← トップに戻る ローカルLLMで足りる仕事、Claude Codeに任せる仕事 表紙

ローカルLLMで足りる仕事、Claude Codeに任せる仕事

判定AI「Jev」流に振り分ける、AIエージェントの実測と設計

依頼の96%はローカルに回せなかった。1ステップずつに下ろすと、半分が回せた

ローカルLLMに回せば安く安全になるはずが、自分の依頼を数えたら96%は回せなかった。Claude Code の作業を1ステップずつに下ろし、ルールと確率で振り分けた実測の記録です。

ローカルLLMシリーズの【振り分け・設計編】何を手元に任せるかを決める側
Kindleで読む 無料で試し読み

Zenn累計32,000+ views · 4言語で30冊以上出版 · Kindle 6カ国で販売中

¥1,500 Kindle Unlimited 読み放題対象 公開:
ken imoto
ken imoto / Practical Claude Code・Harness Engineeringシリーズ著者。4言語で30冊以上の技術書を出版。 · Amazonの方針で購入後7日以内なら返品可
他の言語版: English

本書の概要

Claude CodeとローカルLLMの併用を実測。依頼単位では96%回せず、1ステップずつなら半分。Ollamaの振り分け・機密の門番・しきい値を扱う本。

この本でできるようになること

対象読者

この本で解決できる悩み

この本の立ち位置

なぜこの本か

他のAI本との違い

比較対象 本書の違い
ローカルLLMの入門書・環境構築書 入門書は動かすところまで。本書は動かしたあと、Claude Code の作業のどこをローカルに任せるかを実測で決める
Jev の公式ドキュメント・紹介記事 公式は Jev の API の使い方。本書は同じ型と確率の判定をローカルLLMで作り、公式の数字とその留保を読み直す
LLMルーティングの論文 (RouteLLM など) 論文は公開ベンチマークでの依頼単位の振り分け。本書は自分の依頼とステップで測り、ステップ単位のルールと確率を組み合わせる

目次

導入: 門番がパスワードを通した

ローカルLLMの判定を、確率として読み、そのまま信じない

  1. はじめに
    • この本が扱うこと
    • この本が扱わないこと
    • 対象読者
    • 測った環境
    • 読み方
    • 賞味期限について
  2. 序章 本番DBのパスワード入りのメモを、AIは69%の自信で「問題なし」と判定した
    • 機密を外に出さないための門番だったはずが
    • 並び順は完璧だった
    • 確率をそのまま信じない
    • この本で測ったもの
    • 本書の地図
ここまで読んでみたい → Kindleで続きを読む

第1部 何をローカルに任せるか

依頼単位ではほぼ回せず、ステップ単位なら半分が回せる

  1. 01 第1章 私の依頼の96%はローカルに回せなかった
    • 1-1 何を測ろうとしていたか
    • 1-2 100件の作り方
    • 1-3 結果
    • 1-4 生の指示でも同じだった
    • 1-5 なぜこうなったのか
    • 1-6 機密の4件はどうだったか
    • 1-7 依頼単位の振り分けは、材料を持っていない
  2. 02 第2章 ステップに下ろすと半分が回せる
    • 2-1 ステップを数える
    • 2-2 結果: 200件中97件がローカルで足りる
    • 2-3 定型プロンプトは例外だった
    • 2-4 Claude Code は、すでにステップを振り分けている
    • 2-5 LLMが要らないステップもある
    • 2-6 あなたのログを数える
  3. 03 第3章 決まる部分はルールで、残りだけ確率で
    • 3-1 確率で聞いた振り分け器
    • 3-2 結果
    • 3-3 確率は何を当てていたのか
    • 3-4 決まる部分はルールで
    • 3-5 機密の門番も同じ形になる
    • 3-6 私の3層
ここまで読んでみたい → Kindleで続きを読む

第2部 判定だけを返すAI

型と確率で答える Jev の考え方と、そのオープン実装

  1. 04 第4章 Jevは何を変えたのか: 型と確率で答える
    • 4-1 文章を返さず、型と確率を返す
    • 4-2 公式の数字と、公式自身の留保
    • 4-3 安いモデルと比べ直すと
    • 4-4 LLMでも同じことはできる
    • 4-5 Jev の公式パターンも「決まる部分はルールで」だった
    • 4-6 本書での Jev の位置
  2. 05 第5章 公開2週間で24実装: オープン実装と独立検証の読み方
    • 5-1 Jev の中身は公開されていない
    • 5-2 24本は、3つの作り方に分かれる
    • 5-3 rizzo-flow を RTX 4070 で動かす
    • 5-4 独立検証の数字を読む
    • 5-5 独立検証から持ち帰るもの
ここまで読んでみたい → Kindleで続きを読む

第3部 ローカルで確率を取り出す

logprobs、モデルの大きさ、しきい値の決め方

  1. 06 第6章 logprobsの取り出し方と、黙って消える3つの罠
    • 6-1 logprobs とは何か
    • 6-2 1文字で答えさせ、その1文字の確率を読む
    • 6-3 罠1: OpenAI 互換の API では、確率が黙って消える
    • 6-4 罠2: 考えるモデルは、最初のトークンで答えない
    • 6-5 罠3: 候補が上位20件に入らないと、確率は0に見える
    • 6-6 ほかのランタイムでも考え方は同じ
    • 6-7 確率は確信の度合いで、正しさではない
    • 6-8 最初の1問で確かめること
  2. 07 第7章 何Bあれば足りるか
    • 7-1 同じ60件、同じ質問で、モデルだけを替える
    • 7-2 読み取れること
    • 7-3 判定の中身が変わると、順位も変わる
    • 7-4 私の選び方
  3. 08 第8章 しきい値は0.5とは限らない
    • 8-1 並び順と目盛りは、別の性質
    • 8-2 線の位置は、何を一番避けたいかで決まる
    • 8-3 線の引き方: 見逃しを0にする一番高い線
    • 8-4 見逃し0の線でも、新しい機密は漏れる
    • 8-5 余裕を持たせる
    • 8-6 集めるべきは、件数より機密の数
    • 8-7 ワークシート: 線を引く
ここまで読んでみたい → Kindleで続きを読む

第4部 機密を外に出さない

正規表現とモデルの分担、そして自分にとっての機密

  1. 09 第9章 名札を付けて歩いてくる秘密は正規表現で止める
    • 9-1 形の決まった秘密は、名札を付けて歩いてくる
    • 9-2 最初の実験では、名札が読めなかった
    • 9-3 gitleaks が止めたもの、止めなかったもの
    • 9-4 日本の個人情報を、形と検算で拾う
    • 9-5 誤検知は、名札の偽物から来る
    • 9-6 この章で持ち帰るもの
  2. 10 第10章 モデルは定義に書いたものしか止めない
    • 10-1 正規表現の漏れを、モデルで拾う
    • 10-2 モデル単体で見逃し0を狙うと
    • 10-3 本物の機密は、評価セットの機密と違った
    • 10-4 定義を、自分の機密に書き換える
    • 10-5 名札のない機密は、モデル単体では守れない
    • 10-6 あなたの機密を書き出す
ここまで読んでみたい → Kindleで続きを読む

第5部 振り分けた後、どう戻すか

戻り値の設計と運用、そして最後に残った設計図

  1. 11 第11章 無料のexecutorが一番高くついた
    • 11-1 実験: 強いモデルが段取り、安いモデルが手を動かす
    • 11-2 結果: 無料の作業役を足した構成が、どのタスクでも一番高い
    • 11-3 なぜ無料が一番高いのか
    • 11-4 Claude Code で追試する
    • 11-5 戻り値は、振り分けの一部
  2. 12 第12章 戻り値を型で返す
    • 12-1 3つの返し方を比べる
    • 12-2 結果: 短いタスクでは効き、長いタスクでは効かない
    • 12-3 型には「何をしたか」が入っていなかった
    • 12-4 何を返させるか
  3. 13 第13章 運用: 同居と待ち時間と、線の引き直し
    • 13-1 GPU は1枚しかない
    • 13-2 タイムアウトは起きるものとして書く
    • 13-3 後片付けをしないローカルの作業者
    • 13-4 定義を変えたら、線を引き直す
    • 13-5 記録しておくもの
    • 13-6 運用のチェックリスト
  4. 14 第14章 最後に残った設計図
    • 14-1 最初の設計図と、最後の設計図
    • 14-2 流れ
    • 14-3 入口の門番
    • 14-4 分ける
    • 14-5 種類のルール
    • 14-6 確率の判定
    • 14-7 実行
    • 14-8 戻り値
    • 14-9 設定ファイルにすると
    • 14-10 あなたの環境に移す順番
ここまで読んでみたい → Kindleで続きを読む

終章

賞味期限と次の一手

  1. 終章 賞味期限と次の一手
    • 残るもの
    • 変わるもの
    • 次の一手
ここまで読んでみたい → Kindleで続きを読む

依頼を丸ごとローカルLLMに回そうとすると、ほとんど何も回せません。私の依頼を100件数えたら、96件がフロンティア行きでした。ところが Claude Code の作業を1ステップずつに下ろして数え直すと、200件のうち97件がローカルで足りました。

本書は、その振り分けを RTX 4070 1枚で組み立てた記録です。ステップの種類で決まる部分はルールで決め、残りだけローカルLLMの確率で決めます。機密は依頼を渡す前の入口で止め、ローカルに回した作業の結果は型で返させます。最後の第14章に、そのまま持ち帰れる設計図と設定ファイルの例をまとめました。

まとめ読み

ローカルLLMの本は、いま3冊あります。

読む順番を見る

関連記事で深掘りする

よくある質問

「ローカルLLMで足りる仕事、Claude Codeに任せる仕事」はどんな本ですか?
Claude Code に頼む作業を、手元のローカルLLMとクラウドのフロンティアモデルにどう振り分けるかを、自分の依頼とステップ550件、RTX 4070 1枚で測った本です。依頼を丸ごと振り分けると96%がフロンティア行きでしたが、1ステップずつに下ろすと半分がローカルで足りました。ルールで決まる部分はルールで、残りだけローカルLLMの確率で決め、機密は入口で止め、戻り値は型で返す設計を、全14章と序章・終章でまとめています。
Jev を使う本ですか?
Jev (TypeSafe の判定AI) の API は使いません。Jev と同じく「文章を返さず、型と確率で答える」判定を、Ollama の logprobs を使って手元のローカルLLMで作ります。Jev そのものの考え方と、公式の数字の読み方、24本のオープン実装は第2部で扱います。
どんな環境が必要ですか?
著者の環境は RTX 4070 (12GB) 1枚と Ollama です。判定役は qwen3.5:4b で足り、12GB あれば動きます。数字は著者の依頼から出たものなので、各章の手順で自分のデータに合わせて測り直す前提で書いています。
コードは公開されていますか?
入口の門番 (正規表現と日本の個人情報ルール)、ローカルLLMの判定、しきい値を引く道具、ステップの振り分け、戻り値の型、架空の値で作った評価セットを、GitHub の local-step-router (MIT ライセンス) で公開しています。
どこで購入できますか?
Kindle 版 (Amazon、1,500円) のみです。KDP セレクトに登録しているので、Kindle Unlimited の読み放題対象です。

Kindleで読む

Kindle Unlimited 対象

Kindleで読む (¥1,500)
トピック: ローカルLLMClaude CodeAIエージェントOllamaJev