TypeSafe AIの特化型意思決定モデルJevは、大規模なAIモデルの前段に高速な判断モデルを置く実用的な選択肢を示しています。受信メール100通を仕分けるテストでは、Jevは23.00秒で処理を終え、費用は$0.00196でした。Claude Fable 5.1は218.05秒、$0.14811かかり、100通のうち89通をJevと同じカテゴリーに分類しました。この結果から、各メールについてどちらのモデルが正しかったかは分かりません。ただ、素早い分類と、より費用のかかる回答文の作成を分ける理由は見えてきます。

高さの異なる3本の棒グラフ。最も高い棒の横にストップウォッチ、最も低い棒の横に硬貨

▲ 処理時間と費用の差

この役割分担がモデルルーティングの要点です。リクエストを送る前に、どのモデルに処理させるかを選びます。Claude Codeでは、Jevが最初の選択を担い、より深い推論や文章での回答が必要な作業にはClaudeを使えます。ルーティングの判断自体にも費用がかかるため、ワークフロー全体で追加費用を上回る節約ができるかが重要です。

選択肢が限られた判断のためのモデル

TypeSafe AIがJev向けに設計した出力は3種類です。はい・いいえ、提示されたリストから1つの選択、または2~10段階の尺度による評価です。どの回答にも確信度がパーセンテージで付きます。そのためJevは、メールのカテゴリーやプログラミングの依頼を渡すモデルの選択には向いていますが、メールの文面やプログラムを書く用途には向いていません。

ワークフローでは確信度を基に、判断をClaudeへ回すかどうかを決められます。スキルのルーティング設定の一例では、確信度が60%未満の判断を上位に回します。このしきい値はワークフロー上の選択であり、それ以上の確信度なら必ず正しいという保証ではありません。Jevに自由形式の文章作成、要約、数学的な計算、暦の日付の比較、他のモデルの回答の品質評価を任せるべきではありません。送金を自律的に実行させるべきでもありません。

実測された処理時間と費用

メール100通のテストでは、ホットリード、ウォームリード、コールドリード、リードではない、の4カテゴリーを使いました。実測した時間と費用は次の通りです。

モデル メール100通の処理時間 合計費用
Jev 23.00秒 $0.00196
Claude Haiku 4.5 74.65秒 $0.01959
Claude Fable 5.1 218.05秒 $0.14811

多数の空白のメッセージ吹き出しが漏斗を通り、色分けされた少数のグループに分かれる

▲ メールのカテゴリー分類

JevとClaude Fable 5.1の分類が89通で一致したという数字は、両者の判断の一致を示すものであり、正解を確認した基準に照らした精度ではありません。分類結果が重要な行動につながる場合、この違いは大きな意味を持ちます。チームは自らの基準に照らして一部を確認し、不確かな事例や影響の大きい事例を、より高性能なモデルや人に回せます。

ほかのテストからも、同じ役割分担が有効な場面と、注意が必要な場面が見えてきます。

  • プログラミングの依頼: Jevは12件のリクエストを、Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5、Claude Fable 5.1に振り分けました。うち10件では最上位モデルを使わずに済みました。振り分けた場合の費用は$0.506で、すべてをClaude Fable 5.1で処理した場合の$1.380を下回りました。どの階層のモデルを選ぶかという判断は約80%のケースで最適とされましたが、2件ではOpusのほうが適していたにもかかわらず、JevはHaikuを選びました。
  • 定型的な確認: 5種類のタスクにわたる150件の「はい・いいえ」の判断では、Jevの判断1件当たりのレイテンシー中央値は219ミリ秒で、合計費用は$0.0019でした。タスクには、スパムの判定、請求書の確認、コミュニティルールへの適合確認、返金対象かどうかの判断、顧客離反の兆候の判定が含まれます。
  • コメントの仕分け: Jevは312件のYouTubeコメントについて、それぞれ7つの問いを評価し、計2,184件の判断を下しました。処理時間は72.5秒、費用は$0.0106でした。同じ作業をClaude Fable 5.1で行った場合の費用$3.48は推計値であり、実測した請求額ではありません。Jevは返信が必要なコメント155件、コンテンツのアイデアを含むコメント28件、購入意向を示すコメント97件、スパム5件を特定しました。

コメントのテストでは、Jevのカテゴリー判定は大規模なモデルと90~96%の割合で一致し、スパム判定の一致率は98~100%でした。メールの場合と同様に、判定の一致は、独立に検証された正解データの代わりにはなりません。

Jevを使いすぎずに費用を抑えるには

2026年9月時点でOpenRouterに掲載されていたJevの料金は、入力100万トークン当たり$0.042、出力100万トークン当たり$0.00でした。トークンはモデルの入力や出力を測る単位です。一般的なルーティング判断1件の費用は約$0.00002と見積もられています。この料金なら小さな判断を繰り返しても費用は抑えられますが、プログラミングのテストが示すように、必要な場面では十分な能力を持つモデルを選ばなければなりません。

Claude Codeとの連携にはjev-decisionsパッケージを使います。説明されている設定手順は、APIキーを取得し、node scripts/selftest.mjsで認証情報とレイテンシーを確認し、settings.jsonを通じてフックを接続した後、環境を再起動するというものです。/jev onと/jev offのコマンドでルーティングを切り替え、/jev statusで分類、レイテンシー、確信度、累積費用を確認できます。これらの数値を使えば、請求額が下がったかどうかだけでなく、ルーターが何をしているかも点検できます。

データの扱いにも境界があります。標準アカウントには、SOC 2、ISO、GDPRへの準拠に関する明示的な保証がなく、ゼロデータ保持はエンタープライズアカウントに限られます。機微性の高い顧客名、認証情報、社外秘の財務記録を標準アカウントに通すべきではありません。Jevが役立つ範囲は、読み取れる入力にも左右されます。別のファイル検索テストでは、画像のピクセルではなく、説明文、フォルダー名、ファイルパスを使って一致するものを見つけました。そのため、ラベル付けが不十分な画像には向いていないでしょう。

実務上の要点

Jevが最も役立つのは、最初の限られた判断を担う使い方でしょう。分類、選択、評価を行って確信度を確認し、文章作成や難しい推論は適したモデルに回します。まずは繰り返し発生する低リスクの判断から始め、ワークフロー全体の費用を測り、自ら用意した正解データと分類結果を照らし合わせることが重要です。不確かな判断には代替手段を用意し、標準アカウントでは機密データを扱わないようにします。メール100通の結果は節約の可能性を示す一方、ルーティングの誤りと正解が未検証であることは、運用上の監督が引き続き必要であることを示しています。