← 記事一覧へ

VIDEO · 2026

Jev 徹底解説:データエンジニアのためのシステム1ツール

4 分半の解説動画。Jev は TypeSafe の System One Model。フォワードパス 1 回、token ごとのデコードなし、校正済み確率で判断系の問いに答え、コストは最先端 LLM の約 1/400。

日本語ナレーション · 1080p · 字幕トラック付き · MP4

記事:Jev とは何か――「判断」を1回の関数呼び出しにするシステム1モデル

手元に5000万件の商品レビューがあり、1件ずつ感情を分類して、規約違反がないかも確認したいとします。最先端のLLMで処理すると、API費用だけで数万ドルかかり、数日待たされることもあります。1件ごとに必要なのは短い結論だけなのに、文章をまるごと生成するコストを払っているわけです。

この問題に向けて作られたのがJevです。TypeSafe AI社が2026年9月に正式リリースしたモデルで、創業者のDiogo AlmeidaはOpenAI出身の研究者です。ChatGPTの基盤になったインストラクションフォロー(指示に従わせる学習)の研究に関わっていました。TypeSafe AIはJevを、初めて公開された「システム1モデル」(System One Model)と呼んでいます。文章もコードも書かず、渡した質問に確率付きの判断だけを返すモデルです。メーカーによれば、先ほどの5000万件も約20ドル、数時間で処理できるといいます。

この記事は動画の内容を文章にしたものです。Jevの入力と出力の形、速くて安い理由、訓練の目標である「校正」の意味、データパイプラインでの使い方を順に説明します。最後に限界も整理します。特に、現時点の数値の多くがメーカー公称値である点は押さえておく必要があります。

LLMで構造化された判断をするのは、なぜ大変なのか

LLMはtokenを1つずつ生成します。単純なYes/Noの判断でも、応答を1文字ずつ出力しなければなりません。動画で挙げたレイテンシは1回あたり3秒から30秒で、出力schema(あらかじめ決めた出力の形式)が複雑になるほど長くなります。数百万件の一括処理にはとても耐えられません。

出力された文章は、さらにJSONとしてパースし、検証する必要があります。フォーマットの崩れ、余計なフィールド、モデルが作り出した内容(ハルシネーション)を、追加のコードで防がなければなりません。コストも深刻です。入力も出力もtoken単位で課金されるので、件数が増えると請求額がふくらみます。

「システム1」「システム2」という言葉は、カーネマンの『ファスト&スロー』から来ています。システム1は速い直感的な判断、システム2は遅くじっくり考える推論です。この枠組みで言えば、私たちはシステム2の遅い推論エンジンに、システム1の速い判断をさせてきたことになります。

状態を渡すと、確率付きの3種類の答えが返る

Jevへの入力は会話のメッセージではなく、非構造化の「プログラムの状態」です。テキストでも構造化データでもかまいません。出力は自由なテキストではなく、3種類の決まった形(プリミティブ)だけで、どれにも校正済みの確率が付きます。

1つ目はChoiceです。事前に定義した最大255個の選択肢から1つを選び、各選択肢の確率分布を返します。2つ目はScoreで、「穏やか」「不満」「非常に怒っている」のような順序のある尺度で評価します。3つ目はNoulで、Yes/Noの二値判断に0から1の確率を返します。

たとえば問い合わせのメッセージを状態として渡し、「どのチームが担当するか」(Choice)、「緊急か」(Noul)、「顧客はどのくらい怒っているか」(Score)を同時に尋ねられます。創業者はJevを、最先端の知能を関数として呼び出すものだと説明しています。非構造化の状態を入れると、型の決まった確率的な判断が出てくる。AI版のif文と考えるとイメージしやすいでしょう。

1回のフォワードパスで、速く、形式も崩れない

Jevが速くて安い理由は、1回のフォワードパス(入力から出力まで一度だけ計算すること)で答えを出す点にあります。従来のLLMはtokenを1つずつ自己回帰的にデコードするので、出力が長いほど時間がかかります。Jevは推論の前に出力空間のすべての候補を列挙しておき、1回のフォワードパスで各候補の確率を同時に計算して、最も確率の高いものを返します。

tokenを順に生成するステップがないため、フォーマットの崩れやschema外の出力は構造的に起こりません。メーカー公称のレイテンシは70ミリ秒から500ミリ秒で、最先端LLMの40倍から200倍速いとされています。ただし、独立した第三者による検証はまだありません。内部のアーキテクチャも公開されておらず、外部の推測はどれも確認されていません。

RLCD:確信度と実際の正解率をそろえる

速いだけでは使えません。判断が正確である必要があります。Jevの訓練手法はRLCD(Reinforcement Learning for Calibrated Decisions、校正された判断のための強化学習)です。人間の好みに合わせて回答を最適化するRLHFとも、正解がはっきり決まり自動で検証できる問題を対象にするRLVRとも、目的が違います。

RLCDが目指すのは「校正」です。モデルが示す確信度と、実際の正解率ができるだけ一致するようにします。天気予報にたとえると、「70%の確率で雨」と予報した日を集めたら、そのうち約70%の日に実際に雨が降っている状態です。

確信度が信頼できるなら、そのまましきい値として使えます。一定値以上なら自動で処理し、下回ったら人やもっと高性能なLLMに確認を回す、という設計ができます。

データパイプラインでの使い方

一番わかりやすいのは、map型の一括ラベル付けです。数百万件のレビューや問い合わせチケットに、分類、スコアリング、振り分けをかけます。RAG(検索した文書をLLMに渡して回答させる仕組み)では、検索で取ってきた文書の断片に関連性スコアを付け、LLMのコンテキストに入れる段落を選べます。LLMの出力を点検するガードレールとしても使えます。Noulで、生成内容が規約に沿っているか、ハルシネーションがないかをすばやく判定します。

特に効果が大きいのは、しきい値による振り分けです。確信度0.9以上は自動処理し、それ未満は人やより強いLLMに回します。高価な計算を、本当に判断が難しい一部の件だけに使えます。

料金は、メーカーの発表では入力100万tokenあたり0.042ドル(約4セント)で、出力は無料です。tokenを生成するステップがないので、出力に課金する対象がありません。5000万件で約20ドルという見積もりも、この料金から来ています。公式SDKを使えば3行のコードで動き、導入の手間も小さく抑えられます。現在は早期アクセスの段階で、ウェイティングリストから順に公開されています。

限界:形式が正しくても、判断が正しいとは限らない

まず、TypeSafe(型が保証されている)であることは、判断が正しいことを意味しません。フォーマットは崩れませんが、schemaの中で間違った選択肢を選ぶことは普通にあります。また、自然言語で理由を説明できません。説明可能性や監査対応が求められる場面では、大きな弱点になります。

ベンチマークの数値にも注意が必要です。現時点のベンチマークはすべてメーカー公称値で、独立した第三者の検証はありません。引用するときは必ずその点を添えてください。メーカーの内部評価(4つのワークフロー)では、独立した正解データではなく、GPT-6 AstraとFable 5.1の2モデルの平均的な結果を基準にしています。結果は次のとおりです。

モデル正解率(メーカー公称)
Jev67.8%(1件あたり0.0004ドル、0.4秒)
GPT-5.6 Terra67.9%(1件あたり0.0304ドル、10.1秒)
Claude Sonnet 567.8%
Claude Opus 573.1%
GPT Sol74.1%

この表から読み取れるJevの強みは、速度とコストです。正解率は同クラスのLLMと同程度で、より強いモデルには数ポイント及びません。料金がこのまま続くかも不透明で、メーカー自身が、今の極端に安い価格は補助の段階かもしれないと認めています。さらに、校正の精度は実際に使うデータの分布に左右されます。パイプラインで複数の判断をつなげても、誤りが自動的に打ち消し合うわけではありません。

そのため本番に入れる前には、人が正解を確かめたゴールドデータセットを用意し、正解率、見逃し率、校正の精度を検証してください。どんなモデルでも、盲信は禁物です。

まとめ

JevはLLMを置き換えるものではなく、解決する問題の層が違います。テキスト生成やコーディング、複雑な推論はシステム2の領域で、引き続きLLMの出番です。Jevは判断を、安くて速く、型の保証された関数呼び出しにします。これがシステム1の立ち位置です。

名前の由来は経済学者のジェヴォンズです。ジェヴォンズのパラドックスとは、資源の利用効率が上がると、かえって消費量が増えるという現象です。判断が十分に安くなれば、パイプラインのあらゆる所に判断のロジックを入れるようになるでしょう。これはデータエンジニアリングの自然な流れだと思います。

ただし、この記事で紹介した速度・料金・正解率は、いずれもメーカーの公表資料に基づくもので、独立した検証を待つ段階です。まずはクリティカルではない分類タスクで試し、ゴールドデータセットで校正の精度を確かめてから、規模を広げるか判断するのが安全です。公式の紹介は TypeSafe AI の発表記事 にあります。

ナレーションは本人の声のクローン。画面は概念図です。中国語版は 中文ページ。