BLOG

技術分解 015|Jev:チャットができないモデルと、それを巡る2つの賭け

永亮
JevTypeSafe AIRLCDSystem One模型分类
广告 · Advertisement

技術分解:AI技術フレームワークを解く——説明、分析、技術評価、価値判断、実運用。著者:永亮


9月15日、TypeSafe AIがJevをリリース。18日、TechCrunchは開発者がそれに夢中になっていると報じた。リリース初週、公式サイトはトラフィックで一度ダウンし、Hacker Newsでは400〜500件のコメントがつき、Vercel、Cloudflare、LangChainが続々と統合を発表した。しかし、議論は議論として、それが一体何なのかを明確に説明している記事は少ない——多くの内容が「193倍高速、444倍安価」といった倍数にとどまり、仕組みやパスについては誰も詳しく語っていない。

本記事では、Jevとは何か、なぜ速いのか、それらの倍数をどう読むべきか、4日間で統合側はどのような姿になったか、一般人はどう手を付けるべきか、そして——それを買わないとしても、この考え方をどう自分のシステムに持ち帰るかについて、できるだけ明確に説明する。

一、Jevとは何か:判断のみを出力するマシン

Jevはtransformerアーキテクチャだが、LLMではない。それはテキストを一切生成しない——挨拶も、説明も、コードもない。あなたがテキスト(公式にはstateと呼ばれ、文字列、JSON、テキスト配列などが可能)を与え、あらかじめ定義された質問のセットを添えると、それが返すのは型付きの回答と確率だ。

回答には以下の3つの形状しかない。

  • Noul:是非問答、0から1の確率を返す。「このメッセージは返金を求めているか」→ 0.95。
  • Choice:単一選択問答、選択されたオプションと各候補の確率を返す。「チケットはどのチームに所属するか」→ billing;billing 0.87 / technical 0.13 / sales 0。
  • Score:尺度問答、スコアと各レベルの確率を返す。「顧客はどれほど怒っているか」→ 1.04(0 平静 / 1 怒り / 2 激怒)、各レベルの確率 0 / 0.96 / 0.04。

各回答にはconfidence(信頼度)フィールドも付随する。確率は「このオプションがどれくらい正しい可能性があるか」に答え、信頼度は「モデルが自分自身をどれくらい確信しているか」に答える——この2つのフィールドはどちらもコード内で値を取得でき、これがすべての遊び方の基礎となる。

TypeSafeはJevを新しいカテゴリ「System One」に分類している。この名前はカニマンの『思考、速と慢』におけるシステム1——高速で直感的な判断——に由来する。公式の対外的な定義は意図的に大きく語られている:System Oneモデルはチャット用ではなく、ソフトウェアから呼び出すためのものだ。CEOのDiogo Almeida氏はRLHFとInstructGPTの共同発明者であり、OpenAIの元研究員だ。同社の公式サイトには彼の言葉が掲載されている:「モデルのチャット能力はとっくに人間を超えているが、自動化はどこにある?」彼はOpenAIを離れて2年、より強力なチャットモデルではなく、この判断しかできないマシンを世に送り出した。

訓練方法は公式にはRLCD(Reinforcement Learning for Calibrated Decisions、キャリブレーションされた決定のための強化学習)と呼ばれる。彼らはポストトレーニング技術を3つのルートに分類している:RLHFはモデルを人間が好むチャット相手にする、RLVRはモデルを推論できる問題解決マシンにする、RLCDはただ一件事だけを気にかける——判断を正確に、そして確率を正直にすることだ。キャリブレーションの定義:モデルが0.2と言ったとき、大量の同類の判断の中でそのことが実際に約20%発生する。これは集合属性であり、公式ドキュメントも単回の正しさは保証しないと明記している。

モデル名は19世紀の経済学者ウィリアム・スタンリー・ジェボンズに敬意を表したもの。ジェボンズのパラドックスとは、蒸気機関の効率向上が石炭消費を減らすどころか、石炭を使う場所を想像もつかないほど増やしてしまったという現象を指す。Almeida氏がモデルにこの名前をつけたのは、まさに同じことに賭けているからだ——判断のコストが2桁下がった後、ソフトウェアには現在存在しない何千もの判断ポイントが出現するだろう。これはビジネス的な物語であり、まずはこれを覚えておこう。

会社レベルでさらに2点補足する。9月15日のステルス解除と同時に4000万ドルのシードラウンドを発表し、DCVCが主導した。Forbesは同日の報道で、同社を2億ドルのスタートアップと直接呼んだ。CTOのErik Gafni氏は連続起業家、COOのSasha Sheng氏はMeta FAIR出身だ。リリース週は需要が高すぎてAPIが一度耐えられなくなり、TechCrunchの見出しには「開発者を狂わせている」といった言葉が現れた——感情はすでに最高潮に達しているので、後の数字はすべて分解して見る必要がある。まずは仕組み、次に数字だ。

二、なぜ速いのか:並列サンプラーと「出力無料」

Jevの速さはオカルトによるものではない。公式ブログはアーキテクチャレベルでの2つのことを明らかにしている。

1つ目は並列サンプリングだ。LLMは直列生成である:トークンを1つずつ吐き出し、それぞれが前のトークンに依存するため、300トークン生成すれば300ステップかかり、エンドツーエンドの応答時間は秒単位になる——公式ブログにある最先端モデルの区間は3〜329秒だ。Jevは文字列生成を放棄した後、サンプラーを並列に切り替えた:1回のクエリですべての回答を同時に計算する。公式の言葉では「ハードウェアを意識した並列サンプラー」だ。さらに、すべての質問が同じstateに対して並列評価されるため、1回の呼び出しで50の質問をしても5つの質問をしても所要時間はほぼ同じだ。

2つ目は課金構造だ。入力は100万トークンあたり0.042ドル、出力は無料——公式の言葉では「too cheap to meter(計測する価値がないほど安い)」。出力は数十の構造化された確率値だけなので、コストは確かにゼロに近い。対照的に、主流のLLMは入力が100万トークンあたり0.2〜10ドル、出力はさらに約5倍高い。

この2つを合わせると、Jevのコストモデルは明確になる:あなたは「読ませる」ことにお金を払い、「答えさせる」ことには払わない。公式のエンドツーエンドレイテンシ区間は70〜500ミリ秒、同一タスクにおける最先端LLMとの高速化は40〜200倍だ。現在のオンラインバージョンはjev-1.13.0で、APIはjev-latestとjev-previewの2つのエイリアスを提供しており、バージョンに応じてローリング更新される——公式ドキュメントは本番環境ではバージョン番号を固定し、エイリアスを追わないよう明確に推奨している。高頻度の小さな判断——各コメント、各チケット、各ツール呼び出し——において、この価格構造はあらゆるベンチマークよりも問題をよく説明している。

三、倍数の読み解き方:数字の修辞学と数字の数学

まず公式の見解をすべて並べる:プレスリリースはレイテンシが100ミリ秒未満と書いている。リリース資料は70〜500ミリ秒。公式サイトのトップページは比較モデルより193.6倍高速、444.6倍安価と主張している。公式ブログの控えめなバージョンは「40〜200倍高速」だ。

これらの数字を読むには2つの層に分ける必要がある。修辞学の層:193.6と444.6という小数点まで正確な数字は、企業が発表した自己評価レポートに由来する。4つの比較ワークフローは自社の能力チームが設計したもので、公式の技術説明でも高めに設定されている可能性が高く、結果は真の分布の高値側にある可能性が高いと認めている。ベンチマークに標準答えはなく、対照群は2つの外部大規模モデルの平均確率をラッピングしたバージョンだ。TechStock²の核查は率直に述べている:これらの数字はマーケティングの上限として読むべきで、中央値ではない。四捨五入されていないように見える数字ほど、それがどう計算されたのか問う必要がある——この習慣はすべてのベンダーのベンチマークに適用され、TypeSafeに限らない。

数学の層:倍数をすべて半分にしてさらに割り引いたとしても、「出力無料、入力は億トークン単位で課金、直列生成なし」という構造的差異は、高頻度判断シーンのコストが「LLMが数百トークンを生成してJSONを解析する」よりも天然と1〜2桁低いことを決定づけている。これはいかなるベンチマークにも依存せず、課金の算術だ。

第三者の信号も入ってきている。VercelのエンジニアはTechCrunchに対し、会社のコマンド安全性を審査する分類器をOpenAIからJevに切り替えた後、速度が5〜18倍になり、正確率も高くなったと語った。Bryo AIのCTOはJevとGeminiでメール分類を比較した:Geminiの正確率はやや高いが、コストは10〜20倍高い。本当に彼を心を動かしたのは、Jevだけが真の確率を返せることだった。Piの作者Armin Ronacherの評価が最も冷静だ:ハルシネーションは消えたのではなく、呼び出し側がプログラムで処理できるデータになった——50%の確率はコイントス、95%なら自動実行だ。彼は非常に価値のある方向性も指摘している:Jevを使ってエージェントの行動を監視したり、モデルルーティングを行ったりすること。これらはLLMでやると高すぎるが、この価格なら成立する。

最後に公式自身の率直さを見よう。TypeSafeは「Jaggedness(凹凸)」ドキュメントを維持しており、jev-1.13の9つの既知の弱点を自発的にリストしている:質問を逐語的に読む(書かれた通りに答え、意図を汲まない);カウントは信頼できない(答えの形を認識し、本当に数えているわけではない);日付比較、マルチホップ推論はやや弱い;大きなstateに無関係な詳細を詰め込むと判断が希釈される;敵対的な内容や矛盾した基準はエラーになる;生成や説明が必要なタスクは、公式が生成モデルへの切り替えを直接推奨している。中国語入力はサポートされているが、公式は正確率が英語より低いことを明示している。9月20日時点でモデルはアーリーアクセス制であり、資金調達の発表は収益と顧客数を開示していない。

四、4日間で、統合側はどのような姿になったか

今回のリリースで最も見るべきは、統合側の追従速度で、「需要が本物である」という判断を裏付けていると言える。

公式チャネル以外に、統合側は3日以内で3大クラウドと主流フレームワークを揃えた:Vercelのエンジニアが置き換え事例を公開した;Cloudflareはtypesafe/jevを自社のAIモデルカタログに収録し、Workers AIで一行env.AI.runを呼び出せるようにした;LangChain公式は17日にブログを投稿し、タイトルは『Jevでハーネスを構築する』で、Jevをエージェントループに組み込んで行動評価を行っている——エージェントが決定を行うたびにモデル呼び出しが必要になり、高すぎるが、Jevを監視レイヤーに使えばコストが成立する。OpenRouterも同時に公開され、ウェイティングリストがない開発者はここからアクセスできる。

オープンソースコミュニティはより直接的だ:Claude Codeプラグインのfast-jev-compactionが9月17日に作成され、Jevを使って各ツール呼び出しと結果にスコアを付け、コンテキストの去留を決定し、4日で4340スターに急上昇した。中国語コミュニティの反応速度も遅くない:GitHubにNanmiCoder/jev-arenaが登場した。これは「Jev対DeepSeek」のコメントラベリング対決場で、1万件のCSVをインポートし、両方を同時に実行すると、左側のJevの処理プログレスバーが右側のdeepseek-flashを肉眼でわかるほど引き離し、走り終わると二重のレポートをエクスポートして再生できる——これが現在の中国語圏で最も直感的なJev実測素材であり、すべてのデータとレポートが公開され検証可能だ。

Jevに関する議論の熱度はすでに十分だが、欠けているのは通じる導入パスだ。したがって、次のパートではパスについて専門的に語る。

五、どう参加するか:4つのルート、ハードルの低い順

1つ目、ゼロハードルで観察する:GitHubからNanmiCoder/jev-arenaをプルし、ローカルで実行する。デモデータを使って、同じ1万件のコメントにおけるJevとdeepseek-flashの速度差を確認する。再生は1セントもかからず、キーも不要だ。このステップはタダだが、価値がある——まず自分の目でギャップが本当に存在するかを確認しよう。

2つ目、低コストで試す:JevのDecisionsは独立したプロトコルであり、Chat Completionsではないが、OpenRouterはすでにラッピング済みだ。OpenRouterのキーを申請すればtypesafe/jev-1.13を呼び出せる。jev-arenaはデフォルトでこのルートを行く。vibe codingのチュートリアルは中国語コミュニティで既に育ち始めており、それに従って分類シーンを完了させると、コストは数セント程度だ。

3つ目、本番投入前の評価:候補シーンがWorkers上で動いている場合、Cloudflareの統合が最短ルートだ。Pythonまたはエージェントフレームワークの場合、LangChainのlangchain-typesafeがTypeSafeClassifierをラッピングしており、stateとquestionsをinvoke()に渡して分類結果を取得できる。公式SDKはpip install typesafe-sdkでインストールし、環境変数TYPESAFE_API_KEYを設定する。デフォルトのモデルエイリアスはjev-latestだ。クォータに注意:現在のバージョンは25万トークン/秒、1200回/分に制限されており、単一リクエストは64kトークン、stateと最長の質問の合計は32kを超えられない。クォータは動的であり、統合前にドキュメントを一見しよう。

4つ目、正面玄関から:typesafe.ai公式サイトでウェイティングリストに申請する。アーリーアクセス期間中、モデルはすべてのアカウントで同じ重みを使用しており、公式は顧客ごとの微調整を行わず、ユーザーデータを訓練に使用しないことを約束している。エンタープライズ版ではゼロデータ保持の交渉が可能だ。

計算してみるとより直感的だ。1万件のコメントラベリング、平均300トークンのコンテキスト、合計300万トークン。Jevの入力価格では0.126ドル、出力は無料。同じ量を、出力価格が入力価格の5倍で、各件で数十トークンを生成する必要がある主流LLMに任せると、請求額は1〜2桁高くなり、レイテンシはミリ秒から秒になり、解析失敗のために再試行の予約も必要になる。jev-arenaの対決場はこれを可視化している:左側のJevのプログレスバーが走り終わったとき、右側のdeepseek-flashはまだ端数を処理しているに過ぎない——単回の実行は統計的結論を代表しないが、計算は自分でできる。4つのルートは4つの目的に対応する:野次馬、真偽検証、統合、協力交渉。いきなり4番目から行かないこと。

六、この考え方を持ち帰る:判断と生成の分離

Jevそのものを当面使わないとしても、このアーキテクチャの考え方は自分のLLMアプリケーションに分解して持ち帰る価値がある。なぜなら、本質的にはインターフェース設計の問題だからだ。

低コスト版Jevのアプローチ:既存のLLMを使い続けるが、判断系の呼び出しを「自由生成+JSON解析」から「制限出力+確率キャリブレーション」に変更する。具体的な例:チケットが緊急かどうかを判断する際、モデルにJSONを出力させて解析させるのではなく、出力空間を「緊急/緊急でない」の2つのトークンの二択に圧縮し、最初のトークンのlogprobを確率として取得し、自分で蓄積した過去のチケットで2週間走らせて、キャリブレーション回帰(isotonicまたはPlatt)を行う——。形状はすぐに安定し、解析再試行は消失し、確率も見られるようになる。コストはあまり下がらないかもしれないが、インターフェースの信頼性は確実に向上し、このステップは今日から実行でき、新しいサプライヤーは不要だ。

進化版は蒸留だ。公式のcookbooks自体にこの考え方がある:Jevのオプションと確率を教師信号として使い、古典的な分類器または小さなモデルを訓練し、コストをさらに1〜2桁削減し、レイテンシを10ミリ秒以内に圧縮する。判断タスクのデータ分布が一度安定すると、このルートはほぼ必然的な終着点だ。

より深い啓発はAlmeida氏のあの問いかけだ:「モデルのチャット能力はとっくに人間を超えているが、自動化はどこにある?」彼が賭けた答えはこうだ:自動化が詰まっているのはモデルが十分賢くないからではなく、判断がソフトウェアのプリミティブになっていないからだ。コードは型、確率、決定論的レイテンシを必要とし、チャットモデルが与えるのは文字列だ。Jevは「判断」を生成から切り離して第一級市民にした。この賭けが最終的にどれくらい実現するかに関わらず、「インターフェースの形状でモデルを選ぶ」という考え方は、今後2年のAIエンジニアリングの主流の一つになる可能性が高い。

結論

Jevは真剣に見る価値があるが、鵜呑みにする価値はない。そのリアルな部分:アーキテクチャレベルで直列生成を放棄し、桁違いのレイテンシとコストの利点を交換したこと。判断+キャリブレーション確率のインターフェースは自動化にとって本当に有用であること。統合側の追従速度——3大クラウド、主流フレームワーク、オープンソースプラグイン、中国語コミュニティの実測ツールが4日以内にすべて揃ったこと——は需要が本物であることを裏付けている。割り引くべき部分:公式サイトの小数点まで正確な倍数はすべて自社測定であり、モデルはまだアーリーアクセスで、9つの弱点はどれも痛いところを突いており、中国語シーンでは公式自身が弱いと言っており、キャリブレーションは集合属性であり単件の保証ではない。参加する価値があるかどうかは、あなたのシステムにどれくらいの判断がチャットモデルによって高価に無理やりこなされているかに依存する。自分の本番環境でのLLM呼び出しリストを監査し、「実は判断を求めている」呼び出しをピックアップしよう——最終的にJevを選ぶかどうかにかかわらず、このリスト自体がこの記事の最も価値ある産物だ。


参考来源

  1. TypeSafe 公式ブログ:Introducing System One Models & Jev(2026-09-15、Diogo Almeida氏直筆)
  2. TypeSafe 公式ドキュメント:System One、Noul、Composite Scoring、Jaggedness(jev-1.13)、Models、FAQ、Legal
  3. TypeSafe AI チームページとマニフェスト(typesafe.ai)
  4. Business Wire:TypeSafe AI Emerges from Stealth(2026-09-15)
  5. TechCrunch:A new kind of AI model from a ChatGPT inventor is driving developers wild(2026-09-18)
  6. The Register:TypeSafe debuts Jev(2026-09-16)
  7. TechStock²:TypeSafe’s 193.6× / 444.6× claims(2026-09-17)
  8. LangChain 公式ブログ:Building a Harness with Jev(2026-09-17)
  9. Cloudflare AI モデルドキュメント:typesafe/jev
  10. GitHub:joelhooks/fast-jev-compaction(Claude Codeプラグイン、09-20データ 4340★);NanmiCoder/jev-arena(Jev対DeepSeekコメントラベリング対決場)
  11. OpenRouter モデルページ:typesafe/jev.
广告 · Advertisement

よくある質問

JevとLLMの本質的な違いは何ですか?

LLMはトークンごとに自由テキストを直列生成しますが、Jevは並列サンプラーを用いて1回の呼び出しですべての候補回答を同時に評価し、固定型の確率回答のみを出力します。入力は100万トークンあたり0.042ドル、出力は無料、エンドツーエンドのレイテンシは70〜500ミリ秒で、高頻度の判断シーンに適しています。

公式が主張する193.6倍高速、444.6倍安価という数字は信頼できますか?

これら2つの数字は企業の自己評価レポートに由来し、公式も高めに設定されていることを認めています。第三者による実測では5〜18倍の高速化、Geminiより10〜20倍安価だが精度はやや劣る結果が出ています。より堅実な予想区間は10〜50倍高速、1〜2桁安価です。

一般の開発者は今、Jevにどうやって手を付ければよいですか?

ハードル別に4つのルートがあります:GitHub上のjev-arena対決場をローカルで実行して実測を観察する;OpenRouterのキーを申請してtypesafe/jev-1.13を呼び出す;Cloudflare Workers AIでenv.AI.runを使って統合する;typesafe.ai公式サイトでウェイティングリストに登録する。