Jevとは、TypeSafe AIが公開した、文章ではなく「判断」を決めた形式で返すAIモデルです。判断の材料と質問を渡すと、「どの候補に当たるか」「何段階のどこか」「はいか、いいえか」を、プログラムがそのまま扱える形で返します。同社はこの種類のモデルを「System One Model」と呼んでおり、Jevはその第一弾です。

料金は入力100万トークンあたり0.042ドルで、出力には料金がかかりません。TypeSafe AIの計測では、生成AIより22〜805倍安く、速さも10〜125倍です。問い合わせの分類や、生成AIへ回す依頼の振り分けのように、件数が多く速さが要る判断に向いています。

この記事の内容は、2026年9月26日時点でTypeSafe AIの公式ドキュメントに載っていた情報です。提供状況や料金は変わるため、使い始める前にTypeSafe AIの公式ドキュメントで最新の内容を確かめてください。

Jevとは|TypeSafe AIの「System One Model」第一弾

TypeSafe AIは、Jevを「ソフトウェアがそのまま使える、速くて形の決まった判断を返すモデル」と位置づけています。2026年9月15日に、早期アクセスでの提供が始まりました。

文章を書くAIではなく、判断を返すAI

ChatGPTのような生成AIは、質問に対して文章で答えます。Jevは文章を書きません。そもそも文章を作るようには学習されていないモデルです。

使い方は、判断の材料(state)と質問を渡し、決めた形式で結果を受け取る形です。判断の材料には、文字列・JSON・テキストの配列を渡せます。たとえば問い合わせのメール本文を材料にして、「どの窓口が担当すべきか」を候補の中から選ばせます。

TypeSafe AIが勧める役割分担は、処理の順番や分岐はプログラムが持ち、文章の意味を読み取る判断だけをJevに任せるというものです。生成AIに業務の流れごと任せる作り方とは考え方が違います。

現行モデルと呼び出し方

2026年9月26日時点の現行モデルはJev 1.13です。モデルIDは jev-1.13.0 で、jev-latest と jev-preview という別名もこの版を指しています。呼び出し先は POST /v1/systemone の1つで、リクエストの中でどのモデルを使うかを指定します。

3種類の質問(Choice・Score・Noul)で判断を受け取る

Jevへの質問は、答えの形によって3種類に分かれます。

質問の種類 何を聞くときに使うか 返ってくるもの
Choice 決まった候補の中から1つを選ばせる(担当窓口、文書の種類など) 選ばれた候補、候補ごとの確率(合計で1)、確信度
Score 順番のある2〜10段階のどこに当たるかを採点させる(緊急度、深刻さなど) 段階ごとの確率、確率で重みをつけた平均点、各段階の説明、確信度
Noul はいか、いいえかを答えさせる(返金を求めているか、など) 「はい」である確率を0〜1で表した数字(確信度は無い)

表の返り値のうち確信度(confidence)は、答えにどれだけ迷いがないかを0〜1で表した数字です。読み方には注意が要るため、後の節で説明します。

候補と段階の書き方で精度が変わる

Choiceでは、候補を最大255個まで置けます。候補ごとに説明文を付け、その説明文もモデルが読むため、候補どうしの違いが分かる説明を書くことが精度を左右します。どの候補にも当てはまらない入力に備えて「その他」を用意しておくことも勧められています。

Scoreでは、段階を低い順に言葉で定義します。勧められているのは、「やや深刻」「とても深刻」のような程度ではなく、「回避策がある」「回避策が無く業務が止まる」のような状況を書くことです。程度の言葉は人によって受け取り方が違い、判断がぶれやすくなります。

Noulが返すのは「はい」である確率の数字だけです。何以上を「はい」とみなすかは、使う側がプログラムで決めます。

複数の質問をまとめて投げる

1回のリクエストに複数の質問をまとめて入れられます。質問どうしは互いに影響せず、並行して評価されます。TypeSafe AIは、次の順で組み立てるよう勧めています。

  1. 金額の計算や日付の比較のように、答えが1つに決まる処理はコードで書き、Jevに任せない
  2. 判断の材料を、その判断に関係する情報だけに絞る。関係の無い情報が多いほど精度が落ちる
  3. 質問を細かく分ける。「優先度はどれくらいか」を1問で聞かず、「返金を求めているか」「期限が書かれているか」のように分ける
  4. 分けた質問をまとめて1回で投げる
  5. 「返金を求めていて、期限が近ければ優先」のような結果の組み合わせ方は、コードで決める

Jevに聞くのは意味の判断だけにして、ほかはすべてプログラムに持たせるのが、この作り方の軸です。

Jevの料金と速度

料金と速度は、Jevを選ぶかどうかを決める大きな材料です。公式の数字と、第三者が測った数字を分けて見ます。

料金は生成AIより22〜805倍安い(入力100万トークンあたり0.042ドル)

料金は入力100万トークンあたり0.042ドルで、出力は無料です。1回の入力が1,000トークンなら、100万回呼んで42ドル、1回あたり約0.006円(1ドル150円で換算)です。

生成AIとの差は、Springの公式ブログが紹介したTypeSafe AIの計測に表れています。同社の計測では、Jevは生成AIより22〜805倍安いとされています。

幅が大きいのは、比べる相手の生成AIによって差が変わるためです。14問をまとめて聞く1回の呼び出しでは、Jevが0.000043ドルだったのに対し、軽い生成AIのClaude Haiku 4.5は0.0018ドル(Jevのおよそ40倍)、考えてから答える推論モデルは約0.033ドルでした。軽い生成AIと比べても数十分の1、推論モデルと比べると数百分の1の費用です。

どれもTypeSafe AI自身の計測で、処理の中身によって差は変わります。自社の業務で使うときは、同じ入力を生成AIとJevの両方に流して、費用を見比べてから決めます。

速度は生成AIの10〜125倍

TypeSafe AIによると、Jevの応答にかかる時間は0.07〜0.5秒です。同社の計測では、生成AIが1件の判断を返すあいだに、Jevは10件から多いときで100件以上を返せます。最も差が出た処理では約194倍でしたが、どの処理でも同じだけの差が出るわけではありません。

仮に1件0.3秒かかるとしても、1万件を1件ずつ順番に処理して50分ほどで終わります。

国内では、クラスメソッドの技術ブログが2026年9月17日に検証を公開しています。依頼を4段階に分類する処理で、応答までの時間は中央値0.64〜0.67秒、40件すべてが正しく分類されました。ただし、分類が難しい境目の事例まで含めた評価ではありません。

海外でのJevの使われ方

Jevは2026年9月15日に公開されたばかりですが、海外の開発者の間ではすでに試され始めています。

Javaの開発基盤Springが、問い合わせの振り分けで使い方を紹介

Javaで業務システムを作るときに広く使われるSpringは、2026年9月21日の公式ブログで、Jevを組み込む方法を紹介しました。例に使ったのは、顧客サポートに届いたメッセージ(「助けてください。3日前から入金が失敗し続けています」)を読み、次の3つを同時に判断させる処理です。

  • 緊急度はどれくらいか
  • どの部署が担当すべきか
  • 顧客はどれくらい不満を感じているか

計測では、質問1つで応答までの時間の中央値が0.275秒、質問を3つに増やしても0.31秒でした。質問を増やしても、待ち時間はほとんど延びません。記事を書いたSpringの開発者は、TypeSafe AIの比較の数字は同社自身の計測なので、使う側でも確かめるよう書いています。

海外の事例を日本の業務に当てはめるときの注意

海外の事例は、ほとんどが英語の問い合わせや文書を前提にしています。次の節で触れるとおり、Jevは日本語では精度が下がります。海外の数字は「どんな判断に向くか」の参考にとどめ、精度は自社の日本語のデータで確かめてください。

Jevの注意点|苦手な処理と日本語の精度

TypeSafe AIは、Jevが苦手なことと利用の上限を公開しています。

気をつける点 起きること どうするか
日本語の入力 主に英語で学習しており、精度は英語が最も高い。日本語などでは精度が下がる 自社の日本語データで試し、正答率を確かめてから使う
計算・数え上げ・日付の比較 数字を正確に扱う処理を間違えやすい 計算や比較はプログラムで行い、Jevには意味の判断だけを聞く
二重否定や回りくどい指示 質問の意図を取り違える。書いた言葉を文字どおりに読む 条件をそのまま書く。解釈が要る質問は2問に分ける
判断に関係ない情報が多い入力 精度が落ちる 材料を先に絞り、質問に要る部分だけを送る
画像・音声・動画 入力できない。テキストのみ 先に文字へ起こしてから渡す
1回に送れる量 1リクエスト64kトークンまで。判断の材料と一番長い質問を合わせて32kトークンまで 長い文書は分けて送るか、必要な箇所を抜き出す
呼び出しの回数 1分あたり1,200リクエスト、毎秒25万トークンまで(上限は変わることがある) 件数が多い処理は、上限を超えたときの再試行を組み込む

中でも日本語の精度は、日本企業が使うときに最初に確かめるべき点です。英語で試した評価や海外の事例の数字が、そのまま日本語の業務に当てはまるとは限りません。

「ハルシネーションしない」の意味

Jevは「ハルシネーションしない」と紹介されることがあります。これは、出力が決めた形式から外れないという意味です。候補に無い答えを作ったり、決めた形とは違う文章を返したりはしません。一方で、候補の中から間違ったものを選ぶことはあります。判断を誤らないという意味ではない点に注意してください。

確信度は正答率ではない

確信度は、候補ごとの確率がどれだけ1つに偏っているかから計算した数字です。確信度が0.9でも、その答えが90%の確率で正しいという意味ではありません。

確信度と実際の正答率の関係は、自社のデータで並べて確かめてから、自動で進める境目の値を決めます。扱い方の出発点として、公式は確信度を3つの範囲に分ける形を示しています。

  • 確信度が高いものは、そのまま自動で進める
  • 確信度が中くらいのものは、確認を挟んでから進める
  • 確信度が低いものは、自動では進めず人に回す

社内データを送る前に確かめること

TypeSafe AIは、顧客データを使ってJevを学習させることはないとしています。データを保持しない設定は企業向けに用意されています。ただし、社内のデータを送る前に、TypeSafe AIの利用条件で契約の条件を確かめてください。個人情報や取引先の情報を含む業務では、情報システム部門のセキュリティ審査も通しておきます。

業務のどこにJevを置くか|分類・ルーティング・確認

業務の流れを「読む→分ける→確認する」の3つに分けると、Jevを置くのは「分ける」と「確認する」の2か所です。読む部分、つまり届いたメールや文書から必要な情報を取り出して整える処理は、プログラムや別の仕組みが受け持ちます。

業務の流れの中でJevを置く位置 プログラムが材料を整え、Jevが分けて確認し、確信度に応じてプログラムが自動で進めるか、確認を挟むか、人に回すかを決める。 プログラム・Jevが処理する 人が判断する 1. 読む・整える 2. 分ける 3. 確認する 確信度で道を分ける 自動で進める 確認を挟む 人に回す プログラムが材料を絞る JevがChoiceで分類 JevがNoul・Scoreで点検 境目の値はプログラムが持つ 確信度が高い 確信度が中くらい 確信度が低い
Jevが受け持つのは、分ける工程と確認する工程です。
確信度を見て先の道を決めるのはプログラムの役目です。
迷いの大きい答えだけを人が見ます。

分ける・確認するの具体例

業務の中で、Jevを置きやすい判断には次のようなものがあります。

  • 問い合わせの内容を読んで担当窓口を選び、緊急度を段階で付けて対応の順番を決める
  • 営業への相談や資料請求を読んで、優先して連絡すべきものを選ぶ
  • 社内文書を検索するRAGで、検索で拾った文書のうち質問に関係するものだけに絞る
  • 生成AIが作った回答が、根拠の文書に書かれている内容に沿っているかを確かめる
  • AIの回答を社外へ出す前に、個人情報や不適切な表現が含まれていないかを点検する
  • 依頼の難しさを判定し、高性能な生成AIが必要な依頼だけをそちらへ回す

どれも、件数が多く、1件ごとの判断は短く、答えが候補の中から選べる処理です。反対に、返信文を書く、文書を要約するといった文章を作る処理は、生成AIに任せます。

RAGの検索結果を絞り込む使い方は、検索で関係の薄い文書が混ざって回答がぶれるときの手当てになります。ただし、元の文書に古い情報や矛盾があると、絞り込んでも回答は良くなりません。

コーディングAIで試作する

TypeSafe AIは、Claude CodeやCodexといったコーディングAIに組み込める公式のスキルを公開しています。これを入れると、コーディングAIがJevへの送り方と返ってくるデータの形を把握したうえでコードを書きます。試作の段階なら、コーディングAIに呼び出し部分を頼んで短期間で動く形にできます。

呼び出しの前後の処理、たとえば問い合わせの受信や結果の書き込みは、業務自動化の基盤につなぐ形にすると、既存の業務の流れに組み込みやすくなります。

Jevを業務で小さく試す進め方

Jevが自社の業務で使えるかどうかは、自社のデータで試さないと分かりません。特に日本語の精度は、TypeSafe AI自身も試して確かめるよう勧めています。次の順で進めると、小さな手間で判断できます。

  1. 「問い合わせの担当窓口を選ぶ」のように、答えが候補の中から選べる判断を1つに絞る
  2. 過去の処理済みデータから、正しい答えが分かっているサンプルを100件ほど用意する。すでに人が処理した記録を使えば、正しい答えを新たに考える手間が減る。分類が難しかった例もあえて含める
  3. 同じ100件をJevに判断させ、担当者の判断や今使っている仕組みの結果と見比べる。外れた例は、質問や候補の説明の書き方で直せるものかを見る
  4. 確信度の高い順に並べ、確信度ごとの正答率を見て、どの範囲ならほぼ外れないかを確かめる
  5. ほぼ外れない範囲だけを自動で進め、それ以外は確認を挟むか人に回すと決める

100件は、確信度ごとの正答率の傾向をつかむための目安です。本番で任せる範囲を広げるときは、件数を増やして確かめ直します。試した結果が良くても、本番に移すには運用の担当者や外れたときの戻し方を決める必要があります。

まとめ:Jevは業務の「分ける・確認する」を速く安く受け持つ

  • Jevとは、TypeSafe AIが出したSystem One Modelの第一弾で、文章ではなく判断を決めた形式で返すAIモデル
  • 質問はChoice(候補から選ぶ)、Score(段階で採点する)、Noul(はい・いいえの確率)の3種類で、まとめて1回で投げられる
  • 料金は入力100万トークンあたり0.042ドルで、出力は無料(2026年9月26日時点)
  • 主な学習言語は英語で、日本語では精度が下がる。計算・数え上げ・日付の比較は苦手なので、プログラム側で処理する
  • 「ハルシネーションしない」は形式から外れないという意味で、判断を誤らないという意味ではない
  • 確信度は正答率ではないため、自社のデータで正答率と並べてから、自動で進める範囲を決める

Augueでは、業務の中のどの判断をAIに任せ、どこで人が確認するかを整理したうえで、AIエージェントの設計と開発、試験運用での見極めまでを支援しています。Jevのような新しいモデルを自社の業務で試したい方は、是非ご相談ください。

まずは現状をお聞かせください

弊社では具体的な要件が固まっていない段階でも、無料相談で現状をお聞きしていますので、お困りの際はご相談ください。

無料相談を予約する →

よくある質問

ChatGPTなどの生成AIにJSONで答えさせる方法と、Jevは何が違いますか?

生成AIでも、指定した形式で答えを返させることはできます。違いは、Jevが最初から文章を作らず判断だけを返すように作られている点と、選んだ答えに加えて候補ごとの確率が返る点です。確率があると、迷っている答えだけを人に回す仕組みをプログラムで組めます。一方で、要約や返信文の下書きのように文章そのものが欲しい処理は、生成AIのほうが向いています。

社内で試し始めてから、使うかどうかを決めるまでどれくらいかかりますか?

対象を1つの判断に絞り、過去の処理済みデータから正解つきのサンプルを集められるなら、数週間で見極められる規模です。時間がかかりやすいのは、呼び出す部分を作る作業より、サンプルに正しい答えを付ける作業と、社内データを外部のサービスへ送ってよいかの確認です。この2つを誰がいつまでに終えるかを先に決めておくと、予定がずれにくくなります。

モデルが新しくなると、同じ入力でも結果が変わりますか?

変わる可能性があります。jev-latestのような別名は新しい版が出ると指す先が移るため、手元を何も変えなくても答えが変わることがあります。確信度の境目の値を特定の版で決めた場合は、jev-1.13.0のように版の番号を指定して呼び、新しい版は手元のサンプルで確かめてから切り替えるよう勧めています。

試すのにエンジニアは何人必要ですか?

試す段階なら、APIを呼び出すプログラムを書ける人が1人いれば足ります。コーディングAIを使えば試作はさらに速く進みます。ただし、それとは別に、対象業務を普段処理している担当者の時間が要ります。サンプルの正しい答えを決め、Jevが外した例を見て質問の書き方を直す作業は、業務を知っている人でないと進みません。