約1,500通の実メールをJevに渡したら、何が起きるのか。
開発者Ryan Vogel氏が、 TypeSafe AIのJevを自身のメールボックスで試した公開デモが注目を集めています。
今回は「速かった」という話だけではなく、 何を判断したのか、何が確認できて、何がまだ証明されていないのか まで整理します。
本記事はRyan Vogel氏が公開した実験・動画、 およびGreg Isenberg氏の番組で公開されたRyan氏本人の解説をもとに、 OmochiXが仕組みと業務への応用を分析したものです。 数値は公開者本人の環境・報告に基づくもので、 OmochiX独自の性能検証結果ではありません。
Ryan Vogel氏がJevを約1,500通のメールでテスト
Ryan Vogel氏はJevの公開直後、 自身の約1,500通のメールを使った分類テスト を公開しました。
単なるサンプル文章ではなく、 本人のメールボックスから取り出した実際のメールを使っている点が特徴です。
Ryan氏はGreg Isenberg氏のYouTube番組 「Startup Ideas Pod」にも出演し、 Jevが従来の生成AIとどう違うのか、 どのような業務で使えるのかを解説しています。
Ryan Vogel氏本人が「Jevの使い方」を解説
Greg Isenberg氏との対談では、 Jevを単なるチャットAIとしてではなく、 メール、問い合わせ、Lead、申請など 大量の判断が並んでいる業務の前段に置くモデル として紹介しています。
出典:Greg Isenberg / Startup Ideas Pod 「Jev is HERE. How to use it」
Ryan氏自身のデモでは、 まず100通を8つのworkerで処理。
画面上では平均約200ms、 P95約240ms、 約38メール/秒という処理速度が表示されています。
その後、 同じ仕組みを1,000通規模へ拡大して処理しています。
1通のメールに対して4つの判断
この実験で重要なのは、 メールを単に1つのフォルダへ分類しているだけではない点です。
Ryan氏は各メールについて、 主に次の4項目をJevへ判断させています。
カテゴリー
そのメールがどの種類に属するのかを分類。
優先度
どの程度重要・緊急なメールなのかを評価。
スパム判定
不要・迷惑メールである可能性を判断。
返信要否
人間が返信すべきメールなのかを判定。
つまり1通のメールを、
「何のメールか」
「重要か」
「スパムか」
「返信すべきか」
という複数の軸から判断しています。
なぜJevとメール分類の相性がいいのか
Jevは、 長い文章を生成することを目的としたモデルではありません。
入力された情報をもとに、 Choice・Score・Noulなどの型付き判断 を返すことに特化しています。
通常の生成AIなら、
「このメールを分析して、 どう対応すべきか説明してください」
といった大きなプロンプトを渡すこともできます。
Jevではそれを、 小さな判断へ分解し、ソフトウェアが直接扱える結果として返す という設計に変えます。
公開デモで確認できた速度
| 項目 | 公開デモで表示された値 |
|---|---|
| 最初の処理件数 | 100メール |
| 並列worker | 8 |
| 平均レイテンシ | 約200ms / メール |
| P95 | 約240ms |
| スループット | 約38メール / 秒 |
メールのように、 大量の文章へ同じ種類の判断を繰り返す処理では、 この処理速度が大きな意味を持つ可能性があります。
「1,500通を5セント」とは断定しない
Ryan氏のデモでは利用額の表示も確認できますが、 本人が途中で共有アカウントであることに気付いています。 そのため、その画面だけを根拠に 「1,500通の処理費用が正確に○セントだった」 と断定するのは適切ではありません。
Jev自体が低コストを重視して設計されていることと、 個別デモで実際にいくら発生したのかは、 分けて考える必要があります。
OmochiXでは今後も、 開発者本人の報告値とOmochiX独自の実測値を分けて掲載 します。
もう1つ重要。「正解率」はまだ分からない
Ryan氏は実際のメールを確認しながら、 Jevの分類結果に高い評価を示しています。
ただし、この公開実験では 約1,500通すべてについて正解ラベルを用意した正式なaccuracy評価は公開されていません。
つまり、この事例は
「Jevが大量メール分類に使える可能性を示した実運用寄りのデモ」
と見るべきです。
「既存モデルより精度が高いことを証明したベンチマーク」 ではありません。
このYouTubeで見えてくるJevの本当の使い方
Greg Isenberg氏とRyan Vogel氏の対談で特に面白いのは、 Jevを「メール分類AI」としてだけ見ていない点です。
考え方はかなりシンプルです。
高コストな判断待ちの列の「前」にJevを置く。
人間や大型LLMが全部読む前に、 Jevが高速に分類・スコアリング・ルーティングする。
例えば、
メール
返信が必要なものだけ人間へ送る。
問い合わせ
緊急度や内容から担当部署へ振り分ける。
Lead
見込み度・優先度から営業順序を決める。
AI Agent
次に使うTool・Skill・Modelを決める。
OmochiXならCRMにこう入れる
メール分類より面白いのは、 同じ仕組みを「営業判断」に置き換えたとき。
OmochiXではJevを、 CRMへ入ってきたLeadを最初に判断するレイヤーとして使えるか検証していきます。
見込み度
営業優先度
緊急性
Human Reviewの必要性 ↓ CRM ↓ 自動処理 / AI営業 / 営業担当
例えば、
人間がすべてのLeadを上から順番に読むのではなく、 Jevが最初に整理し、重要な案件だけ人間や高性能AIへ送る という構成です。
Jevの本当の価値は「メール」ではない
この事例だけを見ると、 Jevは高速なメール分類AIに見えるかもしれません。
しかし本質は、 大量の非構造データを、 ソフトウェアがそのまま使える「判断」へ変換すること にあります。
メール。 問い合わせ。 Lead。 サポートチケット。 記事。 ログ。
これまで人間や大型LLMが毎回読んでいたものを、 小さな判断へ分解して処理する。
Ryan Vogel氏のメール実験は、 Jevの考え方を非常に分かりやすく示した公開事例の1つです。
OmochiXでも同じ条件で検証する
第三者事例を見るだけでは、 Jevが日本語や実際の業務データでどこまで使えるのかは分かりません。
OmochiXでは今後、 自社CRMを使ってJevを実際に組み込みます。
正解率
人間の判定とどれだけ一致するか。
確信度
誤判定とconfidenceの関係を確認。
速度
1件・100件・大量処理で測定。
コスト
大型LLMとの実費比較を行う。
Jevをもっと知る
まとめ
Ryan Vogel氏は、 Jevを自身の約1,500通のメールでテストし、 Category・Priority・Spam・Replyといった複数の判断を行いました。
本人のデモでは、 100通の処理で平均約200ms、 P95約240ms、 約38メール/秒という表示が確認されています。
一方、 全1,500通に対する正式な正解率は公開されておらず、 コスト表示についても慎重に扱う必要があります。
そしてGreg Isenberg氏との対談から見えてくるのは、 Jevの用途がメール整理だけではないことです。
大量の仕事を人間や大型LLMへ渡す前に、
Jevが「何をどこへ送るか」を判断する。
次回:Jevで500通のメールを数秒で分類。
さらに「どのAIモデルを使うべきか」をAIが判断する Model Routerへ進みます。
Ryan Vogel氏公開のJevメール分類デモ
Greg Isenberg / Startup Ideas Pod 「Jev is HERE. How to use it」
TypeSafe AI公式ドキュメント
Made with Jev掲載事例
※第三者事例の数値・評価は公開者本人の環境・報告に基づきます。 OmochiXによる独自検証結果ではありません。