什麼是 Jev?TypeSafe AI 的 System One 模型解析
一種全新的 AI 模型,回傳型別化決策而非文字——以及它在 Agent 工作流程中的定位。

今年大多數 AI 新品都在競相提升對話智慧,TypeSafe AI 卻走了一條截然不同的路。2026 年 9 月 15 日,該公司推出了 Jev,其首款「System One 模型」——一種從不生成句子、而是直接回傳型別化、機率性決策供程式碼使用的 AI。如果你正在開發 Agent 或自動化系統,Jev 值得深入了解:它瞄準的是那些 LLM 處理起來既慢又昂貴的大量日常決策。以下說明它是什麼、如何運作、費用多少,以及哪些說法值得保持懷疑。
Jev 是什麼?一句話說清楚
Jev 是 TypeSafe AI 推出的前沿模型,接收程式狀態與一組型別化問題,在單次平行處理中一次回答所有問題——回傳的是帶有校準機率的結構化數值,而非生成文字。
該公司將其定位為一種全新的模型類別,而非更小的 LLM。TypeSafe 稱之為「System One」,借用了丹尼爾·康納曼(Daniel Kahneman)對快速直覺的系統一思維與緩慢深思的系統二推理的區分。其核心假設是:軟體內部的大多數決策都是快速判斷(「這屬於哪個類別?」、「這件事緊急嗎?」),而我們一直在為這些判斷租用完整的推理模型。
Jev 由 Diogo Almeida 打造,他曾參與 OpenAI 的 RLHF 與 InstructGPT 工作,奠定了 ChatGPT 的基礎。此次發布獲得 DCVC 領投的 4,000 萬美元融資。名稱致敬經濟學家威廉·斯坦利·傑文斯(William Stanley Jevons)——寓意決策成本越低,對決策的需求就越爆炸性增長。
Jev 與 LLM 的核心差異
核心差異在於輸出形式。LLM 逐個 token 生成字串,你再解析並驗證該字串,並祈禱它沒有幻覺或回傳錯誤格式。Jev 則預先定義所有可能的答案,並以型別化數值回傳,因此無需解析,且在設計上不存在型別錯誤。
| Jev(System One) | 前沿 LLM | |
|---|---|---|
| 輸出 | 型別化決策 + 機率 | 生成文字(字串) |
| 採樣方式 | 平行,單次處理 | 循序,逐 token |
| 延遲 | 70–500 毫秒(自報數據) | 數秒 |
| 結構化輸出錯誤 | 設計上為 0% | 非零 |
| 信心度 | 每次回答均附校準值 | 常過度自信 |
有兩點特別值得關注。第一,平行採樣:Jev 同時評估一次請求中的所有問題,因此增加第十個問題幾乎不影響回應時間。第二,校準信心度:Jev 採用 TypeSafe 稱為「校準決策強化學習」(Reinforcement Learning for Calibrated Decisions,RLCD)的方法訓練,針對實際結果而非人類偏好來優化機率。整體而言,信心度越高應代表準確率越高——這正是你判斷何時自動執行、何時升級處理所需的依據。
它也像 LLM 一樣理解自然語言輸入,但目前僅接受純文字——字串、JSON 或文字陣列。尚不支援圖片、音訊或影片。
三種基本原語(Primitives)
整個 API 只有三種問題類型。這是設計選擇,而非限制:
- Choice(選擇) — 從一組選項中選一個(最多 255 個)。回傳所選選項、每個選項的機率及信心分數。可加入明確的
other選項,讓模型表示「以上皆不符合」。 - Score(評分) — 在你以文字描述的 2 到 10 級量表上定位。回傳可落在級別之間的分數(例如
1.4)。 - Noul — 是/否問題,以 0 到 1 之間的單一機率回傳。
一次支援工單請求可能在單次呼叫中詢問:應由哪個團隊處理(Choice)、客戶的挫折程度(Score),以及客戶是否明確要求退款(Noul)。你的程式碼再用普通的 if 陳述式組合這些型別化答案。TypeSafe 的官方文件將 Jev 定位為「智慧 if 陳述式」——在手寫規則過於脆弱的地方進行分類、路由、評分、提取或分支。
Jev 擅長什麼,不擅長什麼
Jev 專為針對已知答案集的大量重複決策而生:工單分類、意圖路由、內容審核、資訊提取、評分,以及對其他模型輸出的護欄檢查。由於問題平行執行且輸出免費,你可以「扇形展開」,預先詢問所有問題,再由程式碼決定哪些結果重要。
對於任何需要生成文字的任務,Jev 並不適合:對話、程式碼生成或推理解釋。另有兩個限制值得特別說明:
- 無世界知識。 Jev 只了解你傳入的狀態;它無法自行查詢任何資訊。這一步驟決定了以它為核心的任何工作流程的上限。
- 校準是群體屬性。 TypeSafe 明確指出,校準性質適用於大量預測的整體——並不保證任何單一答案正確。Jev 仍然可能出錯。
定價與速度:細讀注意事項
TypeSafe 的標題數字相當亮眼:輸入費用為每百萬 token $0.042,輸出免費,延遲為 70–500 毫秒,首頁宣稱在其工作流程基準測試中比 LLM「快 193.6 倍、便宜 444.6 倍」。
請將這些數字視為廠商自述,而非獨立驗證結果。TypeSafe 本身也補充了有用的注意事項:評測是在其自家西岸筆電上執行的;無法證明定價未受補貼;且其工作流程雖未納入訓練集,但由其自家團隊建立。基準測試還以 GPT-6 Astra 與 Fable 5.1 的平均值作為「正確」參考,這本身就對這兩個模型存在偏差。涵蓋此次發布的實用指南,例如這篇 dev.to 操作說明,也重申了同樣的警告:速度與成本數據均為自行測試且未經第三方重現。唯一難以反駁的說法是 0% 型別錯誤——Schema 匹配有保證,因此只要出現一個反例即可推翻此說法。
Jev 在 Agent 迴圈中的定位
對於建構多 Agent 系統的團隊而言,有趣的模式是信心度閘控路由。不再為整個系統設定單一準確率門檻,而是根據出錯代價為每個動作設定門檻:對高信心度的低成本唯讀決策自動執行;對高成本決策請求確認;當信心度低時,路由給人工——或交給完整推理模型處理。
這使 Jev 成為 Agent 迴圈中的決策層,而非 LLM 的替代品。常見的架構是級聯式:Jev 以低成本分類和路由,確定性程式碼處理能處理的部分,前沿模型接手困難的少數案例。其價值在於減少昂貴的 LLM 呼叫次數,並在「機器決定」與「需要人工審視」之間建立清晰、可稽核的邊界。
總結
Jev 是一個真正不同的想法:一種形如函式呼叫而非聊天機器人的 AI 基本元件。如果它在廠商自有基準測試之外也能維持表現,System One 模型有望接管目前尷尬地塞在 LLM 提示詞中的數百萬個小判斷。目前它仍處於早期存取階段,僅支援文字,且所有效能數字均為自報——前景看好,但尚未獲得驗證。正確的做法是在一個範圍明確、量大的決策場景中試用,並與現有方案進行實測比較。
用你自己的 AI 工作團隊建構決策驅動的工作流程
Jev 是自動化技術棧中的一層——負責快速決策。其餘部分是協調編排:收集狀態、呼叫正確工具,並在真實應用程式中根據結果採取行動。這正是 Eigent 作為開源多 Agent「Cowork」桌面應用程式所做的事,透過端對端工作流程協調各 Agent,例如審查 GitHub PR 或分類待處理工作。想在本地端建構信心度閘控自動化?下載 Eigent,將你的決策接入一支能付諸行動的 AI 工作團隊。
Recent Posts

Periodic Neon:以實驗室數據訓練、超越前沿模型的 AI 科學家
Periodic Neon 是一個以實體實驗室數據訓練的 1T 參數 AI,在繞射分析上超越 GPT-6 Astra。本文說明其功能與重要性。

Meta Muse:能訂票、購物、議價的個人 AI 代理人
Meta Muse 是一款個人 AI 代理人,能透過對話介面訂旅遊、購物並協商帳單。本文涵蓋功能說明、定價方案、安全機制,以及與其他 AI 代理人的比較。

Eigent v1.0.4 發布說明:技能與連接器儀表板、穩定的多輪執行
Eigent v1.0.4 將技能與連接器重建為管理儀表板,並強化多輪代理工作、工作區檢查點、連接器狀態與應用程式結束流程。