什麼是 Jev?TypeSafe AI 的 System One 模型詳解
一種全新的 AI 模型,返回帶類型的決策而非文字——以及它在智能體工作流程中的定位。

今年大多數 AI 產品都在競相提升對話能力,TypeSafe AI 卻走了另一條路。2026 年 9 月 15 日,該公司推出了 Jev,其首個「System One 模型」——一種從不生成句子、而是直接返回帶類型概率決策供代碼使用的 AI。如果你正在構建智能體或自動化系統,Jev 值得深入了解:它針對的是那些 LLM 處理起來既慢又昂貴的高頻、重複性決策。以下是它的定義、工作原理、費用,以及哪些說法值得保持審慎態度。
Jev 是什麼?一句話概括
Jev 是 TypeSafe AI 推出的前沿模型,它接收程序狀態及一組帶類型的問題,在單次並行處理中回答所有問題——返回帶有校準概率的結構化數值,而非生成文字。
該公司將其定位為一個全新的模型類別,而非更小的 LLM。TypeSafe 稱之為「System One」,借用了丹尼爾·卡尼曼(Daniel Kahneman)對快速直覺式 System 1 思維與緩慢深思熟慮式 System 2 推理的區分。其核心理念是:軟件內部的大多數決策都是快速判斷(「這屬於哪個類別?」、「這件事緊急嗎?」),而我們一直在為此租用完整的推理模型。
Jev 由 Diogo Almeida 構建,他曾參與 OpenAI 的 RLHF(基於人類反饋的強化學習)和 InstructGPT 工作,奠定了 ChatGPT 的基礎。Jev 以 DCVC 領投的 4000 萬美元融資正式亮相。其名稱致敬了經濟學家威廉·斯坦利·傑文斯(William Stanley Jevons)——寓意決策成本越低,對決策的需求就越大。
Jev 與 LLM 的核心差異
核心差異在於輸出方式。LLM 逐個 token 生成字符串,你隨後需要解析和驗證該字符串,並祈禱它沒有幻覺或返回錯誤格式。Jev 則預先定義所有可能的答案,並以帶類型的數值返回,因此無需解析,且從設計上杜絕了類型錯誤。
| Jev(System One) | 前沿 LLM | |
|---|---|---|
| 輸出 | 帶類型的決策 + 概率 | 生成文字(字符串) |
| 採樣方式 | 並行,單次處理 | 逐 token 順序生成 |
| 延遲 | 70–500 毫秒(自報數據) | 數秒 |
| 結構化輸出錯誤 | 設計上為 0% | 非零 |
| 置信度 | 每次答案均附帶校準值 | 常常過度自信 |
有兩點尤為突出。第一,並行採樣:Jev 同時評估請求中的所有問題,因此增加第十個問題幾乎不影響響應時間。第二,校準置信度:Jev 採用 TypeSafe 稱為「校準決策強化學習」(RLCD,Reinforcement Learning for Calibrated Decisions)的方法訓練,針對實際結果而非人類偏好來優化概率。總體而言,更高的置信度意味著更高的準確率——這正是你決定何時自動執行、何時升級處理所需要的特性。
它同樣能像 LLM 一樣理解自然語言輸入,但目前僅接受純文字——字符串、JSON 或文字數組,暫不支持圖像、音頻或視頻。
三種基本原語
整個 API 只有三種問題類型。這是設計理念,而非功能限制:
- Choice(選擇) — 從一組選項中選擇一個(最多 255 個)。返回所選選項、每個選項的概率及置信度分數。可添加明確的
other選項,讓模型表示「以上均不符合」。 - Score(評分) — 在你以文字描述的 2 至 10 級量表上定位。返回可落在級別之間的分數(例如
1.4)。 - Noul — 一個是/否問題,以 0 到 1 之間的單一概率返回。
一個支持工單的 API 調用可能在單次請求中詢問:應由哪個團隊處理(Choice)、客戶的沮喪程度(Score),以及他們是否明確要求退款(Noul)。你的代碼隨後用普通的 if 語句組合這些帶類型的答案。TypeSafe 的官方文檔將 Jev 定位為「智能 if 語句」——在手寫規則過於脆弱的場景中進行分類、路由、評分、提取或分支。
Jev 的適用場景與局限
Jev 專為針對已知答案集的高頻重複決策而設計:工單分類、意圖路由、內容審核、信息提取、評分,以及對其他模型輸出的護欄檢查。由於問題並行處理且輸出免費,你可以「扇形展開」,預先詢問所有問題,再由代碼決定哪些結果重要。
對於任何需要生成文字的任務,Jev 並不適合:對話、代碼生成或推理解釋均不在其能力範圍內。另有兩個值得注意的限制:
- 無世界知識。 Jev 只了解你傳入的狀態,無法自行查詢任何信息。這一步驟決定了任何基於它構建的工作流程的上限。
- 校準是群體屬性。 TypeSafe 明確指出,校準在大量預測中成立——並不保證任何單次答案的正確性。Jev 仍然可能出錯。
定價與速度:細讀注意事項
TypeSafe 的核心數據相當亮眼:輸入費用為每百萬 token 0.042 美元,輸出免費,延遲為 70–500 毫秒,主頁聲稱在其工作流程基準測試中比 LLM「快 193.6 倍、便宜 444.6 倍」。
請將這些視為廠商聲明,而非獨立測試結果。TypeSafe 自身也補充了有用的注意事項:評測在其自家西海岸筆記本電腦上運行;無法證明定價未受補貼;其工作流程雖未納入訓練集,但由其自有團隊構建。基準測試還以 GPT-6 Astra 和 Fable 5.1 的平均值作為「正確」參考,這本身就對這兩個模型存在偏向。涵蓋此次發布的實用指南,如這篇 dev.to 操作指南,也重申了同樣的警告:速度和成本數據均為自行測試,尚未經過獨立驗證。唯一難以反駁的說法是 0% 類型錯誤——模式匹配有保障,因此只要出現一個反例即可證偽。
Jev 在智能體循環中的定位
對於構建多智能體系統的團隊而言,有趣的模式是基於置信度的路由。與其為整個系統設置單一準確率閾值,不如根據出錯代價為每個動作設置閾值:對低成本、只讀的決策在高置信度時自動執行;對高成本決策請求確認;當置信度低時路由給人工——或交由完整推理模型處理。
這使 Jev 成為智能體循環中的決策層,而非 LLM 的替代品。常見的架構是級聯模式:Jev 以低成本進行分類和路由,確定性代碼處理可處理的部分,前沿模型接手少數困難案例。其價值在於減少昂貴的 LLM 調用次數,並在「機器決策」與「需要人工審查」之間建立清晰、可審計的邊界。
總結
Jev 是一個真正不同的理念:一個形如函數調用而非聊天機器人的 AI 原語。如果它在廠商自有基準測試之外同樣表現出色,System One 模型有望接管目前尷尬地塞在 LLM 提示詞中的數百萬個小型判斷任務。目前,它仍處於早期訪問階段,僅支持文字輸入,所有性能數據均為自報——前景可期,但尚待驗證。正確的做法是在一個範圍明確的高頻決策場景中試用,並與現有方案進行對比測量。
用你自己的 AI 工作團隊構建決策驅動的工作流程
Jev 只是自動化技術棧的一層——快速決策層。其餘部分是編排:收集狀態、調用正確的工具,並在真實應用中執行結果。這正是 Eigent 作為開源多智能體「Cowork」桌面應用所做的事,它通過端到端工作流程協調智能體,例如審查 GitHub PR 或對傳入工作進行分類。想在本地構建基於置信度的自動化?下載 Eigent,將你的決策接入一支能付諸行動的工作團隊。
Recent Posts

Periodic Neon:以實驗室數據訓練、超越前沿模型的科學AI
Periodic Neon 是一個以實體實驗室數據訓練的1兆參數AI,在衍射分析上超越GPT-6 Astra。本文介紹其功能及重要意義。

Meta Muse:預訂、購物、議價的個人 AI 代理
Meta Muse 是一款個人 AI 代理,可透過對話介面預訂旅程、購買商品及協商帳單。本文涵蓋其功能、定價、安全性及比較分析。

Eigent v1.0.4 版本更新說明:技能與連接器儀表板、穩定的多輪執行
Eigent v1.0.4 將技能與連接器重建為管理儀表板,並強化多輪代理工作、工作區檢查點、連接器狀態與應用程式結束流程。