Thinking Machines Inkling-Small:以四分之一的規模超越更大兄弟的 276B 模型
一個高效的開放權重 MoE 模型,以四分之一的規模媲美甚至超越 Inkling。

Thinking Machines Lab 發布了 Inkling-Small,這是一個開放權重的混合專家(Mixture-of-Experts,MoE)模型,擁有 2760 億個總參數,120 億個活躍參數——大約是其第一個模型 Inkling 規模的四分之一,但在推理和智能體程式設計(agentic coding)方面的表現卻與之相當甚至超越。這裡的重點不在於規模,而在於效率。本文涵蓋 Inkling-Small 的規格、發布時的基準測試數據、運行成本,以及高效開放權重模型對 AI 智能體開發者的意義。
什麼是 Inkling-Small?
Inkling-Small 是 Thinking Machines Lab 的第二個模型,該新創公司由前 OpenAI 技術長 Mira Murati 創立。它在 Inkling(該實驗室的第一個開放權重發布)問世約兩週後推出,其核心理念是:保留能力,削減運算需求。
- 2760 億個總參數,120 億個活躍參數——稀疏 MoE Transformer 架構。這大約是 Inkling(9750 億總參數 / 410 億活躍參數)的四分之一。
- 100 萬 token 的上下文視窗。
- 原生多模態——可對文字、圖像和音訊進行推理,採用與 Inkling 相同的無編碼器架構。
- 可調式推理強度(Variable thinking effort)——可調高或調低推理深度,以在準確性、速度和成本之間取得平衡。
- 採用 Apache 2.0 授權的開放權重,發布於 Hugging Face——包含用於高效推理的 NVFP4 量化檢查點。
- 在 NVIDIA GB300 NVL72 系統上訓練。
在架構上,它是一個 42 層的僅解碼器 Transformer,將每個 token 路由至 256 個專家中的 6 個,另加 2 個對每個 token 都保持活躍的共享專家(模型說明卡)。其 MoE 設計沿用了與 Inkling 相同的技術脈絡。
關鍵轉折:小模型超越大模型
令人驚訝的是,Inkling-Small 不只是近似 Inkling——在多項基準測試中它甚至領先。Thinking Machines 在發布文章中解釋了原因:Inkling-Small 的訓練開始於其更大兄弟之後,因此團隊得以改進預訓練資料組合和方案,再使用**以 Inkling 為教師模型的策略蒸餾(on-policy distillation)**對早期檢查點進行後訓練。此後,他們又花了兩週時間擴展智能體程式設計的強化學習(發布文章)。
結果,用實驗室自己的話說:Inkling-Small 在推理和智能體程式設計方面超越了 Inkling,而 Inkling 在知識覆蓋範圍和事實準確性方面仍保有優勢。一個具體的例子——在 Humanity's Last Exam(純文字)上,它的得分為 31.6%,高於 Inkling 的 29.7%,且實驗室報告指出這一優勢在每個推理預算下都成立。
Inkling-Small 基準測試
以下所有數據均來自發布文章,在 effort 0.99 的設定下運行。整體模式呈現出廣泛、均衡的通才特性,而非針對排行榜衝刺。涉及自行回報測試框架的項目,我們會特別標注。
| 基準測試 | Inkling-Small | Inkling | 備注 |
|---|---|---|---|
| SWEBench Verified* | 80.2% | 77.6% | 智能體程式設計 |
| Terminal Bench 2.1*(最佳測試框架) | 64.7% | 63.8% | 智能體工具使用 |
| GPQA Diamond | 89.5% | 87.2% | 推理 |
| HLE(純文字) | 31.6% | 29.7% | 推理 |
| AIME 2026 | 95.5% | 97.1% | 數學 |
| ARC-AGI-2 | 40.1% | 36.5% | 抽象推理 |
| CritPt | 8.3% | 5.4% | 高難度物理 |
| SimpleQA Verified | 20.6% | 43.9% | 事實準確性(Inkling 勝出) |
*SWEBench Verified 和 Terminal Bench 2.1 使用實驗室自有的程式設計測試框架評測 Inkling 系列模型;外部模型則使用自行回報的數據。進行跨模型比較時請留意此注意事項——獨立驗證將至關重要。
有兩點值得關注。第一,在對智能體最重要的程式設計和推理任務上,小模型的表現至少與大模型持平。第二,代價是事實準確性:在 SimpleQA Verified 上,Inkling-Small 下滑至 20.6%,而 Inkling 為 43.9%——參數較少意味著記憶的世界知識較少,這正是檢索增強或工具調用發揮作用的地方。
與同等參數量級的競爭對手相比,Inkling-Small 與 DeepSeek V4 Flash、Qwen3.5-397B-A17B 和 GLM 5.2 等開放權重模型具有競爭力——在不同基準測試上互有勝負,而非全面壓制。
效率論點:成本與運算
真正的賣點在於性價比曲線。由於每個 token 只有 120 億個參數處於活躍狀態,在相近品質水準下,Inkling-Small 的服務成本低於 Inkling。
- 輸出定價: Inkling-Small 的定價為 每百萬 token $1.20 美元,而 Inkling 為 每百萬 token $4.05 美元(發布文章)——大約是三分之一的成本。
- 硬體門檻: BF16 檢查點至少需要 600 GB 的聚合 VRAM(例如 4× NVIDIA B300 或 8× H200)。NVFP4 量化檢查點將此需求降至 180 GB,可在單張 B300 上運行(模型說明卡、MarkTechPost)。
單 GPU 的部署路徑是小型團隊的重大突破:一個 2760 億參數的多模態模型,新創公司可以在一台租用的 B300 上自行託管,而無需前沿實驗室等級的叢集。
多模態、認識論與安全性
多模態。 Inkling-Small 採用與 Inkling 相同的原生多模態、無編碼器設計——音訊以 dMel 頻譜圖表示,圖像分割為 40×40 的圖塊——實驗室表示改進了模型使用 Python 處理視覺任務的能力,例如裁剪和縮放圖表與文件。在較低成本下,它在大多數多模態評測中幾乎與 Inkling 持平。
認識論。 校準訓練採用強化學習,針對真實世界預測問題的適當評分規則進行優化。在 ForecastBench(無搜尋)上,它的 Brier Index 為 61.3 ± 0.46,略高於 Inkling 的 60.1(發布文章)。
安全性。 它繼承了 Inkling 的安全方案。StrongREJECT 達到 98.4%,在 FORTRESS 上的對抗性得分為 71.6%,良性得分為 96.9%。實驗室建議在面向消費者的部署中疊加下游內容審核機制,例如 Llama Guard(MarkTechPost)。與 Inkling 一樣,對開放權重進行微調的團隊需自行承擔其客製化版本的安全責任。
如何運行
您有三種途徑(模型說明卡):
- 從 Hugging Face 下載權重——BF16 或 NVFP4 量化檢查點。
- 在 Tinker(實驗室的微調平台)上進行微調,該平台同時提供 API 存取和支援文字、圖像及音訊對話的 Playground。
- 透過 第三方推理服務商 的 API,適合不想自行託管的團隊。
高效開放權重模型對 AI 智能體的意義
對於構建智能體的團隊而言,Inkling-Small 深化了 Inkling 開啟的同一轉變:您可以在自己的基礎設施上運行一個功能強大的多模態模型,針對您的領域進行微調,並保持結果的私密性——無需按 API 呼叫次數向封閉服務商付費。現在的不同之處在於經濟效益。四分之一規模的模型、三分之一的價格,加上單 GPU 量化部署路徑,將自行託管從「前沿實驗室預算」降至「一台租用實例」的門檻。
可調式推理強度是原生智能體特性:在困難的規劃步驟中放慢模型速度,在簡單步驟中加快速度,全部在您自己的循環中完成——這正是長時間、多步驟工作流程所需要的。如果您正在比較開放選項,我們關於原版 Thinking Machines Inkling 的文章更深入地介紹了更大的模型以及「自行微調」的理念。
用您自己的 AI 工作團隊付諸實踐
Inkling-Small 的核心前提——高效、可自行託管且能按需塑造的模型優於一刀切的方案——與 Eigent 背後的理念如出一轍。Eigent 是一款開源的「Cowork」桌面應用程式,可在本地運行多智能體 AI 工作團隊。Inkling-Small 是您進行微調的基礎模型,而 Eigent 則是其上的工作團隊層:一組智能體,使用您選擇的模型,在您的機器上自動化真實的多步驟工作流程。若要讓開放權重模型真正投入使用,而不只是閱讀基準測試表格,請下載 Eigent 並開始構建您自己的智能體工作流程。
Recent Posts

Augment Code 替代方案
從目前定價、共享用量、脈絡品質、原始碼存取、自架部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。

最佳開源 AI 程式設計代理
依授權、介面、自架、模型選擇、核准機制、安全、維護與實際適用性,比較目前最佳開源 AI 程式設計代理。

最佳開源 AI 銷售代理
從聯絡人資料、外聯、CRM 工作流程、成本、控制與適用性,比較 AI 銷售代理堆疊及 11x、Artisan、Qualified Piper、Nooks、Rox。