Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型
一個高效的開放權重 MoE,以四分之一的規模媲美甚至超越 Inkling。

Thinking Machines Lab 發布了 Inkling-Small,這是一個開放權重的混合專家(Mixture-of-Experts,MoE)模型,擁有 2760 億個總參數,120 億個活躍參數——約為其首個模型 Inkling 規模的四分之一,但在推理和智能體編程方面的表現與之相當甚至更勝一籌。這裡的重點不在於規模,而在於效率。本指南涵蓋 Inkling-Small 的規格、發布時的基準測試數據、運行成本,以及高效開放權重模型對 AI 智能體開發者的意義。
什麼是 Inkling-Small?
Inkling-Small 是 Thinking Machines Lab 的第二個模型,該初創公司由前 OpenAI 首席技術官 Mira Murati 創立。它在 Inkling(該實驗室的首個開放權重發布)推出約兩週後面世,其核心理念只有一個:保留能力,削減算力。
- 2760 億個總參數,120 億個活躍參數——稀疏 MoE Transformer 架構。約為 Inkling 9750 億總參數 / 410 億活躍參數的四分之一。
- 100 萬 Token 上下文窗口。
- 原生多模態——可對文字、圖像和音頻進行推理,採用與 Inkling 相同的無編碼器架構。
- 可變推理強度——可調節推理深度,在準確性與速度及成本之間取得平衡。
- 基於 Apache 2.0 的開放權重,發布於 Hugging Face——包含用於高效推理的 NVFP4 量化檢查點。
- 在 NVIDIA GB300 NVL72 系統上訓練。
在架構上,它是一個 42 層的僅解碼器 Transformer,將每個 Token 路由至 256 個專家中的 6 個,另加 2 個在每個 Token 上均活躍的共享專家(模型說明卡)。其 MoE 架構設計與 Inkling 一脈相承。
關鍵亮點:小模型超越大模型
令人驚喜的是,Inkling-Small 不僅僅是 Inkling 的近似版本——在多項基準測試中,它甚至領先。Thinking Machines 在發布公告中解釋了原因:Inkling-Small 的訓練開始於其更大兄弟之後,因此團隊得以改進預訓練數據組合和方案,然後使用**以 Inkling 為教師的在策略蒸餾(on-policy distillation)**對早期檢查點進行後訓練。此後,他們又進行了兩週的智能體編程強化學習擴展(發布公告)。
結果,用實驗室自己的話說:Inkling-Small 在推理和智能體編程方面超越了 Inkling,而 Inkling 在知識覆蓋範圍和事實準確性方面仍保持優勢。一個具體例子——在 Humanity's Last Exam(純文字)中,它的得分為 31.6%,高於 Inkling 的 29.7%,且實驗室報告稱在每個推理預算下均保持這一優勢。
Inkling-Small 基準測試
以下所有數據均來自發布公告,在推理強度 0.99 下運行。整體表現呈現出廣泛均衡的通才特質,而非針對排行榜的特化優化。涉及自報測試框架的情況,我們已作標注。
| 基準測試 | Inkling-Small | Inkling | 備注 |
|---|---|---|---|
| SWEBench Verified* | 80.2% | 77.6% | 智能體編程 |
| Terminal Bench 2.1*(最佳測試框架) | 64.7% | 63.8% | 智能體工具使用 |
| GPQA Diamond | 89.5% | 87.2% | 推理 |
| HLE(純文字) | 31.6% | 29.7% | 推理 |
| AIME 2026 | 95.5% | 97.1% | 數學 |
| ARC-AGI-2 | 40.1% | 36.5% | 抽象推理 |
| CritPt | 8.3% | 5.4% | 高難度物理 |
| SimpleQA Verified | 20.6% | 43.9% | 事實準確性(Inkling 勝出) |
*SWEBench Verified 和 Terminal Bench 2.1 使用實驗室自有的 Inkling 系列模型編程測試框架;外部模型使用自報數據。跨模型比較時請留意此注意事項——獨立驗證至關重要。
有兩點值得關注。第一,在對智能體最重要的編程和推理任務上,小模型的表現至少與大模型持平。第二,代價是事實準確性:在 SimpleQA Verified 上,Inkling-Small 下降至 20.6%,而 Inkling 為 43.9%——參數較少意味著記憶的世界知識較少,這正是檢索或工具發揮作用的地方。
與同等參數量級的競品相比,Inkling-Small 與 DeepSeek V4 Flash、Qwen3.5-397B-A17B 和 GLM 5.2 等開放權重模型具有競爭力——在不同基準測試中各有勝負,而非全面壓制。
效率優勢:成本與算力
真正的賣點在於性價比曲線。由於每個 Token 只有 120 億個參數處於活躍狀態,Inkling-Small 在相近質量水平下的服務成本低於 Inkling。
- 輸出定價: Inkling-Small 標價為 每百萬 Token 1.20 美元,而 Inkling 為 每百萬 Token 4.05 美元(發布公告)——約為三分之一的成本。
- 硬件門檻: BF16 檢查點至少需要 600 GB 聚合顯存(例如 4× NVIDIA B300 或 8× H200)。NVFP4 量化檢查點將此降至 180 GB,可在單張 B300 上運行(模型說明卡,MarkTechPost)。
單 GPU 路徑是小型團隊的重大突破:一個 2760 億參數的多模態模型,初創公司可以在一台租用的 B300 上自行部署,而無需前沿實驗室規模的集群。
多模態、認識論與安全性
多模態。 Inkling-Small 採用與 Inkling 相同的原生多模態、無編碼器設計——音頻以 dMel 頻譜圖形式處理,圖像分割為 40×40 像素塊——實驗室表示改進了模型使用 Python 處理視覺任務(如裁剪和縮放圖表及文件)的能力。在大多數多模態評估中,它以更低成本接近 Inkling 的表現。
認識論。 校準訓練採用強化學習,針對真實世界預測問題的適當評分規則進行優化。在 ForecastBench(無搜索)上,其 Brier Index 為 61.3 ± 0.46,略高於 Inkling 的 60.1(發布公告)。
安全性。 它繼承了 Inkling 的安全方案。StrongREJECT 達到 98.4%,在 FORTRESS 上得分為 71.6%(對抗性)/ 96.9%(良性)。實驗室建議在面向消費者的部署中疊加下游審核機制,例如 Llama Guard(MarkTechPost)。與 Inkling 一樣,對開放權重進行微調的團隊需自行承擔其定制版本的安全責任。
如何運行
您有三種途徑(模型說明卡):
- 從 Hugging Face 下載權重——BF16 或 NVFP4 量化檢查點。
- 在 Tinker 上進行微調,這是實驗室的微調平台,同時提供 API 訪問和支持文字、圖像及音頻對話的 Playground。
- 通過 API 使用第三方推理服務商,適合不希望自行部署的團隊。
高效開放權重模型對 AI 智能體的意義
對於構建智能體的團隊而言,Inkling-Small 深化了 Inkling 開啟的轉變:您可以在自己的基礎設施上運行一個功能強大的多模態模型,針對您的領域進行微調,並保持結果私密——無需按 API 調用次數向封閉服務商付費。現在的不同之處在於經濟性。四分之一規模的模型、三分之一的價格,加上單 GPU 量化路徑,將自行部署從「前沿實驗室預算」降至「一個租用實例」的門檻。
可變推理強度是原生智能體功能:在複雜規劃步驟時放慢模型速度,在簡單步驟時加快速度,全部在您自己的循環內完成——這正是長期、多步驟工作流程所需要的。如果您正在比較開放選項,我們關於原版 Thinking Machines Inkling 的文章更深入地介紹了更大的模型及其自行微調的理念。
用您自己的 AI 工作團隊付諸實踐
Inkling-Small 的核心前提——高效、可自行部署、可按需定制的模型優於千篇一律的方案——與 Eigent 背後的理念如出一轍。Eigent 是一款開源的「Cowork」桌面應用,可在本地運行多智能體 AI 工作團隊。Inkling-Small 是您進行微調的基礎模型,而 Eigent 則是其上的工作力層:一支智能體團隊,使用您選擇的模型,在您的機器上自動化真實的多步驟工作流程。若要讓開放權重模型真正投入使用,而不只是閱讀基準測試表格,請下載 Eigent 並開始構建您自己的智能體工作流程。
Recent Posts

Augment Code 替代方案
從目前定價、共享用量、上下文品質、原始碼存取、自行託管部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。

最佳開源 AI 程式開發代理
依授權、介面、自行託管、模型選擇、審批機制、安全、維護與實際適用性,比較目前最佳開源 AI 程式開發代理。

最佳開源 AI 銷售代理
從聯絡人資料、外聯、CRM 工作流程、成本、控制與適用性,比較 AI 銷售代理堆疊及 11x、Artisan、Qualified Piper、Nooks、Rox。