logo
  • 環境
  • 企業方案
  • 價格方案
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small:以四分之一的規模超越更大兄弟的 276B 模型

一個高效的開放權重 MoE 模型,以四分之一的規模媲美甚至超越 Inkling。

EigentEigent
Share to
Thinking Machines Inkling-Small:以四分之一的規模超越更大兄弟的 276B 模型
  • 什麼是 Inkling-Small?
  • 關鍵轉折:小模型超越大模型
  • Inkling-Small 基準測試
  • 效率論點:成本與運算
  • 多模態、認識論與安全性
  • 如何運行
  • 高效開放權重模型對 AI 智能體的意義
  • 用您自己的 AI 工作團隊付諸實踐
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab 發布了 Inkling-Small,這是一個開放權重的混合專家(Mixture-of-Experts,MoE)模型,擁有 2760 億個總參數,120 億個活躍參數——大約是其第一個模型 Inkling 規模的四分之一,但在推理和智能體程式設計(agentic coding)方面的表現卻與之相當甚至超越。這裡的重點不在於規模,而在於效率。本文涵蓋 Inkling-Small 的規格、發布時的基準測試數據、運行成本,以及高效開放權重模型對 AI 智能體開發者的意義。

什麼是 Inkling-Small?

Inkling-Small 是 Thinking Machines Lab 的第二個模型,該新創公司由前 OpenAI 技術長 Mira Murati 創立。它在 Inkling(該實驗室的第一個開放權重發布)問世約兩週後推出,其核心理念是:保留能力,削減運算需求。

以下是來自實驗室發布文章和模型說明卡的重點事實:

  • 2760 億個總參數,120 億個活躍參數——稀疏 MoE Transformer 架構。這大約是 Inkling(9750 億總參數 / 410 億活躍參數)的四分之一。
  • 100 萬 token 的上下文視窗。
  • 原生多模態——可對文字、圖像和音訊進行推理,採用與 Inkling 相同的無編碼器架構。
  • 可調式推理強度(Variable thinking effort)——可調高或調低推理深度,以在準確性、速度和成本之間取得平衡。
  • 採用 Apache 2.0 授權的開放權重,發布於 Hugging Face——包含用於高效推理的 NVFP4 量化檢查點。
  • 在 NVIDIA GB300 NVL72 系統上訓練。

在架構上,它是一個 42 層的僅解碼器 Transformer,將每個 token 路由至 256 個專家中的 6 個,另加 2 個對每個 token 都保持活躍的共享專家(模型說明卡)。其 MoE 設計沿用了與 Inkling 相同的技術脈絡。

關鍵轉折:小模型超越大模型

令人驚訝的是,Inkling-Small 不只是近似 Inkling——在多項基準測試中它甚至領先。Thinking Machines 在發布文章中解釋了原因:Inkling-Small 的訓練開始於其更大兄弟之後,因此團隊得以改進預訓練資料組合和方案,再使用**以 Inkling 為教師模型的策略蒸餾(on-policy distillation)**對早期檢查點進行後訓練。此後,他們又花了兩週時間擴展智能體程式設計的強化學習(發布文章)。

結果,用實驗室自己的話說:Inkling-Small 在推理和智能體程式設計方面超越了 Inkling,而 Inkling 在知識覆蓋範圍和事實準確性方面仍保有優勢。一個具體的例子——在 Humanity's Last Exam(純文字)上,它的得分為 31.6%,高於 Inkling 的 29.7%,且實驗室報告指出這一優勢在每個推理預算下都成立。

Inkling-Small 基準測試

以下所有數據均來自發布文章,在 effort 0.99 的設定下運行。整體模式呈現出廣泛、均衡的通才特性,而非針對排行榜衝刺。涉及自行回報測試框架的項目,我們會特別標注。

基準測試Inkling-SmallInkling備注
SWEBench Verified*80.2%77.6%智能體程式設計
Terminal Bench 2.1*(最佳測試框架)64.7%63.8%智能體工具使用
GPQA Diamond89.5%87.2%推理
HLE(純文字)31.6%29.7%推理
AIME 202695.5%97.1%數學
ARC-AGI-240.1%36.5%抽象推理
CritPt8.3%5.4%高難度物理
SimpleQA Verified20.6%43.9%事實準確性(Inkling 勝出)

*SWEBench Verified 和 Terminal Bench 2.1 使用實驗室自有的程式設計測試框架評測 Inkling 系列模型;外部模型則使用自行回報的數據。進行跨模型比較時請留意此注意事項——獨立驗證將至關重要。

有兩點值得關注。第一,在對智能體最重要的程式設計和推理任務上,小模型的表現至少與大模型持平。第二,代價是事實準確性:在 SimpleQA Verified 上,Inkling-Small 下滑至 20.6%,而 Inkling 為 43.9%——參數較少意味著記憶的世界知識較少,這正是檢索增強或工具調用發揮作用的地方。

與同等參數量級的競爭對手相比,Inkling-Small 與 DeepSeek V4 Flash、Qwen3.5-397B-A17B 和 GLM 5.2 等開放權重模型具有競爭力——在不同基準測試上互有勝負,而非全面壓制。

效率論點:成本與運算

真正的賣點在於性價比曲線。由於每個 token 只有 120 億個參數處於活躍狀態,在相近品質水準下,Inkling-Small 的服務成本低於 Inkling。

  • 輸出定價: Inkling-Small 的定價為 每百萬 token $1.20 美元,而 Inkling 為 每百萬 token $4.05 美元(發布文章)——大約是三分之一的成本。
  • 硬體門檻: BF16 檢查點至少需要 600 GB 的聚合 VRAM(例如 4× NVIDIA B300 或 8× H200)。NVFP4 量化檢查點將此需求降至 180 GB,可在單張 B300 上運行(模型說明卡、MarkTechPost)。

單 GPU 的部署路徑是小型團隊的重大突破:一個 2760 億參數的多模態模型,新創公司可以在一台租用的 B300 上自行託管,而無需前沿實驗室等級的叢集。

多模態、認識論與安全性

多模態。 Inkling-Small 採用與 Inkling 相同的原生多模態、無編碼器設計——音訊以 dMel 頻譜圖表示,圖像分割為 40×40 的圖塊——實驗室表示改進了模型使用 Python 處理視覺任務的能力,例如裁剪和縮放圖表與文件。在較低成本下,它在大多數多模態評測中幾乎與 Inkling 持平。

認識論。 校準訓練採用強化學習,針對真實世界預測問題的適當評分規則進行優化。在 ForecastBench(無搜尋)上,它的 Brier Index 為 61.3 ± 0.46,略高於 Inkling 的 60.1(發布文章)。

安全性。 它繼承了 Inkling 的安全方案。StrongREJECT 達到 98.4%,在 FORTRESS 上的對抗性得分為 71.6%,良性得分為 96.9%。實驗室建議在面向消費者的部署中疊加下游內容審核機制,例如 Llama Guard(MarkTechPost)。與 Inkling 一樣,對開放權重進行微調的團隊需自行承擔其客製化版本的安全責任。

如何運行

您有三種途徑(模型說明卡):

  1. 從 Hugging Face 下載權重——BF16 或 NVFP4 量化檢查點。
  2. 在 Tinker(實驗室的微調平台)上進行微調,該平台同時提供 API 存取和支援文字、圖像及音訊對話的 Playground。
  3. 透過 第三方推理服務商 的 API,適合不想自行託管的團隊。

高效開放權重模型對 AI 智能體的意義

對於構建智能體的團隊而言,Inkling-Small 深化了 Inkling 開啟的同一轉變:您可以在自己的基礎設施上運行一個功能強大的多模態模型,針對您的領域進行微調,並保持結果的私密性——無需按 API 呼叫次數向封閉服務商付費。現在的不同之處在於經濟效益。四分之一規模的模型、三分之一的價格,加上單 GPU 量化部署路徑,將自行託管從「前沿實驗室預算」降至「一台租用實例」的門檻。

可調式推理強度是原生智能體特性:在困難的規劃步驟中放慢模型速度,在簡單步驟中加快速度,全部在您自己的循環中完成——這正是長時間、多步驟工作流程所需要的。如果您正在比較開放選項,我們關於原版 Thinking Machines Inkling 的文章更深入地介紹了更大的模型以及「自行微調」的理念。

用您自己的 AI 工作團隊付諸實踐

Inkling-Small 的核心前提——高效、可自行託管且能按需塑造的模型優於一刀切的方案——與 Eigent 背後的理念如出一轍。Eigent 是一款開源的「Cowork」桌面應用程式,可在本地運行多智能體 AI 工作團隊。Inkling-Small 是您進行微調的基礎模型,而 Eigent 則是其上的工作團隊層:一組智能體,使用您選擇的模型,在您的機器上自動化真實的多步驟工作流程。若要讓開放權重模型真正投入使用,而不只是閱讀基準測試表格,請下載 Eigent 並開始構建您自己的智能體工作流程。

Recent Posts

Augment Code 替代方案
產業Aug 3, 2026

Augment Code 替代方案

從目前定價、共享用量、脈絡品質、原始碼存取、自架部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。

Douglas LaiDouglas Lai
最佳開源 AI 程式設計代理
產業Aug 3, 2026

最佳開源 AI 程式設計代理

依授權、介面、自架、模型選擇、核准機制、安全、維護與實際適用性,比較目前最佳開源 AI 程式設計代理。

Douglas LaiDouglas Lai
最佳開源 AI 銷售代理
產業Aug 3, 2026

最佳開源 AI 銷售代理

從聯絡人資料、外聯、CRM 工作流程、成本、控制與適用性,比較 AI 銷售代理堆疊及 11x、Artisan、Qualified Piper、Nooks、Rox。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即體驗 Eigent

下載開源桌面應用,在本地以 AI 工作團隊開始自動化。

下載 Eigent
Eigent

掌握 AI 工作團隊自動化的最新更新與教學內容。

產品Eigent環境價格方案企業方案
探索解決方案使用情境技能插件部落格
開發者文件GitHubCAMEL-AI開源基金合作夥伴
下載開源版
公司關於我們品牌招募使用條款隱私權政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 全新版本發佈!download