logo
  • 環境
  • 企業方案
  • 價格
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型

一個高效的開放權重 MoE,以四分之一的規模媲美甚至超越 Inkling。

EigentEigent
Share to
Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型
  • 什麼是 Inkling-Small?
  • 關鍵亮點:小模型超越大模型
  • Inkling-Small 基準測試
  • 效率優勢:成本與算力
  • 多模態、認識論與安全性
  • 如何運行
  • 高效開放權重模型對 AI 智能體的意義
  • 用您自己的 AI 工作團隊付諸實踐
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab 發布了 Inkling-Small,這是一個開放權重的混合專家(Mixture-of-Experts,MoE)模型,擁有 2760 億個總參數,120 億個活躍參數——約為其首個模型 Inkling 規模的四分之一,但在推理和智能體編程方面的表現與之相當甚至更勝一籌。這裡的重點不在於規模,而在於效率。本指南涵蓋 Inkling-Small 的規格、發布時的基準測試數據、運行成本,以及高效開放權重模型對 AI 智能體開發者的意義。

什麼是 Inkling-Small?

Inkling-Small 是 Thinking Machines Lab 的第二個模型,該初創公司由前 OpenAI 首席技術官 Mira Murati 創立。它在 Inkling(該實驗室的首個開放權重發布)推出約兩週後面世,其核心理念只有一個:保留能力,削減算力。

以下是來自實驗室發布公告和模型說明卡的核心數據:

  • 2760 億個總參數,120 億個活躍參數——稀疏 MoE Transformer 架構。約為 Inkling 9750 億總參數 / 410 億活躍參數的四分之一。
  • 100 萬 Token 上下文窗口。
  • 原生多模態——可對文字、圖像和音頻進行推理,採用與 Inkling 相同的無編碼器架構。
  • 可變推理強度——可調節推理深度,在準確性與速度及成本之間取得平衡。
  • 基於 Apache 2.0 的開放權重,發布於 Hugging Face——包含用於高效推理的 NVFP4 量化檢查點。
  • 在 NVIDIA GB300 NVL72 系統上訓練。

在架構上,它是一個 42 層的僅解碼器 Transformer,將每個 Token 路由至 256 個專家中的 6 個,另加 2 個在每個 Token 上均活躍的共享專家(模型說明卡)。其 MoE 架構設計與 Inkling 一脈相承。

關鍵亮點:小模型超越大模型

令人驚喜的是,Inkling-Small 不僅僅是 Inkling 的近似版本——在多項基準測試中,它甚至領先。Thinking Machines 在發布公告中解釋了原因:Inkling-Small 的訓練開始於其更大兄弟之後,因此團隊得以改進預訓練數據組合和方案,然後使用**以 Inkling 為教師的在策略蒸餾(on-policy distillation)**對早期檢查點進行後訓練。此後,他們又進行了兩週的智能體編程強化學習擴展(發布公告)。

結果,用實驗室自己的話說:Inkling-Small 在推理和智能體編程方面超越了 Inkling,而 Inkling 在知識覆蓋範圍和事實準確性方面仍保持優勢。一個具體例子——在 Humanity's Last Exam(純文字)中,它的得分為 31.6%,高於 Inkling 的 29.7%,且實驗室報告稱在每個推理預算下均保持這一優勢。

Inkling-Small 基準測試

以下所有數據均來自發布公告,在推理強度 0.99 下運行。整體表現呈現出廣泛均衡的通才特質,而非針對排行榜的特化優化。涉及自報測試框架的情況,我們已作標注。

基準測試Inkling-SmallInkling備注
SWEBench Verified*80.2%77.6%智能體編程
Terminal Bench 2.1*(最佳測試框架)64.7%63.8%智能體工具使用
GPQA Diamond89.5%87.2%推理
HLE(純文字)31.6%29.7%推理
AIME 202695.5%97.1%數學
ARC-AGI-240.1%36.5%抽象推理
CritPt8.3%5.4%高難度物理
SimpleQA Verified20.6%43.9%事實準確性(Inkling 勝出)

*SWEBench Verified 和 Terminal Bench 2.1 使用實驗室自有的 Inkling 系列模型編程測試框架;外部模型使用自報數據。跨模型比較時請留意此注意事項——獨立驗證至關重要。

有兩點值得關注。第一,在對智能體最重要的編程和推理任務上,小模型的表現至少與大模型持平。第二,代價是事實準確性:在 SimpleQA Verified 上,Inkling-Small 下降至 20.6%,而 Inkling 為 43.9%——參數較少意味著記憶的世界知識較少,這正是檢索或工具發揮作用的地方。

與同等參數量級的競品相比,Inkling-Small 與 DeepSeek V4 Flash、Qwen3.5-397B-A17B 和 GLM 5.2 等開放權重模型具有競爭力——在不同基準測試中各有勝負,而非全面壓制。

效率優勢:成本與算力

真正的賣點在於性價比曲線。由於每個 Token 只有 120 億個參數處於活躍狀態,Inkling-Small 在相近質量水平下的服務成本低於 Inkling。

  • 輸出定價: Inkling-Small 標價為 每百萬 Token 1.20 美元,而 Inkling 為 每百萬 Token 4.05 美元(發布公告)——約為三分之一的成本。
  • 硬件門檻: BF16 檢查點至少需要 600 GB 聚合顯存(例如 4× NVIDIA B300 或 8× H200)。NVFP4 量化檢查點將此降至 180 GB,可在單張 B300 上運行(模型說明卡,MarkTechPost)。

單 GPU 路徑是小型團隊的重大突破:一個 2760 億參數的多模態模型,初創公司可以在一台租用的 B300 上自行部署,而無需前沿實驗室規模的集群。

多模態、認識論與安全性

多模態。 Inkling-Small 採用與 Inkling 相同的原生多模態、無編碼器設計——音頻以 dMel 頻譜圖形式處理,圖像分割為 40×40 像素塊——實驗室表示改進了模型使用 Python 處理視覺任務(如裁剪和縮放圖表及文件)的能力。在大多數多模態評估中,它以更低成本接近 Inkling 的表現。

認識論。 校準訓練採用強化學習,針對真實世界預測問題的適當評分規則進行優化。在 ForecastBench(無搜索)上,其 Brier Index 為 61.3 ± 0.46,略高於 Inkling 的 60.1(發布公告)。

安全性。 它繼承了 Inkling 的安全方案。StrongREJECT 達到 98.4%,在 FORTRESS 上得分為 71.6%(對抗性)/ 96.9%(良性)。實驗室建議在面向消費者的部署中疊加下游審核機制,例如 Llama Guard(MarkTechPost)。與 Inkling 一樣,對開放權重進行微調的團隊需自行承擔其定制版本的安全責任。

如何運行

您有三種途徑(模型說明卡):

  1. 從 Hugging Face 下載權重——BF16 或 NVFP4 量化檢查點。
  2. 在 Tinker 上進行微調,這是實驗室的微調平台,同時提供 API 訪問和支持文字、圖像及音頻對話的 Playground。
  3. 通過 API 使用第三方推理服務商,適合不希望自行部署的團隊。

高效開放權重模型對 AI 智能體的意義

對於構建智能體的團隊而言,Inkling-Small 深化了 Inkling 開啟的轉變:您可以在自己的基礎設施上運行一個功能強大的多模態模型,針對您的領域進行微調,並保持結果私密——無需按 API 調用次數向封閉服務商付費。現在的不同之處在於經濟性。四分之一規模的模型、三分之一的價格,加上單 GPU 量化路徑,將自行部署從「前沿實驗室預算」降至「一個租用實例」的門檻。

可變推理強度是原生智能體功能:在複雜規劃步驟時放慢模型速度,在簡單步驟時加快速度,全部在您自己的循環內完成——這正是長期、多步驟工作流程所需要的。如果您正在比較開放選項,我們關於原版 Thinking Machines Inkling 的文章更深入地介紹了更大的模型及其自行微調的理念。

用您自己的 AI 工作團隊付諸實踐

Inkling-Small 的核心前提——高效、可自行部署、可按需定制的模型優於千篇一律的方案——與 Eigent 背後的理念如出一轍。Eigent 是一款開源的「Cowork」桌面應用,可在本地運行多智能體 AI 工作團隊。Inkling-Small 是您進行微調的基礎模型,而 Eigent 則是其上的工作力層:一支智能體團隊,使用您選擇的模型,在您的機器上自動化真實的多步驟工作流程。若要讓開放權重模型真正投入使用,而不只是閱讀基準測試表格,請下載 Eigent 並開始構建您自己的智能體工作流程。

Recent Posts

Augment Code 替代方案
Aug 3, 2026

Augment Code 替代方案

從目前定價、共享用量、上下文品質、原始碼存取、自行託管部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。

Douglas LaiDouglas Lai
最佳開源 AI 程式開發代理
Aug 3, 2026

最佳開源 AI 程式開發代理

依授權、介面、自行託管、模型選擇、審批機制、安全、維護與實際適用性,比較目前最佳開源 AI 程式開發代理。

Douglas LaiDouglas Lai
最佳開源 AI 銷售代理
Aug 3, 2026

最佳開源 AI 銷售代理

從聯絡人資料、外聯、CRM 工作流程、成本、控制與適用性,比較 AI 銷售代理堆疊及 11x、Artisan、Qualified Piper、Nooks、Rox。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即試用 Eigent

下載開源桌面 app。你的 AI workforce,直接在你電腦上運行。

下載 Eigent
Eigent

獲取 AI workforce 自動化的最新更新、教學與版本消息。

產品Eigent環境定價企業方案
探索解決方案使用案例技能外掛網誌
開發者文件GitHubCAMEL-AIOpen Source Fund合作夥伴
下載適用於開源版
公司關於我們品牌招聘使用條款私隱政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 新版本已發佈!download