logo
  • 環境
  • 企業方案
  • 價格
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型

一個高效的開放權重 MoE,以四分之一的規模媲美甚至超越 Inkling。

EigentEigent
Share to
Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型
  • 什麼是 Inkling-Small?
  • 關鍵亮點:小模型超越大模型
  • Inkling-Small 基準測試
  • 效率優勢:成本與算力
  • 多模態、認識論與安全性
  • 如何運行
  • 高效開放權重模型對 AI 智能體的意義
  • 用您自己的 AI 工作團隊付諸實踐
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab 發布了 Inkling-Small,這是一個開放權重的混合專家(Mixture-of-Experts,MoE)模型,擁有 2760 億個總參數,120 億個活躍參數——約為其首個模型 Inkling 規模的四分之一,但在推理和智能體編程方面的表現與之相當甚至更勝一籌。這裡的重點不在於規模,而在於效率。本指南涵蓋 Inkling-Small 的規格、發布時的基準測試數據、運行成本,以及高效開放權重模型對 AI 智能體開發者的意義。

什麼是 Inkling-Small?

Inkling-Small 是 Thinking Machines Lab 的第二個模型,該初創公司由前 OpenAI 首席技術官 Mira Murati 創立。它在 Inkling(該實驗室的首個開放權重發布)推出約兩週後面世,其核心理念只有一個:保留能力,削減算力。

以下是來自實驗室發布公告和模型說明卡的核心數據:

  • 2760 億個總參數,120 億個活躍參數——稀疏 MoE Transformer 架構。約為 Inkling 9750 億總參數 / 410 億活躍參數的四分之一。
  • 100 萬 Token 上下文窗口。
  • 原生多模態——可對文字、圖像和音頻進行推理,採用與 Inkling 相同的無編碼器架構。
  • 可變推理強度——可調節推理深度,在準確性與速度及成本之間取得平衡。
  • 基於 Apache 2.0 的開放權重,發布於 Hugging Face——包含用於高效推理的 NVFP4 量化檢查點。
  • 在 NVIDIA GB300 NVL72 系統上訓練。

在架構上,它是一個 42 層的僅解碼器 Transformer,將每個 Token 路由至 256 個專家中的 6 個,另加 2 個在每個 Token 上均活躍的共享專家(模型說明卡)。其 MoE 架構設計與 Inkling 一脈相承。

關鍵亮點:小模型超越大模型

令人驚喜的是,Inkling-Small 不僅僅是 Inkling 的近似版本——在多項基準測試中,它甚至領先。Thinking Machines 在發布公告中解釋了原因:Inkling-Small 的訓練開始於其更大兄弟之後,因此團隊得以改進預訓練數據組合和方案,然後使用**以 Inkling 為教師的在策略蒸餾(on-policy distillation)**對早期檢查點進行後訓練。此後,他們又進行了兩週的智能體編程強化學習擴展(發布公告)。

結果,用實驗室自己的話說:Inkling-Small 在推理和智能體編程方面超越了 Inkling,而 Inkling 在知識覆蓋範圍和事實準確性方面仍保持優勢。一個具體例子——在 Humanity's Last Exam(純文字)中,它的得分為 31.6%,高於 Inkling 的 29.7%,且實驗室報告稱在每個推理預算下均保持這一優勢。

Inkling-Small 基準測試

以下所有數據均來自發布公告,在推理強度 0.99 下運行。整體表現呈現出廣泛均衡的通才特質,而非針對排行榜的特化優化。涉及自報測試框架的情況,我們已作標注。

基準測試Inkling-SmallInkling備注
SWEBench Verified*80.2%77.6%智能體編程
Terminal Bench 2.1*(最佳測試框架)64.7%63.8%智能體工具使用
GPQA Diamond89.5%87.2%推理
HLE(純文字)31.6%29.7%推理
AIME 202695.5%97.1%數學
ARC-AGI-240.1%36.5%抽象推理
CritPt8.3%5.4%高難度物理
SimpleQA Verified20.6%43.9%事實準確性(Inkling 勝出)

*SWEBench Verified 和 Terminal Bench 2.1 使用實驗室自有的 Inkling 系列模型編程測試框架;外部模型使用自報數據。跨模型比較時請留意此注意事項——獨立驗證至關重要。

有兩點值得關注。第一,在對智能體最重要的編程和推理任務上,小模型的表現至少與大模型持平。第二,代價是事實準確性:在 SimpleQA Verified 上,Inkling-Small 下降至 20.6%,而 Inkling 為 43.9%——參數較少意味著記憶的世界知識較少,這正是檢索或工具發揮作用的地方。

與同等參數量級的競品相比,Inkling-Small 與 DeepSeek V4 Flash、Qwen3.5-397B-A17B 和 GLM 5.2 等開放權重模型具有競爭力——在不同基準測試中各有勝負,而非全面壓制。

效率優勢:成本與算力

真正的賣點在於性價比曲線。由於每個 Token 只有 120 億個參數處於活躍狀態,Inkling-Small 在相近質量水平下的服務成本低於 Inkling。

  • 輸出定價: Inkling-Small 標價為 每百萬 Token 1.20 美元,而 Inkling 為 每百萬 Token 4.05 美元(發布公告)——約為三分之一的成本。
  • 硬件門檻: BF16 檢查點至少需要 600 GB 聚合顯存(例如 4× NVIDIA B300 或 8× H200)。NVFP4 量化檢查點將此降至 180 GB,可在單張 B300 上運行(模型說明卡,MarkTechPost)。

單 GPU 路徑是小型團隊的重大突破:一個 2760 億參數的多模態模型,初創公司可以在一台租用的 B300 上自行部署,而無需前沿實驗室規模的集群。

多模態、認識論與安全性

多模態。 Inkling-Small 採用與 Inkling 相同的原生多模態、無編碼器設計——音頻以 dMel 頻譜圖形式處理,圖像分割為 40×40 像素塊——實驗室表示改進了模型使用 Python 處理視覺任務(如裁剪和縮放圖表及文件)的能力。在大多數多模態評估中,它以更低成本接近 Inkling 的表現。

認識論。 校準訓練採用強化學習,針對真實世界預測問題的適當評分規則進行優化。在 ForecastBench(無搜索)上,其 Brier Index 為 61.3 ± 0.46,略高於 Inkling 的 60.1(發布公告)。

安全性。 它繼承了 Inkling 的安全方案。StrongREJECT 達到 98.4%,在 FORTRESS 上得分為 71.6%(對抗性)/ 96.9%(良性)。實驗室建議在面向消費者的部署中疊加下游審核機制,例如 Llama Guard(MarkTechPost)。與 Inkling 一樣,對開放權重進行微調的團隊需自行承擔其定制版本的安全責任。

如何運行

您有三種途徑(模型說明卡):

  1. 從 Hugging Face 下載權重——BF16 或 NVFP4 量化檢查點。
  2. 在 Tinker 上進行微調,這是實驗室的微調平台,同時提供 API 訪問和支持文字、圖像及音頻對話的 Playground。
  3. 通過 API 使用第三方推理服務商,適合不希望自行部署的團隊。

高效開放權重模型對 AI 智能體的意義

對於構建智能體的團隊而言,Inkling-Small 深化了 Inkling 開啟的轉變:您可以在自己的基礎設施上運行一個功能強大的多模態模型,針對您的領域進行微調,並保持結果私密——無需按 API 調用次數向封閉服務商付費。現在的不同之處在於經濟性。四分之一規模的模型、三分之一的價格,加上單 GPU 量化路徑,將自行部署從「前沿實驗室預算」降至「一個租用實例」的門檻。

可變推理強度是原生智能體功能:在複雜規劃步驟時放慢模型速度,在簡單步驟時加快速度,全部在您自己的循環內完成——這正是長期、多步驟工作流程所需要的。如果您正在比較開放選項,我們關於原版 Thinking Machines Inkling 的文章更深入地介紹了更大的模型及其自行微調的理念。

用您自己的 AI 工作團隊付諸實踐

Inkling-Small 的核心前提——高效、可自行部署、可按需定制的模型優於千篇一律的方案——與 Eigent 背後的理念如出一轍。Eigent 是一款開源的「Cowork」桌面應用,可在本地運行多智能體 AI 工作團隊。Inkling-Small 是您進行微調的基礎模型,而 Eigent 則是其上的工作力層:一支智能體團隊,使用您選擇的模型,在您的機器上自動化真實的多步驟工作流程。若要讓開放權重模型真正投入使用,而不只是閱讀基準測試表格,請下載 Eigent 並開始構建您自己的智能體工作流程。

Recent Posts

Meta Muse:預訂、購物、議價的個人 AI 代理
Sep 9, 2026

Meta Muse:預訂、購物、議價的個人 AI 代理

Meta Muse 是一款個人 AI 代理,可透過對話介面預訂旅程、購買商品及協商帳單。本文涵蓋其功能、定價、安全性及比較分析。

EigentEigent
Eigent v1.0.4 版本更新說明:技能與連接器儀表板、穩定的多輪執行
產品Sep 4, 2026

Eigent v1.0.4 版本更新說明:技能與連接器儀表板、穩定的多輪執行

Eigent v1.0.4 將技能與連接器重建為管理儀表板,並強化多輪代理工作、工作區檢查點、連接器狀態與應用程式結束流程。

Douglas LaiDouglas Lai
Claude Fable 5.1 與 Mythos 5.1:全新功能詳解
Sep 3, 2026

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解

Claude Fable 5.1 與 Mythos 5.1 詳解:同一模型分兩個安全防護層級,附全新基準測試結果、成本降低約 25 至 45%,以及存取詳情。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即試用 Eigent

下載開源桌面 app。你的 AI workforce,直接在你電腦上運行。

下載 Eigent
Eigent

獲取 AI workforce 自動化的最新更新、教學與版本消息。

感謝訂閱!

產品Eigent環境定價企業方案
探索解決方案使用案例技能外掛網誌
開發者文件GitHubCAMEL-AIOpen Source Fund合作夥伴
下載適用於開源版
公司關於我們品牌招聘使用條款私隱政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD