Thinking Machines Inkling-Small:一个超越其更大兄弟的276B模型
一个高效的开放权重MoE模型,以四分之一的规模匹敌甚至超越Inkling。

Thinking Machines Lab发布了Inkling-Small,这是一个开放权重的混合专家(Mixture-of-Experts,MoE)模型,拥有2760亿总参数,120亿激活参数——约为其首款模型Inkling规模的四分之一,但在推理和智能体编程方面的表现与Inkling不相上下,甚至有所超越。这里的核心不在于规模,而在于效率。本文将介绍Inkling-Small的规格参数、发布时公布的基准测试数据、运行成本,以及对于正在构建AI智能体的开发者而言,一个高效的开放权重模型意味着什么。
什么是Inkling-Small?
Inkling-Small是Thinking Machines Lab推出的第二款模型,该公司由前OpenAI首席技术官Mira Murati创立。它在Inkling——该实验室首个开放权重版本——发布约两周后问世,其核心理念只有一个:保留能力,削减算力。
- 2760亿总参数,120亿激活参数——稀疏MoE Transformer架构。约为Inkling(9750亿总参数/410亿激活参数)的四分之一。
- 100万token上下文窗口。
- 原生多模态——与Inkling采用相同的无编码器架构,支持对文本、图像和音频进行推理。
- 可变推理强度——可调节推理深度,在精度与速度、成本之间灵活权衡。
- 基于Apache 2.0协议的开放权重,已上传至Hugging Face——包含用于高效推理的NVFP4量化检查点。
- 在NVIDIA GB300 NVL72系统上完成训练。
从架构角度看,这是一个42层仅解码器Transformer,每个token被路由至256个专家中的6个,另有2个共享专家对每个token始终激活(模型卡)。其MoE设计方案与Inkling一脉相承。
关键亮点:小模型超越大模型
令人惊喜的是,Inkling-Small不仅仅是对Inkling的近似——在多项基准测试中,它实际上领先于Inkling。Thinking Machines在发布公告中解释了原因:Inkling-Small的训练启动时间晚于其更大的兄弟模型,因此团队得以优化预训练数据配比和训练方案,并通过**以Inkling为教师模型的在线策略蒸馏(on-policy distillation)**对早期检查点进行后训练。此后,他们又对智能体编程强化学习进行了两周的扩展训练(发布公告)。
用该实验室自己的话来说:Inkling-Small在推理和智能体编程方面超越了Inkling,而Inkling在知识覆盖度和事实准确性方面仍保持优势。一个具体的例子——在Humanity's Last Exam(纯文本)测试中,Inkling-Small得分31.6%,高于Inkling的29.7%,且该实验室报告称这一优势在各个推理预算级别下均成立。
Inkling-Small基准测试
以下所有数据均来自发布公告,在推理强度0.99下运行。整体表现呈现出广泛均衡的通才特征,而非针对特定排行榜的极端优化。涉及自报告测试框架的情况,我们会特别标注。
| 基准测试 | Inkling-Small | Inkling | 备注 |
|---|---|---|---|
| SWEBench Verified* | 80.2% | 77.6% | 智能体编程 |
| Terminal Bench 2.1*(最佳框架) | 64.7% | 63.8% | 智能体工具使用 |
| GPQA Diamond | 89.5% | 87.2% | 推理能力 |
| HLE(纯文本) | 31.6% | 29.7% | 推理能力 |
| AIME 2026 | 95.5% | 97.1% | 数学 |
| ARC-AGI-2 | 40.1% | 36.5% | 抽象推理 |
| CritPt | 8.3% | 5.4% | 高难度物理 |
| SimpleQA Verified | 20.6% | 43.9% | 事实准确性(Inkling胜出) |
*SWEBench Verified和Terminal Bench 2.1使用该实验室针对Inkling系列模型的自有编程测试框架;外部模型使用自报告数据。进行跨模型比较时请注意这一局限性——独立验证至关重要。
有两点值得关注。第一,在对智能体最重要的编程和推理任务上,小模型的表现至少与大模型持平。第二,代价在于事实准确性:在SimpleQA Verified测试中,Inkling-Small仅得20.6%,而Inkling达43.9%——参数量更少意味着记忆的世界知识更少,这正是检索增强或工具调用发挥价值的场景。
与同等参数量级的竞品相比,Inkling-Small与DeepSeek V4 Flash、Qwen3.5-397B-A17B和GLM 5.2等开放权重模型具有竞争力,在不同基准测试上互有胜负,并无全面碾压之势。
效率优势:成本与算力
真正的卖点在于性价比曲线。由于每个token仅激活120亿参数,在相近质量水平下,Inkling-Small的服务成本低于Inkling。
- 输出定价: Inkling-Small标价1.20美元/百万token,而Inkling为4.05美元/百万token(发布公告)——约为后者的三分之一。
- 硬件门槛: BF16检查点至少需要600 GB聚合显存(例如4块NVIDIA B300或8块H200)。NVFP4量化检查点将这一需求降至180 GB,可在单块B300上运行(模型卡,MarkTechPost)。
单GPU部署路径对小型团队而言意义重大:一个2760亿参数的多模态模型,初创公司可以在一台租用的B300上自行托管,而无需依赖前沿实验室级别的算力集群。
多模态、认知校准与安全性
多模态能力。 Inkling-Small采用与Inkling相同的原生多模态无编码器设计——音频以dMel频谱图形式处理,图像切分为40×40的图块——该实验室表示改进了模型利用Python处理视觉任务的能力,例如对图表和文档进行裁剪和局部放大。在大多数多模态评测中,它以更低成本接近Inkling的表现。
认知校准。 校准训练采用强化学习方法,基于真实世界预测问题的适当评分规则进行训练。在ForecastBench(无搜索)测试中,Brier指数为61.3 ± 0.46,略优于Inkling的60.1(发布公告)。
安全性。 它继承了Inkling的安全方案。StrongREJECT得分为98.4%,FORTRESS测试中对抗性得分71.6%,良性得分96.9%。该实验室建议在面向消费者的部署中叠加下游内容审核机制,例如Llama Guard(MarkTechPost)。与Inkling一样,对开放权重进行微调的团队需自行承担其定制版本的安全责任。
如何运行
您有三种部署路径(模型卡):
- 从Hugging Face下载权重——BF16版本或NVFP4量化检查点。
- 在Tinker上进行微调,这是该实验室的微调平台,同时提供API访问和支持文本、图像、音频对话的Playground。
- 通过第三方推理服务商的API——适合不希望自行托管的团队。
高效开放权重模型对AI智能体的意义
对于构建智能体的团队而言,Inkling-Small深化了Inkling开创的转变:您可以在自有基础设施上运行一个功能强大的多模态模型,针对特定领域进行微调,并对结果保密——无需按API调用次数向封闭服务商付费。现在的区别在于经济性。四分之一规模的模型、三分之一的价格,加上单GPU量化部署路径,将自托管从"前沿实验室预算"的门槛降低到"一台租用实例"的水平。
可变推理强度是面向智能体原生设计的核心功能:在复杂规划步骤中放慢模型速度,在简单步骤中加快速度,全程在您自己的循环中控制——这正是长流程、多步骤工作流所需要的。如果您正在比较开放权重模型的选项,我们关于原版Thinking Machines Inkling的文章对更大的模型及其"自行微调"理念有更深入的介绍。
用您自己的AI工作团队付诸实践
Inkling-Small的核心理念——一个您可以自主定制的高效自托管模型,胜过千篇一律的通用方案——与Eigent背后的理念不谋而合。Eigent是一款开源"协作"桌面应用,可在本地运行多智能体AI工作团队。Inkling-Small是您进行微调的基础模型,而Eigent则是其上的工作力层:一支能够在您的机器上使用您选择的模型自动化真实多步骤工作流的智能体团队。如果您想让开放权重模型真正投入使用,而不只是停留在阅读基准测试数据的阶段,请下载Eigent,开始构建您自己的智能体工作流。
Recent Posts

Augment Code 替代方案
从目前定价、共享用量、上下文品质、源代码存取、自托管部署、安全性与团队适配度,比较大型代码库的 Augment Code 替代方案。

最佳开源 AI 编程代理
依授权、介面、自托管、模型选择、审批机制、安全、维护与实际适用性,比较目前最佳开源 AI 编程代理。

最佳开源 AI 销售代理
从联络人资料、外联、CRM 工作流程、成本、控制与适用性,比较 AI 销售代理堆叠及 11x、Artisan、Qualified Piper、Nooks、Rox。