logo
  • 环境
  • 企业版
  • 价格
Blogs
Sep 3, 2026

Muse Spark 1.3:Meta 前沿编程与智能体模型详解

Meta 五个月内第四次发布 Muse Spark,登顶智能体任务基准榜首——定价不变,最强推理变体限量预览。

EigentEigent
Share to
Muse Spark 1.3:Meta 前沿编程与智能体模型详解
  • Muse Spark 1.3 是什么?
  • 两个变体:xhigh 与 max
  • 基准测试:Muse Spark 1.3 如何跻身前沿
  • Meta 未重点宣传的性能回退
  • 定价:同类前沿模型中单任务成本最低
  • 编程能力的变化
  • 与其他模型的横向比较
  • 后续规划
  • 总结
  • 在 AI 工作团队中使用 Muse Spark 1.3
  • 常见问题
Automate Everything with
AI Workforce on Desktop
Download Eigent

Muse Spark 1.3 是 Meta 面向编程与智能体(agentic)工作的最新前沿模型,于 2026 年 9 月 2 日发布——这是 Meta 五个月内推出的第四款 Muse Spark 模型。核心亮点:顶级变体在主流智能指数榜单上紧追 Claude,在关键智能体任务基准中拿下第一,且同类模型中单任务成本最低。以下是 Muse Spark 1.3 相较于 1.2 版本的变化、两个变体的区别、基准测试结果、定价详情,以及对 AI 智能体开发者的参考价值。

Muse Spark 1.3 是什么?

Muse Spark 1.3 是 Meta 推出的推理模型,专为长周期编程和智能体工作流而优化。它支持文本、图像和视频输入,拥有 100 万 token 的上下文窗口,并于发布当天即可通过 Muse Code 和 Meta 模型 API 使用。

Meta 的官方定位是:该模型通过与用户协作、在单一长线程中并行处理多个工作流,从而支撑更长时间的持续工作。实际表现为:在提示语模糊时主动提问、遇到瓶颈时寻求帮助、在执行高影响操作前进行确认——这些行为专为长时间运行的智能体而设计,而非一次性对话。

Meta AI 负责人 Alexandr Wang 在接受 Axios 采访时表示,此次更新"与前沿模型极具竞争力",并有助于推动个人智能体等产品落地。此次发布恰逢 Google Gemini 3.8 Flash 和 Anthropic Claude Fable 5.1 同期上线,堪称模型发布的密集周。

两个变体:xhigh 与 max

Muse Spark 1.3 以两种模型形式发布,推理预算各有不同:

  • Muse Spark 1.3 (xhigh) — 现已在 Muse Code 和 API 中正式上线。
  • Muse Spark 1.3 (max) — 更高算力的变体,目前向 Meta 合作伙伴限量预览,完成额外安全测试后将更广泛推出。

两者的区别在于推理深度。在 Artificial Analysis 智能指数上,xhigh 得分 61,max 得分 62。max 变体通过更多算力投入实现更高分数——在一项智能体评测中推理消耗约多 62%,在另一项中约多 28%。如果追求最佳效果且能承受更高 token 成本,max 是目标选择;如果追求当前可用的性价比最优解,xhigh 更合适。

基准测试:Muse Spark 1.3 如何跻身前沿

在 Artificial Analysis 智能指数上,Muse Spark 1.3 (xhigh) 入榜得分 61——较 Muse Spark 1.2(57 分)提升 4 分,较 Muse Spark 1.1(53 分)提升 8 分。与 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 并列。max 变体以 62 分仅次于 Claude Fable 5.1 和 Claude Opus 5,位居榜单前列。

大部分提升来自智能体任务和科学推理,而非纯粹的知识储备。

基准测试Muse Spark 1.21.3 (xhigh)1.3 (max)
Tau3-Bench Banking35%47%52%
Terminal-Bench 2.180%85%86%
GDPval-AA v2 (Elo)1,6151,7091,754
CritPt(科学推理)18%26%~25%
GPQA Diamond90%94%94%

数据来源:Artificial Analysis,2026 年 9 月 2 日。

最突出的是 Tau3-Bench Banking:max 变体以 52% 位居所有模型第一,较 Muse Spark 1.2 提升 12 至 17 个百分点,是本次指数提升的最大驱动力。科学推理能力全面提升,xhigh 在 CritPt 上提升 8 分尤为显著。

Meta 未重点宣传的性能回退

与 Muse Spark 1.2 相比,有两项基准出现下滑。两个变体在 AA-LCR 上均下降 4 分(从 83% 降至 79%),AA-Omniscience(准确率) 方面 xhigh 下降 3 分,max 下降 1 分。据 Artificial Analysis 分析,全知性下降源于更高的弃答率——即模型在不确定时选择不作答——同时也降低了幻觉率。对于智能体工作而言,这或许是一个优点:一个说"我不知道"而非自信猜测的模型,在执行长期高影响任务时更为可靠。

Meta 表示,Muse Spark 1.3 经过训练后对自身知识边界有更清晰的认知,并会在遇到瓶颈时主动标记,而非凭空捏造结果——与上述弃答行为一致。

定价:同类前沿模型中单任务成本最低

定价与 Muse Spark 1.2 保持不变:输入 $1.25/百万 token,输出 $4.25/百万 token,缓存命中折扣至 $0.15/百万 token。Wang 将此定价定性为"激进"。

更关键的对比维度是单任务成本。Artificial Analysis 测算 Muse Spark 1.3 (xhigh) 的单智能指数任务成本为 $0.55——是所有得分 59 分及以上模型中最低的。同分段竞品成本远高于此:Grok 4.6 (high) 为 $0.94,GPT-5.6 Sol (max) 为 $0.95,溢价超过 70%。Meta 尚未公布 max 变体的定价。

需要注意的是:与 Muse Spark 1.2($0.40)相比,单任务成本有所上升,因为新模型每项智能体任务消耗的输入 token 约多 57%。它比同类竞品更便宜,但不比上一代更便宜。

编程能力的变化

Meta 表示,Muse Spark 1.3 在更多长周期编程任务上进行了训练,在实际工程工作中更易用。与 Muse Spark 1.2 相比,它在不必要时减少了轮次交互,输出更简洁,编程风格更清晰。在 Meta 内部工程师对比测试中,工具调用次数减少约 20%,token 消耗减少约 25%——这种效率提升在长时间智能体运行中积累效果显著。

Meta 还报告了与智能体最相关的安全改进:对提示注入(prompt injection)和对抗性输入的抵抗力更强,以及在执行不可逆操作前的判断校准更准确。

与其他模型的横向比较

Muse Spark 1.3 (xhigh) 最准确的定位是前沿边缘的性价比之选:在指数上与 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 并列,单任务成本领先,在智能体银行任务上位居榜首。它在综合指数上落后于 Claude Fable 5.1(66 分)和 Claude Opus 5(63 分)——如果不计成本追求最强模型,Claude 仍是首选;如果追求最低成本下的前沿级智能体性能,Muse Spark 1.3 是最突出的选择。

关于本周发布模型的详细对比,请参阅我们的 Muse Spark 1.3 vs Gemini 3.8 Flash vs Claude Fable 5.1 对比文章。

后续规划

Meta 表示其路线图包括更大规模的模型以及 Muse Spark 开放权重版本。此前 Meta 于 8 月发布了从 Muse Spark 蒸馏而来的 300 亿参数开放权重模型 Muse Glimmer,开放权重系列看来将持续扩展。Wang 还特别指出安全性是当前内部最重要的议题之一,并表示 Meta 有更强大的模型正在研发中。

总结

Muse Spark 1.3 标志着 Meta 在智能体与编程工作上以极具竞争力的价格跻身前沿。xhigh 变体今日即可使用,在同智能层级模型中提供最低的单任务成本;max 变体在指数上紧追 Claude 顶部位置。需要客观说明的是:基准测试结果尚属早期,单任务成本较 1.2 版本有所上升,且有两项评测出现小幅回退。但如果你构建智能体并关注每美元的长周期可靠性,它值得列入候选名单。

在 AI 工作团队中使用 Muse Spark 1.3

像 Muse Spark 1.3 这样的前沿模型,只有接入真实工作流——工具调用、文件处理、代码审查、多步骤规划——才能真正发挥价值,而不是停留在对话窗口中。Eigent 是一款开源的协作桌面应用,可在本地运行多智能体 AI 工作团队,且与模型无关,让你为每项任务选择最合适的模型,同时将敏感工作保留在自己的机器上。了解智能体如何端到端地审查 GitHub PR,然后下载 Eigent 立即体验。

常见问题

Muse Spark 1.3 是什么?

Muse Spark 1.3 是 Meta 面向编程与智能体工作的前沿推理模型,于 2026 年 9 月 2 日发布。它支持文本、图像和视频输入,拥有 100 万 token 的上下文窗口,可通过 Muse Code 和 Meta 模型 API 使用。这是 Meta 五个月内发布的第四款 Muse Spark 模型。

Muse Spark 1.3 xhigh 和 max 有什么区别?

两者的区别在于推理预算。Muse Spark 1.3 (xhigh) 现已正式上线,在 Artificial Analysis 智能指数上得分 61。Muse Spark 1.3 (max) 是限量预览的高算力变体,通过消耗更多推理 token 达到 62 分,将在额外安全测试后更广泛推出。

Muse Spark 1.3 的价格是多少?

xhigh 变体的定价与 Muse Spark 1.2 保持不变:输入 $1.25/百万 token,输出 $4.25/百万 token,缓存命中为 $0.15/百万 token。Artificial Analysis 测算其单智能指数任务成本为 $0.55——是所有得分 59 分及以上模型中最低的。max 变体的定价尚未公布。

Muse Spark 1.3 比 Muse Spark 1.2 更好吗?

在大多数任务上是的。xhigh 变体在指数上提升 4 分,在智能体基准上大幅跃升——Tau3-Bench Banking 从 35% 升至 47%,Terminal-Bench 2.1 从 80% 升至 85%。有两项评测出现小幅回退(AA-LCR 和 AA-Omniscience),且由于输入 token 消耗增加,单任务成本有所上升。

Muse Spark 1.3 与 Claude 和 GPT 相比如何?

Muse Spark 1.3 (xhigh) 在智能指数上与 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 并列 61 分,但单任务成本远低于后两者。max 变体以 62 分仅次于 Claude Fable 5.1(66 分)和 Claude Opus 5(63 分)。Claude 在综合指数上仍居首位;Muse Spark 在单任务成本和 Tau3-Bench Banking 智能体评测上领先。

Muse Spark 1.3 会开放权重吗?

Meta 已表示开放权重版 Muse Spark 在其路线图中,此前 Meta 于 8 月发布了 300 亿参数的开放权重模型 Muse Glimmer。Muse Spark 1.3 开放权重版的具体发布日期尚未公布。

Recent Posts

Claude Fable 5.1 与 Mythos 5.1:新功能详解
Sep 3, 2026

Claude Fable 5.1 与 Mythos 5.1:新功能详解

Claude Fable 5.1 与 Mythos 5.1 详解:同一模型的两个安全防护层级,附最新基准测试成绩、约 25% 至 45% 的成本降幅及访问方式说明。

EigentEigent
Gemini 3.8 Flash:编程与 AI 智能体的全新升级
Sep 3, 2026

Gemini 3.8 Flash:编程与 AI 智能体的全新升级

Gemini 3.8 Flash 在保持与 3.7 Flash 相同低价的前提下,大幅提升了编程能力和智能体推理能力,并推出全新的 3.8 Flash Cyber 变体。本文涵盖基准测试、定价及使用方法。

EigentEigent
GPT-6 Astra:OpenAI 新模型究竟能做什么
Sep 3, 2026

GPT-6 Astra:OpenAI 新模型究竟能做什么

GPT-6 Astra 是 OpenAI 的全新旗舰模型。本文详解其功能、基准测试表现、定价方案,以及 AGI 相关报道背后的注意事项。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

感谢订阅!

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD