Muse Spark 1.3:Meta 前沿編程與智能代理模型詳解
Meta 五個月內第四次發布 Muse Spark,登頂智能代理工作基準測試,定價維持不變,最高推理版本限量預覽中。

Muse Spark 1.3 是 Meta 最新的前沿編程與智能代理工作模型,於 2026 年 9 月 2 日發布——這是 Meta 五個月內推出的第四個 Muse Spark 模型。重點摘要:其頂級版本在主要智能指數中緊隨 Claude 之後,在關鍵智能代理工作基準測試中奪得第一,且以同類模型中最低的每任務成本實現這一成績。以下是 Muse Spark 1.3 相較於 Muse Spark 1.2 的變化、兩個版本的差異、基準測試結果、定價,以及對構建智能代理的開發者而言的適用場景。
Muse Spark 1.3 是什麼?
Muse Spark 1.3 是 Meta 的推理模型(reasoning model),專為長周期編程與智能代理工作流程而優化。它支持文字、圖像和視頻輸入,擁有 100 萬 token 的上下文窗口,並於發布當日起在 Muse Code 和 Meta 的模型 API 上正式提供。
Meta 的定位是:該模型通過與用戶協作、在單一長線程中同時處理多個工作流程,以維持更長時間的工作。實際上,這意味著當提示語(prompt)模糊時主動提問、遇到困難時尋求協助,以及在執行重要操作前進行確認——這些行為專為長時間運行的智能代理設計,而非一次性對話。
Meta AI 負責人 Alexandr Wang 向 Axios 表示,此次更新"與前沿模型極具競爭力",並有助於推動個人智能代理等產品的發展。此次發布恰逢 Google 的 Gemini 3.8 Flash 和 Anthropic 的 Claude Fable 5.1 同期推出——模型發布的密集時期。
兩個版本:xhigh 與 max
Muse Spark 1.3 以兩個模型形式發布,推理預算各有不同:
- Muse Spark 1.3 (xhigh) — 現已在 Muse Code 和 API 中提供。
- Muse Spark 1.3 (max) — 更高算力版本,目前向 Meta 合作夥伴限量預覽,完成額外安全測試後將更廣泛推出。
兩者的區別在於推理深度。在 Artificial Analysis 智能指數上,xhigh 得分 61,max 得分 62。max 版本通過消耗更多資源達到更高分數——在一項智能代理評估中比 xhigh 多消耗約 62% 的推理資源,在另一項中多消耗約 28%。若追求最佳結果且能承受 token 成本,max 是目標選擇;若追求當前可用的性價比最優方案,xhigh 則是首選。
基準測試:Muse Spark 1.3 達到前沿水準
在 Artificial Analysis 智能指數上,Muse Spark 1.3 (xhigh) 以 61 分入榜——比 Muse Spark 1.2(57 分)高 4 分,比 Muse Spark 1.1(53 分)高 8 分。它與 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 並列。max 版本以 62 分僅次於 Claude Fable 5.1 和 Claude Opus 5,位居指數頂端。
大部分提升來自智能代理和科學任務,而非純粹的知識廣度。
| 基準測試 | Muse Spark 1.2 | 1.3 (xhigh) | 1.3 (max) |
|---|---|---|---|
| Tau3-Bench Banking | 35% | 47% | 52% |
| Terminal-Bench 2.1 | 80% | 85% | 86% |
| GDPval-AA v2 (Elo) | 1,615 | 1,709 | 1,754 |
| CritPt(科學推理) | 18% | 26% | ~25% |
| GPQA Diamond | 90% | 94% | 94% |
資料來源:Artificial Analysis,2026 年 9 月 2 日。
最突出的是 Tau3-Bench Banking:max 版本的 52% 是所有模型中的第一名,而相較 Muse Spark 1.2 提升的 12 至 17 個百分點,是推動指數整體提升的最大單一因素。科學推理能力全面提升,其中 xhigh 的 CritPt 得分提高了 8 個百分點。
Meta 未重點宣傳的性能回退
兩項基準測試相較 Muse Spark 1.2 出現倒退。兩個版本在 AA-LCR 上均下降 4 分(從 83% 降至 79%),AA-Omniscience(準確率) 方面,xhigh 下降 3 分,max 下降 1 分。根據 Artificial Analysis 的分析,Omniscience 的下降源於更高的棄答率——即模型在不確定時拒絕作答——這同時也降低了幻覺(hallucination)率。對於智能代理工作而言,這可以說是一項優點:一個說「我不知道」而非自信猜測的模型,在執行長期重要任務時更為安全。
Meta 表示,Muse Spark 1.3 的訓練目標之一是讓模型更清楚地了解自身的知識邊界,並在遇到瓶頸時主動標記,而非虛構結果——這與上述棄答行為一致。
定價:同類前沿模型中每任務成本最低
定價與 Muse Spark 1.2 保持不變:每 100 萬輸入 token 收費 $1.25,每 100 萬輸出 token 收費 $4.25,快取命中(cache hit)折扣至每 100 萬 $0.15。Wang 將此定價形容為「具攻擊性」。
關鍵比較在於每任務成本。Artificial Analysis 測量 Muse Spark 1.3 (xhigh) 的每智能指數任務成本為 $0.55——是所有得分 59 分及以上模型中最低的。同分的競品成本遠高於此:Grok 4.6 (high) 為 $0.94,GPT-5.6 Sol (max) 為 $0.95,溢價超過 70%。Meta 尚未公布 max 版本的定價。
需要注意的是:每任務成本相較 Muse Spark 1.2($0.40)有所上升,因為新模型每項智能代理任務消耗的輸入 token 增加了約 57%。它比同類競品便宜,但不比前代便宜。
編程能力的變化
Meta 表示,Muse Spark 1.3 在更多長周期編程任務上進行了訓練,在實際工程工作中更易使用。相較 Muse Spark 1.2,它在不必要時減少了對話輪次,表達更簡潔,編程風格更清晰。在 Meta 自身的工程師對比測試中,它減少了約 20% 的工具調用次數和約 25% 的 token 消耗——這種效率在長時間的智能代理運行中積累效果顯著。
Meta 還報告了與智能代理最相關的安全改進:更強的抗提示注入(prompt injection)和對抗性輸入能力,以及在執行前對不可逆操作的更好判斷。
與其他模型的比較
Muse Spark 1.3 (xhigh) 最適合定位為前沿邊緣的高性價比選擇:在指數上與 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 並列,每任務成本領先,在智能代理銀行任務上位居榜首。它在整體指數上落後於 Claude Fable 5.1(66 分)和 Claude Opus 5(63 分)——因此,若不計成本追求最強模型,Claude 仍然領先;若追求最低成本的前沿級智能代理性能,Muse Spark 1.3 則是最突出的選擇。
如需本週發布模型的詳細對比,請參閱我們的 Muse Spark 1.3 vs Gemini 3.8 Flash vs Claude Fable 5.1 比較文章。
未來展望
Meta 表示其路線圖包括更大規模的模型以及 Muse Spark 開放權重版本的發布。這延續了 Meta 於八月推出的 Muse Glimmer——一個從 Muse Spark 蒸餾而來的 300 億參數開放權重模型——開放權重系列看來將持續擴展。Wang 亦指出,安全性是目前最重要的內部議題之一,並表示 Meta 正在開發更強大的模型。
總結
Muse Spark 1.3 標誌著 Meta 在智能代理與編程工作上以真正具競爭力的價格達到前沿水準。xhigh 版本現已可用,在其智能等級的所有模型中提供最低的每任務成本;max 版本在指數上緊隨 Claude 之後位居頂端。需要誠實說明的是:基準測試結果尚屬早期,每任務成本相較 1.2 版本有所上升,且兩項評估指標略有回退。但若您構建智能代理並重視每美元的長周期可靠性,它值得列入您的候選名單。
在 AI 工作團隊中使用 Muse Spark 1.3
像 Muse Spark 1.3 這樣的前沿模型,只有接入真實工作流程——工具、文件、代碼審查和多步驟計劃——而非僅用於對話窗口,才能真正發揮價值。Eigent 是一款開源的協作桌面應用,可在本地運行多智能代理 AI 工作團隊,且與模型無關,讓您可以將合適的模型分配給每項任務,同時將敏感工作保留在自己的設備上。了解智能代理如何端到端地審查 GitHub PR,然後下載 Eigent 立即體驗。
常見問題
Muse Spark 1.3 是什麼?
Muse Spark 1.3 是 Meta 的前沿推理模型,專為編程和智能代理工作設計,於 2026 年 9 月 2 日發布。它支持文字、圖像和視頻輸入,擁有 100 萬 token 的上下文窗口,可在 Muse Code 和 Meta 的模型 API 中使用。這是 Meta 五個月內推出的第四個 Muse Spark 版本。
Muse Spark 1.3 xhigh 和 max 有什麼區別?
兩者的區別在於推理預算。Muse Spark 1.3 (xhigh) 現已可用,在 Artificial Analysis 智能指數上得分 61。Muse Spark 1.3 (max) 是更高算力的限量預覽版本,通過消耗顯著更多的推理 token 達到 62 分,將在額外安全測試後更廣泛推出。
Muse Spark 1.3 的定價是多少?
xhigh 版本的定價與 Muse Spark 1.2 相同:每 100 萬輸入 token $1.25,每 100 萬輸出 token $4.25,快取命中為每 100 萬 $0.15。Artificial Analysis 測量其每智能指數任務成本為 $0.55——是所有得分 59 分及以上模型中最低的。max 版本的定價尚未公布。
Muse Spark 1.3 比 Muse Spark 1.2 更好嗎?
在大多數任務上是的。xhigh 版本在指數上提升了 4 分,並在智能代理基準測試上取得大幅進步——Tau3-Bench Banking 從 35% 升至 47%,Terminal-Bench 2.1 從 80% 升至 85%。兩項評估指標略有回退(AA-LCR 和 AA-Omniscience),且由於消耗更多輸入 token,每任務成本有所上升。
Muse Spark 1.3 與 Claude 和 GPT 相比如何?
Muse Spark 1.3 (xhigh) 在智能指數上與 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 並列 61 分,但每任務成本遠低於它們。max 版本以 62 分僅次於 Claude Fable 5.1(66 分)和 Claude Opus 5(63 分)。Claude 在整體指數上仍然領先;Muse Spark 在每任務成本和 Tau3-Bench Banking 智能代理評估上領先。
Muse Spark 1.3 會開放權重嗎?
Meta 已表示開放權重版本的 Muse Spark 在其路線圖上,延續其於八月推出的 300 億參數開放權重 Muse Glimmer 模型。Muse Spark 1.3 開放權重的具體日期尚未公布。
Recent Posts

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解
Claude Fable 5.1 與 Mythos 5.1 詳解:同一模型分兩個安全防護層級,附全新基準測試結果、成本降低約 25 至 45%,以及存取詳情。

Gemini 3.8 Flash:編程與 AI 代理的全新升級
Gemini 3.8 Flash 在保持低價的同時,大幅提升編程與代理推理能力,並推出全新 3.8 Flash Cyber 變體。涵蓋基準測試、定價及使用方法。

GPT-6 Astra:OpenAI 全新模型的真實能力
GPT-6 Astra 是 OpenAI 的全新旗艦模型。本文詳解其功能、基準測試表現、定價方案,以及 AGI 標題背後的注意事項。