logo
  • 環境
  • 企業方案
  • 價格方案
Blogs
Sep 3, 2026

Muse Spark 1.3:Meta 前沿程式碼與智能代理模型完整解析

Meta 五個月內第四次發布 Muse Spark,登頂智能代理工作基準測試,定價維持不變,最高推理版本限量預覽中。

EigentEigent
Share to
Muse Spark 1.3:Meta 前沿程式碼與智能代理模型完整解析
  • 什麼是 Muse Spark 1.3?
  • 兩種版本:xhigh 與 max
  • 基準測試:Muse Spark 1.3 達到前沿水準
  • Meta 未主動宣傳的效能退步項目
  • 定價:每項任務成本最低的前沿級模型
  • 程式碼編寫能力的改進
  • 與其他模型的比較
  • 後續發展
  • 總結
  • 在 AI 工作團隊中運用 Muse Spark 1.3
  • 常見問題
Automate Everything with
AI Workforce on Desktop
Download Eigent

Muse Spark 1.3 是 Meta 最新的前沿程式碼與智能代理工作模型,於 2026 年 9 月 2 日發布,是 Meta 五個月內推出的第四款 Muse Spark 模型。重點摘要:頂級版本在主要智能指數上緊追 Claude,在關鍵智能代理工作基準測試中奪得第一,且每項任務的成本為同級模型中最低。以下將說明與 Muse Spark 1.2 的差異、兩種版本的比較、基準測試結果、定價,以及對於開發智能代理的人而言,它的定位為何。

什麼是 Muse Spark 1.3?

Muse Spark 1.3 是 Meta 推出的推理模型,專為長時程程式碼編寫與智能代理工作流程而優化。它支援文字、圖片與影片輸入,擁有 100 萬 token 的上下文視窗,並於發布當天即可在 Muse Code 和 Meta 的 Model API 上使用。

Meta 的定位是:這款模型的設計目標是透過與使用者協作、在單一長對話串中同時處理多個工作流程,來維持更長時間的工作持續性。實際上,這意味著當提示語意不明確時會主動提問、遇到瓶頸時會尋求協助,並在執行重要操作前先行確認——這些行為是針對長時間運行的智能代理所設計,而非一次性的對話互動。

Meta AI 負責人 Alexandr Wang 向 Axios 表示,此次更新「與前沿模型極具競爭力」,有助於為個人代理等產品鋪路,讓 AI 能代表使用者執行任務。此次發布恰逢 Google 推出 Gemini 3.8 Flash 及 Anthropic 發布 Claude Fable 5.1 的同一週,是模型發布相當密集的幾天。

兩種版本:xhigh 與 max

Muse Spark 1.3 以兩種模型形式發布,推理預算各有不同:

  • Muse Spark 1.3 (xhigh) — 現已在 Muse Code 和 API 上提供。
  • Muse Spark 1.3 (max) — 更高效能的版本,目前向 Meta 合作夥伴限量預覽,完成額外安全測試後將更廣泛推出。

兩者的差異在於推理深度。在 Artificial Analysis 智能指數上,xhigh 得分 61,max 得分 62。max 版本透過更多運算達到更高分數——在一項智能代理評估中比 xhigh 多消耗約 62% 的推理資源,在另一項評估中則多消耗約 28%。如果您追求最佳結果且能承擔 token 成本,max 是首選;如果您希望以現有最佳性價比使用,xhigh 是最合適的選擇。

基準測試:Muse Spark 1.3 達到前沿水準

在 Artificial Analysis 智能指數上,Muse Spark 1.3 (xhigh) 以 61 分進入排行——比 Muse Spark 1.2(57 分)高出 4 分,比 Muse Spark 1.1(53 分)高出 8 分。它與 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 並列。max 版本以 62 分僅次於 Claude Fable 5.1 和 Claude Opus 5,位居指數頂端。

大部分進步來自智能代理與科學推理任務,而非純粹的知識廣度。

基準測試Muse Spark 1.21.3 (xhigh)1.3 (max)
Tau3-Bench Banking35%47%52%
Terminal-Bench 2.180%85%86%
GDPval-AA v2 (Elo)1,6151,7091,754
CritPt(科學推理)18%26%~25%
GPQA Diamond90%94%94%

資料來源:Artificial Analysis,2026 年 9 月 2 日。

最突出的是 Tau3-Bench Banking:max 版本的 52% 是所有模型中的第一名,而比 Muse Spark 1.2 提升 12 至 17 個百分點,是推動指數進步的最大單一因素。科學推理能力全面提升,其中 xhigh 在 CritPt 上提升了 8 個百分點。

Meta 未主動宣傳的效能退步項目

與 Muse Spark 1.2 相比,有兩項基準測試出現退步。兩種版本在 AA-LCR 上均下降 4 分(從 83% 降至 79%),AA-Omniscience(準確率) 方面,xhigh 下降 3 分,max 下降 1 分。根據 Artificial Analysis 的說明,Omniscience 的下降源於更高的棄答率——即模型在不確定時選擇不回答——這同時也降低了幻覺(hallucination)發生率。對於智能代理工作而言,這可以說是一項優點:一個在不確定時說「我不知道」而非自信猜測的模型,在執行長時程重要任務時更為安全。

Meta 表示,Muse Spark 1.3 的訓練目標之一是讓模型更清楚自己知道什麼、不知道什麼,並在遇到瓶頸時主動標記,而非憑空捏造結果——這與上述棄答行為一致。

定價:每項任務成本最低的前沿級模型

定價與 Muse Spark 1.2 相同:每 100 萬輸入 token 收費 $1.25 美元,每 100 萬輸出 token 收費 $4.25 美元,快取命中折扣至每 100 萬 token $0.15 美元。Wang 將此定價形容為「積極進取」。

真正重要的比較是每項任務的成本。Artificial Analysis 測量 Muse Spark 1.3 (xhigh) 的每項智能指數任務成本為 $0.55 美元——是所有得分 59 分及以上模型中成本最低的。同樣得分 61 的直接競品成本遠高於此:Grok 4.6 (high) 為 $0.94 美元,GPT-5.6 Sol (max) 為 $0.95 美元,溢價超過 70%。Meta 尚未公布 max 版本的定價。

需要注意的是:與 Muse Spark 1.2($0.40 美元)相比,每項任務的成本有所上升,因為新模型每項智能代理任務消耗的輸入 token 約多出 57%。它比同級競品便宜,但不比前一代便宜。

程式碼編寫能力的改進

Meta 表示,Muse Spark 1.3 在更多長時程程式碼任務上進行了訓練,在實際工程工作中更易於使用。與 Muse Spark 1.2 相比,它在不必要時減少了對話輪次、輸出更為精簡,且程式碼風格更為整潔。在 Meta 自家工程師的對比測試中,工具呼叫次數減少約 20%,token 使用量減少約 25%——這種效率在長時間的智能代理運行中累積效果顯著。

Meta 也報告了與智能代理最相關的安全性改進:對提示注入(prompt injection)和對抗性輸入的抵抗力更強,以及在執行操作前對不可逆行為的判斷校準更佳。

與其他模型的比較

Muse Spark 1.3 (xhigh) 最適合被定位為前沿邊緣的高性價比選擇:在指數上與 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 並列,每項任務成本領先,並在智能代理銀行業務任務上位居第一。它在整體指數上落後於 Claude Fable 5.1(66 分)和 Claude Opus 5(63 分)——因此,如果您不計成本只求最強模型,Claude 仍然領先;如果您希望以最低成本獲得前沿級智能代理效能,Muse Spark 1.3 是最突出的選擇。

關於本週發布模型的詳細對比,請參閱我們的 Muse Spark 1.3 vs Gemini 3.8 Flash vs Claude Fable 5.1 比較文章。

後續發展

Meta 表示其路線圖包括更大型的模型以及 Muse Spark 開放權重版本。這延續了 Meta 在八月發布的 Muse Glimmer——一個從 Muse Spark 蒸餾而來的 300 億參數開放權重模型——因此開放權重系列看來將持續擴展。Wang 也強調安全性是目前最重要的內部議題之一,並指出 Meta 正在開發更強大的模型。

總結

Muse Spark 1.3 代表 Meta 在智能代理與程式碼工作上以真正具競爭力的價格達到前沿水準。xhigh 版本現已可用,在同智能等級的模型中提供最低的每任務成本;max 版本在指數上緊追 Claude 頂端位置。需要誠實說明的注意事項:基準測試結果仍屬早期,每任務成本相較 1.2 版本有所上升,且有兩項評估指標略有退步。但如果您開發智能代理,且重視每一分錢所能換來的長時程可靠性,它絕對值得列入您的候選名單。

在 AI 工作團隊中運用 Muse Spark 1.3

像 Muse Spark 1.3 這樣的前沿模型,只有在真正整合到實際工作流程中——包括工具、檔案、程式碼審查和多步驟計畫——而非僅用於聊天視窗時,才能真正發揮價值。Eigent 是一款開源的協作桌面應用程式,可在本地端運行多智能代理 AI 工作團隊,且不依賴特定模型,讓您能將合適的模型分配給每項任務,同時將敏感工作保留在自己的機器上。了解智能代理如何端對端地審查 GitHub PR,然後下載 Eigent 立即體驗。

常見問題

什麼是 Muse Spark 1.3?

Muse Spark 1.3 是 Meta 針對程式碼編寫與智能代理工作推出的前沿推理模型,於 2026 年 9 月 2 日發布。它支援文字、圖片與影片輸入,擁有 100 萬 token 的上下文視窗,可在 Muse Code 和 Meta 的 Model API 上使用。這是 Meta 五個月內推出的第四款 Muse Spark 模型。

Muse Spark 1.3 xhigh 和 max 有什麼差異?

兩者的差異在於推理預算。Muse Spark 1.3 (xhigh) 現已可用,在 Artificial Analysis 智能指數上得分 61。Muse Spark 1.3 (max) 是更高效能的版本,目前處於限量預覽階段,透過消耗更多推理 token 達到 62 分,將在完成額外安全測試後更廣泛推出。

Muse Spark 1.3 的費用是多少?

xhigh 版本的定價與 Muse Spark 1.2 相同:每 100 萬輸入 token $1.25 美元,每 100 萬輸出 token $4.25 美元,快取命中為每 100 萬 token $0.15 美元。Artificial Analysis 測量其每項智能指數任務成本為 $0.55 美元——是所有得分 59 分及以上模型中最低的。max 版本的定價尚未公布。

Muse Spark 1.3 比 Muse Spark 1.2 更好嗎?

在大多數任務上是的。xhigh 版本在指數上提升了 4 分,並在智能代理基準測試上取得大幅進步——Tau3-Bench Banking 從 35% 提升至 47%,Terminal-Bench 2.1 從 80% 提升至 85%。有兩項評估指標略有退步(AA-LCR 和 AA-Omniscience),且由於使用更多輸入 token,每任務成本有所上升。

Muse Spark 1.3 與 Claude 和 GPT 相比如何?

Muse Spark 1.3 (xhigh) 在智能指數上與 GPT-5.6 Sol (max) 和 Grok 4.6 (high) 並列 61 分,但每任務成本遠低於它們。max 版本以 62 分僅次於 Claude Fable 5.1(66 分)和 Claude Opus 5(63 分)。Claude 在整體指數上仍然領先;Muse Spark 在每任務成本以及 Tau3-Bench Banking 智能代理評估上領先。

Muse Spark 1.3 會推出開放權重版本嗎?

Meta 已表示開放權重的 Muse Spark 版本在其路線圖上,延續其在八月發布的 300 億參數開放權重 Muse Glimmer 模型。Muse Spark 1.3 開放權重版本的具體日期尚未公布。

Recent Posts

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解
Sep 3, 2026

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解

Claude Fable 5.1 與 Mythos 5.1 詳解:同一模型提供兩種安全防護等級,附全新基準測試成績、約 25 至 45% 的成本降幅,以及存取方式說明。

EigentEigent
Gemini 3.8 Flash:程式開發與 AI 代理的全新升級
Sep 3, 2026

Gemini 3.8 Flash:程式開發與 AI 代理的全新升級

Gemini 3.8 Flash 在維持低廉價格的同時,大幅提升程式開發與代理推理能力,並推出全新 3.8 Flash Cyber 變體。本文涵蓋基準測試、定價及使用方式。

EigentEigent
GPT-6 Astra:OpenAI 新模型究竟能做什麼
Sep 3, 2026

GPT-6 Astra:OpenAI 新模型究竟能做什麼

GPT-6 Astra 是 OpenAI 最新旗艦模型。本文解析其功能、基準測試表現、定價方案,以及 AGI 標題背後值得注意的注意事項。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即體驗 Eigent

下載開源桌面應用,在本地以 AI 工作團隊開始自動化。

下載 Eigent
Eigent

掌握 AI 工作團隊自動化的最新更新與教學內容。

感謝您的訂閱!

產品Eigent環境價格方案企業方案
探索解決方案使用情境技能插件部落格
開發者文件GitHubCAMEL-AI開源基金合作夥伴
下載開源版
公司關於我們品牌招募使用條款隱私權政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD