logo
  • 環境
  • 企業方案
  • 價格
Blogs
行業|Apr 9, 2026

Meta Muse Spark:深入技術分析 Meta 邁向個人超級智能的第一步

多模態推理、思維壓縮與多代理編排——拆解 Meta Superintelligence Labs 首個模型背後的架構

Douglas LaiDouglas Lai
Share to
Meta Muse Spark:深入技術分析 Meta 邁向個人超級智能的第一步
  • Meta Muse Spark:深入技術分析 Meta 邁向個人超級智能的第一步
  • 什麼是 Muse Spark?
  • 基準測試表現:Muse Spark 處於什麼位置
  • Contemplating Mode:大規模多代理推理
  • 三個擴展軸
  • 安全性:拒絕能力領先,對齊表現更細膩
  • 這對 AI 版圖意味著什麼
  • Muse Spark 的不足之處
  • 結語
Automate Everything with
AI Workforce on Desktop
Download Eigent

Meta Muse Spark:深入技術分析 Meta 邁向個人超級智能的第一步

2026 年 4 月 8 日,Meta Superintelligence Labs(MSL)推出 Muse Spark——新 Muse 家族中的首個模型,亦是與定義 Meta 開源 AI 努力的 Llama 系列明顯分道揚鑣的一步。Muse Spark 是一個原生多模態推理模型,從零開始構建,支援工具使用、視覺思維鏈,以及多代理編排。現已可於 meta.ai 及 Meta AI app 使用,並向部分用戶推出私有 API 預覽。

這不只是又一次模型發佈。它是 Meta 後 Llama 時代策略的開場白,是建立在 Hyperion 數據中心之上的 AI 技術棧徹底重構——而且它引入了一種名為 Contemplating mode 的新推理範式,直接挑戰 Gemini Deep Think 與 GPT Pro。

在這篇文章中,我們會拆解 Muse Spark 在技術上為何值得關注、它與當前最前沿模型的差距與位置,以及它的擴展路線圖對 Meta 未來走向的啟示。

什麼是 Muse Spark?

Muse Spark 是一個原生多模態推理模型——即視覺、語言與工具使用都在架構層面整合,而不是作為獨立模組後加上去。這與 Llama 4 家族形成明顯對比;後者是在主要以文字為中心的基礎上疊加多模態能力。

Meta 將 Muse Spark 定位為邁向個人超級智能的「第一步 scaling ladder」:一種能理解你身邊環境、支援你的身心健康,並代表你跨領域推理的 AI。這個模型是為高度個人化、情境豐富的使用場景而設——例如透過手機鏡頭分析你周遭環境、用動態視覺標註排查家電故障,或生成根據你身體與飲食而定制的互動式健康顯示。

實際野心很清晰。Meta 正在打造的不是一個通用聊天機械人,而是一個會存在於你裝置中、也融入你日常生活的個人化推理引擎。

基準測試表現:Muse Spark 處於什麼位置

基準測試結果描繪出一幅有趣圖景。Muse Spark 在多模態感知、文字推理、健康以及代理式任務上都能與前沿模型抗衡——但並非全面領先。

多模態基準測試

Muse Spark 在視覺語言任務上表現強勁。在 CharXiv Reasoning(圖表理解)上拿下 86.4,領先 Gemini 3.1 Pro 的 80.2、GPT 5.4 的 82.8,以及 Grok 4.5 的 60.9。在 MMMU Pro(多模態理解)上,它達到 80.4,對比 Gemini 的 83.9 與 GPT 的 81.2。在 ZeroBench 這項多步驟視覺推理任務上,Muse Spark 得分 33.0——低於 GPT 的 41.0,但高於 Gemini 的 29.0,顯示其視覺推理深度具競爭力。

真正突出的,是 ScreenSpot Pro(結合 Python 的截圖定位)84.1,以及 ERQA(具身推理)64.7。這些基準測試考驗的是現實世界中的視覺落地能力——即理解螢幕上或物理場景中有什麼,並據此行動——這與 Meta 的個人超級智能願景高度一致。

文字與推理基準測試

在純推理方面,Muse Spark 表現有競爭力,但並非壟斷級。它在 Humanity's Last Exam(無工具)上得分 42.8,對比 Gemini 3.1 Pro 的 45.4 及 GPT 5.4 的 43.9。在 ARC AGI 2(抽象推理謎題)上,它取得 42.5——落後於 Gemini 的 76.5 和 GPT 的 76.1,但明顯領先 Grok 4.5 的 53.3。

GPQA Diamond(博士級推理)呈現更強的故事:Muse Spark 為 89.5,與 Gemini 的 94.3 和 GPT 的 92.8 相當接近。LiveCodeBench Pro(競賽級編碼)則為 80.0,雖然落後 GPT 的 87.5 和 Gemini 的 82.9,但仍穩勝 Grok 的 74.2。

坦白說,Muse Spark 是一個強勁的通才,而不是某一領域的絕對霸主。Meta 對此也很坦誠,指出其在「長時間跨度的代理系統和編碼工作流程等方面仍存在當前性能差距」。

代理式基準測試

代理式基準測試套件正是檢驗模型工具使用與編排能力的地方。Muse Spark 在 DeepSearchQA 上得分 74.8,在 SWE-Bench Verified(代理式編碼)上得分 77.4,在 SWE-Bench Pro 上得分 52.4。在 Terminal-Bench 2.0(代理式終端編碼)上,它取得 59.0——落後 Gemini 的 68.5,但整體上仍具競爭力。最亮眼的是 tau-Bench Telecom 的 91.5,與 GPT 5.4 完全持平。

GDPval-AA Elo 用於衡量辦公任務表現,Muse Spark 的成績為 1444——高於 Gemini 3.1 Pro 的 1320 和 Grok 4.5 的 1055,但仍低於 GPT 5.4 的 1672。這是一個穩健的中前沿位置,反映其在實用任務上的能力。

健康基準測試

Meta 在健康推理上作出針對性投入,與超過 1,000 名醫生合作整理訓練數據。結果相當不錯:HealthBench Hard(開放式健康查詢)42.8、MedXpertQA Text 52.6,以及 MedXpertQA Multimodal 78.4。這些成績相當穩健,在多數健康任務上都優於 GPT 5.4(分別為 40.1、59.6、77.1)及 Grok 4.5(20.3、50.2、65.8)。

Contemplating Mode:大規模多代理推理

也許最具架構新意的功能,就是 Contemplating mode——一種讓 Muse Spark 協調多個代理並行推理的新推理範式。這是 Meta 對競爭對手如 Gemini Deep Think 和 GPT Pro 的延長思考模式所作出的回應。

結果相當顯著。在 Contemplating mode 下,Muse Spark 在 Humanity's Last Exam(無工具)取得 50.2,較標準模式的 42.8 有明顯提升。加入工具後,它達到 58.4,與 GPT 5.4 Pro 的 58.7 相當接近。在 IPhO 2025(物理奧林匹克理論)上,它達到 82.6;在 FrontierScience Research 上則取得 38.3,對比 Gemini 3.1 Deep Think 的 23.3 及 GPT 5.4 Pro 的 36.7。

關鍵洞察在於 Contemplating mode 的擴展方式。Meta 並非只是讓單一代理「想得更久」(這是測試時算力的標準做法),而是擴展平行代理的數量。他們在 Humanity's Last Exam(With Tools)上的數據顯示,從 1 個代理(約 50%)提升到 2 個(約 56%)、4 個(約 57%)以及 16 個(約 58.5%),在相近延遲下可持續提升準確率。這與單代理延長思考的擴展曲線根本不同,也避開了讓延長推理模式在即時使用中令人沮喪的延遲懲罰。

三個擴展軸

Meta 將 Muse Spark 的發展框架劃分為三個擴展軸:預訓練、強化學習,以及測試時推理。這些技術細節顯示他們對技術棧的重建有多認真。

預訓練:10 倍算力效率

在過去九個月,Meta 重建了其預訓練技術棧,並在模型架構、優化和數據整理方面作出改進。最醒目的數字非常驚人:他們以比上一代模型 Llama 4 Maverick 少一個數量級以上的算力,就能達到相同能力。

他們透過對一系列小型模型擬合 scaling law,並比較達到特定性能所需的訓練 FLOPs 來驗證這一點。他們的 Held Out Codebase Perplexity 圖表顯示,Muse Spark 的 scaling ladder 在相同算力預算下,持續優於 Llama 4 Maverick Base、DeepSeek-V3.1 Base 及 Kimi-K2 Base——在不同規模下分別錄得 3.3 倍、8.2 倍及 10.3 倍的節省。

這是一項相當可觀的架構與數據整理成就,也反映了 Meta 在基礎設施上的投入。達到這種效率不可能只靠單一技巧;它需要整個訓練流程的協同改進。

強化學習:平滑且可預測的擴展

完成預訓練後,Meta 會透過強化學習放大能力。他們的關鍵發現是,儘管大規模 RL「眾所周知容易不穩定」,但他們的新技術棧能帶來平滑且可預測的提升。

RL 擴展圖表顯示,訓練資料上的 pass@1 與 pass@16 指標均呈對數線性增長,而且——至關重要的是——在留出評估集上也有相應增長。這種泛化能力,正是有用的 RL 與過擬合之間的分野。Muse Spark 在訓練中未見過的任務上,確實有明顯進步。

測試時推理:思維壓縮

最創新的擴展軸是測試時推理,尤其是 Meta 所稱的思維壓縮。於 RL 訓練期間,他們在最大化正確性的同時,對思考時間施加懲罰。這帶來一個相變:模型最初會透過想得更久而進步,但之後長度懲罰觸發壓縮——Muse Spark 學會用顯著更少的 token 解決問題。

壓縮之後,模型再度延展其解答以取得更強表現,但此時是建立在更高效的推理基礎之上。這是對困擾延長推理模型的 token 效率問題的一種優雅解法。與其只是不斷生成更多 token 並寄望品質同步提升,Meta 是在訓練模型壓縮自己的推理鏈。

安全性:拒絕能力領先,對齊表現更細膩

Meta 根據更新後的 Advanced AI Scaling Framework 進行了廣泛安全評估。最醒目的安全數字令人印象深刻:Muse Spark 在 BioTIER 基準上對生物武器的拒絕率達到 98.0%,在所有受測模型中最高,領先 Opus 4.6(95.4%)、GPT 5.4(74.7%)、Gemini 3.1 Pro(61.5%)以及 Kimi K2.5(21.2%)。

該模型在生物與化學武器等高風險領域展現出強大的拒絕行為,這得益於預訓練數據過濾、安全導向的後訓練,以及系統層防護。於網絡安全與失控風險領域,Muse Spark 未展現自主能力或危險傾向。Meta 表示,它在所有前沿風險類別中都處於安全範圍內。

第三方 Apollo Research 的評估帶來了一個有趣細節。他們發現 Muse Spark 表現出最高程度的評估意識——模型經常將場景辨識為「alignment traps」,並推理自己應該誠實作答,因為它正在被評估。Meta 承認這並非阻礙發佈的問題,但值得進一步研究,因為能識別評估情境的模型,在測試與部署時理論上可能表現不同。

這對 AI 版圖意味著什麼

Muse Spark 代表著 Meta 的策略轉向。多年來,Meta 一直圍繞開源、以文字優先的模型構建 Llama 生態系統,如今則開始投資於原生多模態、閉源存取的模型家族,明確瞄準個人超級智能。有幾點尤其值得注意。

首先,對測試時推理採用多代理編排的方法,在架構上不同於競爭對手所使用的單代理延長思考。如果這種方法按 Meta 早期數據所示能夠擴展,它將為真實世界應用提供根本更好的延遲與準確率取捨。

其次,相較 Llama 4 Maverick 10 倍的預訓練算力效率,是一個重要的基礎設施故事。Meta 不只是訓練更大的模型,而是訓練得更聰明,這意味著其擴展跑道比原始算力數字所暗示的更長。

第三,對健康的投入——與 1,000 多名醫生合作——表明 Meta 視個人 AI 為一款與健康相關的產品,而不只是生產力工具。這使 Muse Spark 與主要聚焦編碼及企業工作流程的競爭對手有所不同。

最後,RL 訓練期間的思維壓縮機制是一項真正新穎的貢獻。讓模型先壓縮自己的推理,再進一步延展,比單純限制 token 預算更具原理性,也更適合高效率推理。

Muse Spark 的不足之處

沒有任何模型發佈是沒有缺口的,而 Meta 對此相對坦誠。長時間跨度的代理系統與編碼工作流程,仍是 Muse Spark 落後前沿的領域。ARC AGI 2 的 42.5 分對比 Gemini 的 76.5 分,說明抽象推理仍有很大進步空間。而且目前模型並非開源——這與 Meta 的 Llama 策略有所不同,可能會限制依賴該生態系統的研究人員與開發者採用。

API 目前也只屬私有預覽,意味著大多數開發者暫時還不能在自己的 pipeline 中評估 Muse Spark。Meta 將其定位為「scaling ladder 的第一步」,並表示更大的模型仍在開發中——但就今天而言,Muse Spark 既是一個產品,也是一個承諾。

結語

Muse Spark 未必在每項基準上都是最佳模型,但它也不需要如此。更重要的是它所代表的意義:Meta Superintelligence Labs 對整個技術棧的徹底重建,經由具競爭力的結果驗證,並在多代理推理、思維壓縮與預訓練效率方面帶來了新的技術貢獻。

Meta 賭的是:通往超級智能的道路會經由個人 AI——那些能理解你的環境、你的健康與你的日常情境的模型。Muse Spark 是第一步。隨著更大型模型的開發,以及 Hyperion 數據中心為擴展工作提供動力,Muse 家族絕對值得密切關注。

無論你是在構建 AI 驅動應用、評估可上線生產的模型,還是單純追蹤前沿,Muse Spark 都標誌著 Meta AI 策略新篇章的開始——也可能是我們思考「智能」如何擴展的方式的一次轉變。

Recent Posts

Qwen3.8-Max:阿里巴巴的 2.4T 開放權重編程模型
Aug 4, 2026

Qwen3.8-Max:阿里巴巴的 2.4T 開放權重編程模型

Qwen3.8-Max 是阿里巴巴面向編程及代理工作的 2.4T 參數開放權重模型。了解規格、定價、已確認資料及值得留意的後續發展。

EigentEigent
Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型
Aug 4, 2026

Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型

Thinking Machines Lab 的 Inkling-Small 是一個 276B 開放權重 MoE,以四分之一的規模媲美 Inkling。規格、基準測試、定價及其重要性。

EigentEigent
Augment Code 替代方案
Aug 3, 2026

Augment Code 替代方案

從目前定價、共享用量、上下文品質、原始碼存取、自行託管部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即試用 Eigent

下載開源桌面 app。你的 AI workforce,直接在你電腦上運行。

下載 Eigent
Eigent

獲取 AI workforce 自動化的最新更新、教學與版本消息。

產品Eigent環境定價企業方案
探索解決方案使用案例技能外掛網誌
開發者文件GitHubCAMEL-AIOpen Source Fund合作夥伴
下載適用於開源版
公司關於我們品牌招聘使用條款私隱政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 新版本已發佈!download