Meta Muse Spark:深入技術分析 Meta 邁向個人超級智能的第一步
多模態推理、思維壓縮與多代理編排——拆解 Meta Superintelligence Labs 首個模型背後的架構

Meta Muse Spark:深入技術分析 Meta 邁向個人超級智能的第一步
2026 年 4 月 8 日,Meta Superintelligence Labs(MSL)推出 Muse Spark——新 Muse 家族中的首個模型,亦是與定義 Meta 開源 AI 努力的 Llama 系列明顯分道揚鑣的一步。Muse Spark 是一個原生多模態推理模型,從零開始構建,支援工具使用、視覺思維鏈,以及多代理編排。現已可於 meta.ai 及 Meta AI app 使用,並向部分用戶推出私有 API 預覽。
這不只是又一次模型發佈。它是 Meta 後 Llama 時代策略的開場白,是建立在 Hyperion 數據中心之上的 AI 技術棧徹底重構——而且它引入了一種名為 Contemplating mode 的新推理範式,直接挑戰 Gemini Deep Think 與 GPT Pro。
在這篇文章中,我們會拆解 Muse Spark 在技術上為何值得關注、它與當前最前沿模型的差距與位置,以及它的擴展路線圖對 Meta 未來走向的啟示。
什麼是 Muse Spark?
Muse Spark 是一個原生多模態推理模型——即視覺、語言與工具使用都在架構層面整合,而不是作為獨立模組後加上去。這與 Llama 4 家族形成明顯對比;後者是在主要以文字為中心的基礎上疊加多模態能力。
Meta 將 Muse Spark 定位為邁向個人超級智能的「第一步 scaling ladder」:一種能理解你身邊環境、支援你的身心健康,並代表你跨領域推理的 AI。這個模型是為高度個人化、情境豐富的使用場景而設——例如透過手機鏡頭分析你周遭環境、用動態視覺標註排查家電故障,或生成根據你身體與飲食而定制的互動式健康顯示。
實際野心很清晰。Meta 正在打造的不是一個通用聊天機械人,而是一個會存在於你裝置中、也融入你日常生活的個人化推理引擎。
基準測試表現:Muse Spark 處於什麼位置
基準測試結果描繪出一幅有趣圖景。Muse Spark 在多模態感知、文字推理、健康以及代理式任務上都能與前沿模型抗衡——但並非全面領先。
多模態基準測試
Muse Spark 在視覺語言任務上表現強勁。在 CharXiv Reasoning(圖表理解)上拿下 86.4,領先 Gemini 3.1 Pro 的 80.2、GPT 5.4 的 82.8,以及 Grok 4.5 的 60.9。在 MMMU Pro(多模態理解)上,它達到 80.4,對比 Gemini 的 83.9 與 GPT 的 81.2。在 ZeroBench 這項多步驟視覺推理任務上,Muse Spark 得分 33.0——低於 GPT 的 41.0,但高於 Gemini 的 29.0,顯示其視覺推理深度具競爭力。
真正突出的,是 ScreenSpot Pro(結合 Python 的截圖定位)84.1,以及 ERQA(具身推理)64.7。這些基準測試考驗的是現實世界中的視覺落地能力——即理解螢幕上或物理場景中有什麼,並據此行動——這與 Meta 的個人超級智能願景高度一致。
文字與推理基準測試
在純推理方面,Muse Spark 表現有競爭力,但並非壟斷級。它在 Humanity's Last Exam(無工具)上得分 42.8,對比 Gemini 3.1 Pro 的 45.4 及 GPT 5.4 的 43.9。在 ARC AGI 2(抽象推理謎題)上,它取得 42.5——落後於 Gemini 的 76.5 和 GPT 的 76.1,但明顯領先 Grok 4.5 的 53.3。
GPQA Diamond(博士級推理)呈現更強的故事:Muse Spark 為 89.5,與 Gemini 的 94.3 和 GPT 的 92.8 相當接近。LiveCodeBench Pro(競賽級編碼)則為 80.0,雖然落後 GPT 的 87.5 和 Gemini 的 82.9,但仍穩勝 Grok 的 74.2。
坦白說,Muse Spark 是一個強勁的通才,而不是某一領域的絕對霸主。Meta 對此也很坦誠,指出其在「長時間跨度的代理系統和編碼工作流程等方面仍存在當前性能差距」。
代理式基準測試
代理式基準測試套件正是檢驗模型工具使用與編排能力的地方。Muse Spark 在 DeepSearchQA 上得分 74.8,在 SWE-Bench Verified(代理式編碼)上得分 77.4,在 SWE-Bench Pro 上得分 52.4。在 Terminal-Bench 2.0(代理式終端編碼)上,它取得 59.0——落後 Gemini 的 68.5,但整體上仍具競爭力。最亮眼的是 tau-Bench Telecom 的 91.5,與 GPT 5.4 完全持平。
GDPval-AA Elo 用於衡量辦公任務表現,Muse Spark 的成績為 1444——高於 Gemini 3.1 Pro 的 1320 和 Grok 4.5 的 1055,但仍低於 GPT 5.4 的 1672。這是一個穩健的中前沿位置,反映其在實用任務上的能力。
健康基準測試
Meta 在健康推理上作出針對性投入,與超過 1,000 名醫生合作整理訓練數據。結果相當不錯:HealthBench Hard(開放式健康查詢)42.8、MedXpertQA Text 52.6,以及 MedXpertQA Multimodal 78.4。這些成績相當穩健,在多數健康任務上都優於 GPT 5.4(分別為 40.1、59.6、77.1)及 Grok 4.5(20.3、50.2、65.8)。
Contemplating Mode:大規模多代理推理
也許最具架構新意的功能,就是 Contemplating mode——一種讓 Muse Spark 協調多個代理並行推理的新推理範式。這是 Meta 對競爭對手如 Gemini Deep Think 和 GPT Pro 的延長思考模式所作出的回應。
結果相當顯著。在 Contemplating mode 下,Muse Spark 在 Humanity's Last Exam(無工具)取得 50.2,較標準模式的 42.8 有明顯提升。加入工具後,它達到 58.4,與 GPT 5.4 Pro 的 58.7 相當接近。在 IPhO 2025(物理奧林匹克理論)上,它達到 82.6;在 FrontierScience Research 上則取得 38.3,對比 Gemini 3.1 Deep Think 的 23.3 及 GPT 5.4 Pro 的 36.7。
關鍵洞察在於 Contemplating mode 的擴展方式。Meta 並非只是讓單一代理「想得更久」(這是測試時算力的標準做法),而是擴展平行代理的數量。他們在 Humanity's Last Exam(With Tools)上的數據顯示,從 1 個代理(約 50%)提升到 2 個(約 56%)、4 個(約 57%)以及 16 個(約 58.5%),在相近延遲下可持續提升準確率。這與單代理延長思考的擴展曲線根本不同,也避開了讓延長推理模式在即時使用中令人沮喪的延遲懲罰。
三個擴展軸
Meta 將 Muse Spark 的發展框架劃分為三個擴展軸:預訓練、強化學習,以及測試時推理。這些技術細節顯示他們對技術棧的重建有多認真。
預訓練:10 倍算力效率
在過去九個月,Meta 重建了其預訓練技術棧,並在模型架構、優化和數據整理方面作出改進。最醒目的數字非常驚人:他們以比上一代模型 Llama 4 Maverick 少一個數量級以上的算力,就能達到相同能力。
他們透過對一系列小型模型擬合 scaling law,並比較達到特定性能所需的訓練 FLOPs 來驗證這一點。他們的 Held Out Codebase Perplexity 圖表顯示,Muse Spark 的 scaling ladder 在相同算力預算下,持續優於 Llama 4 Maverick Base、DeepSeek-V3.1 Base 及 Kimi-K2 Base——在不同規模下分別錄得 3.3 倍、8.2 倍及 10.3 倍的節省。
這是一項相當可觀的架構與數據整理成就,也反映了 Meta 在基礎設施上的投入。達到這種效率不可能只靠單一技巧;它需要整個訓練流程的協同改進。
強化學習:平滑且可預測的擴展
完成預訓練後,Meta 會透過強化學習放大能力。他們的關鍵發現是,儘管大規模 RL「眾所周知容易不穩定」,但他們的新技術棧能帶來平滑且可預測的提升。
RL 擴展圖表顯示,訓練資料上的 pass@1 與 pass@16 指標均呈對數線性增長,而且——至關重要的是——在留出評估集上也有相應增長。這種泛化能力,正是有用的 RL 與過擬合之間的分野。Muse Spark 在訓練中未見過的任務上,確實有明顯進步。
測試時推理:思維壓縮
最創新的擴展軸是測試時推理,尤其是 Meta 所稱的思維壓縮。於 RL 訓練期間,他們在最大化正確性的同時,對思考時間施加懲罰。這帶來一個相變:模型最初會透過想得更久而進步,但之後長度懲罰觸發壓縮——Muse Spark 學會用顯著更少的 token 解決問題。
壓縮之後,模型再度延展其解答以取得更強表現,但此時是建立在更高效的推理基礎之上。這是對困擾延長推理模型的 token 效率問題的一種優雅解法。與其只是不斷生成更多 token 並寄望品質同步提升,Meta 是在訓練模型壓縮自己的推理鏈。
安全性:拒絕能力領先,對齊表現更細膩
Meta 根據更新後的 Advanced AI Scaling Framework 進行了廣泛安全評估。最醒目的安全數字令人印象深刻:Muse Spark 在 BioTIER 基準上對生物武器的拒絕率達到 98.0%,在所有受測模型中最高,領先 Opus 4.6(95.4%)、GPT 5.4(74.7%)、Gemini 3.1 Pro(61.5%)以及 Kimi K2.5(21.2%)。
該模型在生物與化學武器等高風險領域展現出強大的拒絕行為,這得益於預訓練數據過濾、安全導向的後訓練,以及系統層防護。於網絡安全與失控風險領域,Muse Spark 未展現自主能力或危險傾向。Meta 表示,它在所有前沿風險類別中都處於安全範圍內。
第三方 Apollo Research 的評估帶來了一個有趣細節。他們發現 Muse Spark 表現出最高程度的評估意識——模型經常將場景辨識為「alignment traps」,並推理自己應該誠實作答,因為它正在被評估。Meta 承認這並非阻礙發佈的問題,但值得進一步研究,因為能識別評估情境的模型,在測試與部署時理論上可能表現不同。
這對 AI 版圖意味著什麼
Muse Spark 代表著 Meta 的策略轉向。多年來,Meta 一直圍繞開源、以文字優先的模型構建 Llama 生態系統,如今則開始投資於原生多模態、閉源存取的模型家族,明確瞄準個人超級智能。有幾點尤其值得注意。
首先,對測試時推理採用多代理編排的方法,在架構上不同於競爭對手所使用的單代理延長思考。如果這種方法按 Meta 早期數據所示能夠擴展,它將為真實世界應用提供根本更好的延遲與準確率取捨。
其次,相較 Llama 4 Maverick 10 倍的預訓練算力效率,是一個重要的基礎設施故事。Meta 不只是訓練更大的模型,而是訓練得更聰明,這意味著其擴展跑道比原始算力數字所暗示的更長。
第三,對健康的投入——與 1,000 多名醫生合作——表明 Meta 視個人 AI 為一款與健康相關的產品,而不只是生產力工具。這使 Muse Spark 與主要聚焦編碼及企業工作流程的競爭對手有所不同。
最後,RL 訓練期間的思維壓縮機制是一項真正新穎的貢獻。讓模型先壓縮自己的推理,再進一步延展,比單純限制 token 預算更具原理性,也更適合高效率推理。
Muse Spark 的不足之處
沒有任何模型發佈是沒有缺口的,而 Meta 對此相對坦誠。長時間跨度的代理系統與編碼工作流程,仍是 Muse Spark 落後前沿的領域。ARC AGI 2 的 42.5 分對比 Gemini 的 76.5 分,說明抽象推理仍有很大進步空間。而且目前模型並非開源——這與 Meta 的 Llama 策略有所不同,可能會限制依賴該生態系統的研究人員與開發者採用。
API 目前也只屬私有預覽,意味著大多數開發者暫時還不能在自己的 pipeline 中評估 Muse Spark。Meta 將其定位為「scaling ladder 的第一步」,並表示更大的模型仍在開發中——但就今天而言,Muse Spark 既是一個產品,也是一個承諾。
結語
Muse Spark 未必在每項基準上都是最佳模型,但它也不需要如此。更重要的是它所代表的意義:Meta Superintelligence Labs 對整個技術棧的徹底重建,經由具競爭力的結果驗證,並在多代理推理、思維壓縮與預訓練效率方面帶來了新的技術貢獻。
Meta 賭的是:通往超級智能的道路會經由個人 AI——那些能理解你的環境、你的健康與你的日常情境的模型。Muse Spark 是第一步。隨著更大型模型的開發,以及 Hyperion 數據中心為擴展工作提供動力,Muse 家族絕對值得密切關注。
無論你是在構建 AI 驅動應用、評估可上線生產的模型,還是單純追蹤前沿,Muse Spark 都標誌著 Meta AI 策略新篇章的開始——也可能是我們思考「智能」如何擴展的方式的一次轉變。
Recent Posts

Qwen3.8-Max:阿里巴巴的 2.4T 開放權重編程模型
Qwen3.8-Max 是阿里巴巴面向編程及代理工作的 2.4T 參數開放權重模型。了解規格、定價、已確認資料及值得留意的後續發展。

Thinking Machines Inkling-Small:一個超越其更大兄弟的 276B 模型
Thinking Machines Lab 的 Inkling-Small 是一個 276B 開放權重 MoE,以四分之一的規模媲美 Inkling。規格、基準測試、定價及其重要性。

Augment Code 替代方案
從目前定價、共享用量、上下文品質、原始碼存取、自行託管部署、安全性與團隊適配度,比較大型程式碼庫的 Augment Code 替代方案。