logo
  • 環境
  • エンタープライズ
  • 料金
Blogs
Sep 3, 2026

Muse Spark 1.3:Metaのフロンティアコーディング・エージェントモデル、徹底解説

Metaが5ヶ月で4回目のMuse Sparkリリース——トップのエージェント作業ベンチマーク、据え置き価格、限定プレビューの最大推論バリアントでフロンティアに到達。

EigentEigent
Share to
Muse Spark 1.3:Metaのフロンティアコーディング・エージェントモデル、徹底解説
  • Muse Spark 1.3とは?
  • 2つのバリアント:xhigh vs max
  • ベンチマーク:Muse Spark 1.3がフロンティアに到達
  • Metaが強調しなかった性能低下
  • 価格:タスクあたりコストが最安のフロンティア級モデル
  • コーディングにおける変更点
  • 他のモデルとの比較
  • 今後の展開
  • まとめ
  • Muse Spark 1.3をAIワークフォースで活用する
  • よくある質問
Automate Everything with
AI Workforce on Desktop
Download Eigent

Muse Spark 1.3は、2026年9月2日にリリースされたMetaのコーディングおよびエージェント作業向け新フロンティアモデルです——Metaが5ヶ月で4回目となるMuse Sparkモデルのリリースとなります。注目点は、最上位バリアントが主要インテリジェンス指数でClaudeのすぐ後につけ、主要なエージェント作業ベンチマークで第1位のスコアを記録し、同クラスのモデルの中で最低のタスクあたりコストを実現していることです。Muse Spark 1.2からの変更点、2つのバリアント、ベンチマーク、価格、そしてエージェントを構築する人々にとっての位置づけを解説します。

Muse Spark 1.3とは?

Muse Spark 1.3は、長期的なコーディングとエージェントワークフロー向けにチューニングされたMetaの推論モデルです。テキスト、画像、動画の入力に対応し、100万トークンのコンテキストウィンドウを持ち、リリース初日からMuse CodeおよびMetaのModel APIで利用可能です。

Metaの説明によれば、このモデルはユーザーと協力しながら、1つの長いスレッドで複数のワークフローを並行処理することで、より長い作業を継続できるよう設計されています。実際には、プロンプトが曖昧な場合に確認の質問をし、行き詰まったときに助けを求め、重要なアクションの前に確認を取るという動作を意味します——これは一度きりのチャットではなく、長時間稼働するエージェントを想定した挙動です。

Meta AIのAlexandr Wang最高責任者はAxiosに対し、このアップデートは「フロンティアモデルと非常に競争力がある」と述べ、ユーザーの代わりに作業するパーソナルエージェントのような製品への道を開くものだと語りました。このリリースは、GoogleのGemini 3.8 FlashとAnthropicのClaude Fable 5.1と同じ週に行われ、モデルリリースが集中した数日間となりました。

2つのバリアント:xhigh vs max

Muse Spark 1.3は、推論バジェットが異なる2つのモデルとして提供されます:

  • Muse Spark 1.3 (xhigh) — Muse CodeおよびAPIで現在利用可能。
  • Muse Spark 1.3 (max) — Metaのパートナー向けに限定プレビュー中で、追加の安全性テスト後に広く展開予定。

違いは各バリアントの思考の深さにあります。Artificial Analysis Intelligence Indexでは、xhighが61点、maxが62点を記録しています。maxバリアントは、xhighと比較してあるエージェント評価で約62%多く、別の評価で約28%多くの推論を費やすことで、より高いスコアを達成しています。最良の結果を求めてトークンコストを許容できる場合はmaxが目標となり、現在利用可能なコストパフォーマンスの最適点を求める場合はxhighが最適です。

ベンチマーク:Muse Spark 1.3がフロンティアに到達

Artificial Analysis Intelligence Indexでは、Muse Spark 1.3 (xhigh)が61点でエントリー——Muse Spark 1.2(57点)から4点、Muse Spark 1.1(53点)から8点の上昇です。GPT-5.6 Sol (max)およびGrok 4.6 (high)と同点となっています。maxバリアントの62点は、インデックス上位のClaude Fable 5.1とClaude Opus 5にのみ後れを取る位置です。

スコアの向上の大部分は、純粋な知識ではなくエージェント作業と科学的タスクから来ています。

ベンチマークMuse Spark 1.21.3 (xhigh)1.3 (max)
Tau3-Bench Banking35%47%52%
Terminal-Bench 2.180%85%86%
GDPval-AA v2 (Elo)1,6151,7091,754
CritPt(科学的推論)18%26%~25%
GPQA Diamond90%94%94%

出典:Artificial Analysis、2026年9月2日。

特筆すべきはTau3-Bench Bankingです:maxバリアントの52%は全モデル中第1位のスコアであり、Muse Spark 1.2からの12〜17ポイントの上昇がインデックス改善の最大の要因となっています。科学的推論はxhighのCritPtが8ポイント上昇するなど、全体的に向上しています。

Metaが強調しなかった性能低下

Muse Spark 1.2と比較して、2つのベンチマークで逆の結果が出ています。両バリアントともAA-LCRで4ポイント低下(83%から79%)し、**AA-Omniscience(精度)**はxhighで3ポイント、maxで1ポイント低下しました。Artificial Analysisによると、Omniscience(全知)の低下はより高い回答拒否率によるもので——不確かな場合にモデルが回答を控えること——これにより幻覚(ハルシネーション)率も低下しています。エージェント作業においてはこれは一種の機能とも言えます:自信を持って推測するのではなく「わからない」と言えるモデルは、長期的で重要なタスクを任せるのに安全です。

Metaは、Muse Spark 1.3を自分が知っていることと知らないことをより正確に把握し、行き詰まったときに幻覚的な結果を出す代わりに警告を発するよう訓練したと述べており、この回答拒否の挙動と一致しています。

価格:タスクあたりコストが最安のフロンティア級モデル

価格はMuse Spark 1.2から変更なし:入力トークン100万件あたり$1.25、出力トークン100万件あたり$4.25で、キャッシュヒット時は100万件あたり$0.15に割引されます。Wangはこの価格設定を「積極的」と表現しています。

重要な比較指標はタスクあたりのコストです。Artificial AnalysisはMuse Spark 1.3 (xhigh)をIntelligence Indexタスクあたり$0.55と測定しており——59点以上のスコアを持つモデルの中で最低コストです。同じ61点の直接競合モデルははるかに高コストで、Grok 4.6 (high)が$0.94、GPT-5.6 Sol (max)が$0.95と、70%以上のプレミアムがかかります。maxバリアントの価格はまだ公表されていません。

注意点として、タスクあたりのコストはMuse Spark 1.2($0.40)と比較して上昇しています。新モデルはエージェントタスクあたり約57%多くの入力トークンを消費するためです。競合モデルよりは安価ですが、前バージョンよりは高くなっています。

コーディングにおける変更点

Metaは、Muse Spark 1.3がより多くの長期的なコーディングタスクで訓練されており、実際のエンジニアリング作業でより使いやすくなったと述べています。Muse Spark 1.2と比較して、不要なターンが減り、冗長性が低下し、コーディングスタイルがよりクリーンになっています。Metaの社内エンジニア比較では、ツール呼び出しが約20%、トークン数が約25%削減されており——長いエージェント実行全体で積み重なる効率化です。

Metaはエージェントに最も関連する安全性の改善も報告しています:プロンプトインジェクションや敵対的入力への耐性強化、および不可逆的なアクションを実行する前の判断精度の向上です。

他のモデルとの比較

Muse Spark 1.3 (xhigh)は、フロンティアの端におけるコストパフォーマンス最優先の選択肢として最もよく理解できます:GPT-5.6 Sol (max)およびGrok 4.6 (high)とインデックスで同点、タスクあたりコストでそれらをリード、エージェントバンキングタスクでフィールドトップ。Claude Fable 5.1(66点)とClaude Opus 5(63点)には総合インデックスで後れを取っています——価格を問わず最強のモデルを求めるならClaudeがリードしており、最低コストでフロンティア級のエージェント性能を求めるならMuse Spark 1.3が際立っています。

今週のリリースの直接比較については、Muse Spark 1.3 vs Gemini 3.8 Flash vs Claude Fable 5.1比較記事をご覧ください。

今後の展開

Metaのロードマップには、より大規模なモデルとMuse Sparkのオープンウェイトリリースが含まれています。これはMetaが8月に出荷したMuse Sparkから蒸留された300億パラメータのオープンウェイトモデルMuse Glimmerに続くもので、オープンウェイトファミリーは引き続き拡大していく見込みです。Wangはまた、安全性が現在最も重要な社内トピックの一つであると指摘し、Metaがより強力なモデルを開発中であることを示唆しました。

まとめ

Muse Spark 1.3は、Metaがエージェント作業とコーディングにおいて真に競争力のある価格でフロンティアに到達したことを示しています。xhighバリアントは本日から利用可能で、そのインテリジェンス層の中で最低のタスクあたりコストを実現しており、maxバリアントはインデックス上位でClaudeのすぐ後につけています。正直な注意点として、ベンチマークはまだ初期段階であり、タスクあたりのコストは1.2より上昇し、2つの評価指標でわずかに後退しています。しかし、エージェントを構築し、1ドルあたりの長期的な信頼性を重視するなら、このモデルは候補リストに入れるべきです。

Muse Spark 1.3をAIワークフォースで活用する

Muse Spark 1.3のようなフロンティアモデルは、チャットウィンドウではなく、ツール、ファイル、コードレビュー、マルチステップのプランなど実際のワークフローに組み込まれて初めてその価値を発揮します。Eigentは、マルチエージェントAIワークフォースをローカルで実行するオープンソースのCoworkデスクトップアプリで、モデルに依存しないため、各タスクに適切なモデルをルーティングし、機密性の高い作業を自分のマシン上に保持できます。エージェントがGitHub PRをエンドツーエンドでレビューする方法を確認してから、Eigentをダウンロードしてお試しください。

よくある質問

Muse Spark 1.3とは何ですか?

Muse Spark 1.3は、2026年9月2日にリリースされたMetaのコーディングおよびエージェント作業向けフロンティア推論モデルです。100万トークンのコンテキストウィンドウでテキスト、画像、動画の入力をサポートし、Muse CodeおよびMetaのModel APIで利用可能です。Metaが5ヶ月で4回目のMuse Sparkリリースとなります。

Muse Spark 1.3のxhighとmaxの違いは何ですか?

推論バジェットが異なります。Muse Spark 1.3 (xhigh)は現在利用可能で、Artificial Analysis Intelligence Indexで61点を記録しています。Muse Spark 1.3 (max)は限定プレビュー中の高負荷バリアントで、大幅に多くの推論トークンを費やすことで62点を達成しており、追加の安全性テスト後に広く展開される予定です。

Muse Spark 1.3の価格はいくらですか?

xhighバリアントの価格はMuse Spark 1.2から変更なし:入力トークン100万件あたり$1.25、出力トークン100万件あたり$4.25で、キャッシュヒット時は100万件あたり$0.15です。Artificial AnalysisはIntelligence Indexタスクあたり$0.55と測定しており——59点以上のスコアを持つモデルの中で最低コストです。maxバリアントの価格はまだ発表されていません。

Muse Spark 1.3はMuse Spark 1.2より優れていますか?

ほとんどのタスクでは優れています。xhighバリアントはインデックスで4ポイント上昇し、エージェントベンチマークで大幅な向上を記録しました——Tau3-Bench Bankingは35%から47%、Terminal-Bench 2.1は80%から85%に上昇。2つの評価指標(AA-LCRとAA-Omniscience)でわずかに後退し、入力トークンの消費量が増えたためタスクあたりのコストも上昇しています。

Muse Spark 1.3はClaudeやGPTと比べてどうですか?

Muse Spark 1.3 (xhigh)はインテリジェンス指数でGPT-5.6 Sol (max)およびGrok 4.6 (high)と61点で同点ながら、タスクあたりのコストははるかに低くなっています。maxバリアントの62点はClaude Fable 5.1(66点)とClaude Opus 5(63点)にのみ後れを取っています。総合インデックスではClaudeがリードしており、タスクあたりのコストとTau3-Bench Bankingエージェント評価ではMuse Sparkがリードしています。

Muse Spark 1.3はオープンウェイトになりますか?

Metaはオープンウェイトのリリースをロードマップに含めていると述べており、8月に出荷した300億パラメータのオープンウェイトモデルMuse Glimmerに続くものとなります。Muse Spark 1.3のオープンウェイトの具体的な日程はまだ発表されていません。

Recent Posts

Claude Fable 5.1とMythos 5.1:新機能の詳細解説
Sep 3, 2026

Claude Fable 5.1とMythos 5.1:新機能の詳細解説

Claude Fable 5.1とMythos 5.1の解説:同一モデルを2つのセーフガードティアで提供、新ベンチマーク結果、約25〜45%のコスト削減、アクセス方法の詳細。

EigentEigent
Gemini 3.8 Flash:コーディングとAIエージェントの新機能
Sep 3, 2026

Gemini 3.8 Flash:コーディングとAIエージェントの新機能

Gemini 3.8 Flashは、同じ低価格でコーディングとエージェント推論を大幅に向上させ、新たにGemini 3.8 Flash Cyberバリアントも登場。ベンチマーク、価格、活用方法を解説。

EigentEigent
GPT-6 Astra:OpenAIの新モデルが実際にできること
Sep 3, 2026

GPT-6 Astra:OpenAIの新モデルが実際にできること

GPT-6 AstraはOpenAIの新しいフラッグシップモデルです。その機能、ベンチマーク結果、価格、そしてAGIの見出しの裏にある注意点を解説します。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

今すぐ Eigent を試す

オープンソースのデスクトップアプリをダウンロードして、AI ワークフォースで自動化を始めましょう。

Eigent をダウンロード
Eigent

AI Workforce Automation の最新アップデートとチュートリアルをお届けします。

ご購読ありがとうございます!

製品Eigent環境料金エンタープライズ
探索ソリューションユースケーススキルプラグインブログ
開発者ドキュメントGitHubCAMEL-AIオープンソースファンドパートナー
ダウンロードオープンソース向け
会社情報私たちについてブランド採用情報利用規約プライバシーポリシーセキュリティと信頼Cookieポリシー返金・トライアルポリシー

無断転載を禁じます © 2026 EIGENT UK LTD