logo
  • 환경
  • 엔터프라이즈
  • 요금제
Blogs
Sep 3, 2026

Muse Spark 1.3: Meta의 최전선 코딩 및 에이전트 모델 완전 해설

5개월 만에 네 번째 Muse Spark 출시 — 최고의 에이전트 작업 벤치마크 달성, 동일한 가격 유지, 최대 추론 변형은 제한적 미리보기 제공.

EigentEigent
Share to
Muse Spark 1.3: Meta의 최전선 코딩 및 에이전트 모델 완전 해설
  • Muse Spark 1.3이란?
  • 두 가지 변형: xhigh vs max
  • 벤치마크: Muse Spark 1.3이 최전선에 도달한 지점
  • Meta가 강조하지 않은 성능 저하 항목
  • 가격: 작업당 비용이 가장 낮은 최전선 모델
  • 코딩 분야의 변화
  • 다른 모델들과의 비교
  • 앞으로의 계획
  • 결론
  • AI 워크포스에서 Muse Spark 1.3 활용하기
  • 자주 묻는 질문
Automate Everything with
AI Workforce on Desktop
Download Eigent

Muse Spark 1.3은 코딩과 에이전트 작업을 위한 Meta의 새로운 최전선 모델로, 2026년 9월 2일에 출시되었습니다 — 5개월 만에 네 번째 Muse Spark 모델입니다. 핵심 내용은 다음과 같습니다: 최상위 변형이 주요 인텔리전스 지수에서 Claude 바로 다음 순위에 올랐고, 핵심 에이전트 작업 벤치마크에서 1위를 기록했으며, 동급 모델 중 작업당 비용이 가장 낮습니다. Muse Spark 1.2 대비 변경 사항, 두 가지 변형, 벤치마크, 가격, 그리고 에이전트를 구축하는 개발자에게 어떤 의미인지 정리했습니다.

Muse Spark 1.3이란?

Muse Spark 1.3은 Meta의 추론 모델로, 장기적인 코딩과 에이전트 워크플로우에 최적화되어 있습니다. 텍스트, 이미지, 동영상 입력을 지원하고, 1M 토큰 컨텍스트 윈도우를 갖추고 있으며, 출시 당일부터 Muse Code와 Meta의 Model API에서 이용 가능합니다.

Meta의 설명에 따르면, 이 모델은 사용자와 협력하고 하나의 긴 스레드에서 여러 워크플로우를 동시에 처리하며 더 오랜 작업을 지속할 수 있도록 설계되었습니다. 실제로는 프롬프트가 모호할 때 명확한 질문을 하고, 막혔을 때 도움을 요청하며, 중요한 작업 전에 확인을 구하는 방식으로 동작합니다 — 일회성 채팅이 아닌 장시간 실행되는 에이전트를 위한 행동 방식입니다.

Meta AI 책임자 Alexandr Wang은 Axios와의 인터뷰에서 이번 업데이트가 "최전선 모델들과 매우 경쟁력 있다"고 밝히며, 사용자를 대신해 작동하는 개인 에이전트 같은 제품의 길을 열어준다고 말했습니다. 이번 출시는 Google의 Gemini 3.8 Flash와 Anthropic의 Claude Fable 5.1과 같은 주에 이루어졌습니다 — 모델 출시가 집중된 며칠이었습니다.

두 가지 변형: xhigh vs max

Muse Spark 1.3은 추론 예산이 다른 두 가지 모델로 출시됩니다:

  • Muse Spark 1.3 (xhigh) — Muse Code와 API에서 현재 이용 가능.
  • Muse Spark 1.3 (max) — Meta 파트너를 위한 제한적 미리보기 중인 고성능 변형으로, 추가 안전성 테스트 후 더 넓게 출시 예정.

차이점은 각 변형이 얼마나 깊이 생각하느냐입니다. Artificial Analysis 인텔리전스 지수에서 xhigh는 61점, max는 62점을 기록합니다. max 변형은 xhigh 대비 에이전트 평가 항목 하나에서 약 62% 더 많은 추론을, 다른 항목에서 28% 더 많은 추론을 사용해 더 높은 점수를 달성합니다. 최상의 결과를 원하고 토큰 비용을 감당할 수 있다면 max가 목표이고, 현재 이용 가능한 가격 대비 성능 최적점을 원한다면 xhigh가 정답입니다.

벤치마크: Muse Spark 1.3이 최전선에 도달한 지점

Artificial Analysis 인텔리전스 지수에서 Muse Spark 1.3 (xhigh)은 61점으로 진입했습니다 — Muse Spark 1.2(57점)보다 4점, Muse Spark 1.1(53점)보다 8점 높습니다. GPT-5.6 Sol (max) 및 Grok 4.6 (high)과 동점입니다. 62점의 max 변형은 지수 상단에서 Claude Fable 5.1과 Claude Opus 5 바로 다음에 위치합니다.

대부분의 성능 향상은 단순 지식이 아닌 에이전트 및 과학적 작업에서 나왔습니다.

벤치마크Muse Spark 1.21.3 (xhigh)1.3 (max)
Tau3-Bench Banking35%47%52%
Terminal-Bench 2.180%85%86%
GDPval-AA v2 (Elo)1,6151,7091,754
CritPt (과학적 추론)18%26%~25%
GPQA Diamond90%94%94%

출처: Artificial Analysis, 2026년 9월 2일.

가장 두드러진 항목은 Tau3-Bench Banking입니다: max 변형의 52%는 전체 모델 중 1위이며, Muse Spark 1.2 대비 12~17포인트 상승은 지수 개선의 가장 큰 원동력입니다. 과학적 추론은 전반적으로 향상되었으며, xhigh의 CritPt 8포인트 상승이 두드러집니다.

Meta가 강조하지 않은 성능 저하 항목

두 가지 벤치마크는 Muse Spark 1.2 대비 오히려 하락했습니다. 두 변형 모두 AA-LCR에서 4포인트 하락(83% → 79%)했고, **AA-Omniscience (정확도)**는 xhigh에서 3포인트, max에서 1포인트 하락했습니다. Artificial Analysis에 따르면, 옴니사이언스 하락은 더 높은 기권율 때문입니다 — 모델이 불확실할 때 답변을 거부하는 것으로, 이는 환각(hallucination) 비율도 낮췄습니다. 에이전트 작업 관점에서는 오히려 장점일 수 있습니다: 자신 있게 추측하는 대신 "모르겠다"고 말하는 모델이 장기적이고 중요한 작업을 맡기기에 더 안전합니다.

Meta는 Muse Spark 1.3이 자신이 아는 것과 모르는 것을 더 잘 파악하고, 결과를 환각하는 대신 막혔을 때 이를 알리도록 훈련되었다고 밝혔습니다 — 이러한 기권 행동과 일치하는 설명입니다.

가격: 작업당 비용이 가장 낮은 최전선 모델

가격은 Muse Spark 1.2와 동일합니다: 입력 토큰 1M당 $1.25, 출력 토큰 1M당 $4.25, 캐시 히트 시 1M당 $0.15로 할인됩니다. Wang은 이 가격을 "공격적"이라고 표현했습니다.

중요한 비교 지표는 작업당 비용입니다. Artificial Analysis는 Muse Spark 1.3 (xhigh)의 인텔리전스 지수 작업당 비용을 $0.55로 측정했습니다 — 59점 이상 모델 중 가장 낮은 비용입니다. 61점 동점 경쟁자들은 훨씬 비쌉니다: Grok 4.6 (high)은 $0.94, GPT-5.6 Sol (max)은 $0.95로, 70% 이상 비쌉니다. Meta는 아직 max 변형의 가격을 공개하지 않았습니다.

한 가지 주의할 점: 새 모델이 에이전트 작업당 입력 토큰을 약 57% 더 많이 소비하기 때문에, 작업당 비용은 Muse Spark 1.2($0.40) 대비 상승했습니다. 동급 경쟁자보다는 저렴하지만, 전작보다는 비쌉니다.

코딩 분야의 변화

Meta는 Muse Spark 1.3이 더 많은 장기 코딩 작업으로 훈련되었으며 실제 엔지니어링 작업에서 더 활용하기 쉽다고 밝혔습니다. Muse Spark 1.2 대비 불필요한 턴을 줄이고, 덜 장황하며, 더 깔끔한 코딩 스타일을 갖췄습니다. Meta 자체 엔지니어 비교에서 도구 호출은 약 20%, 토큰은 약 25% 적게 사용했습니다 — 장기 에이전트 실행에서 누적되는 효율성입니다.

Meta는 에이전트에 특히 관련된 안전성 개선도 보고했습니다: 프롬프트 인젝션(prompt injection) 및 적대적 입력에 대한 강화된 저항성, 그리고 진행 전 어떤 작업이 되돌릴 수 없는지에 대한 더 나은 판단력입니다.

다른 모델들과의 비교

Muse Spark 1.3 (xhigh)은 최전선 끝에서의 가성비 선택으로 이해하는 것이 가장 적절합니다: GPT-5.6 Sol (max) 및 Grok 4.6 (high)과 지수 동점이면서 작업당 비용에서 앞서고, 에이전트 뱅킹 작업에서 전체 1위입니다. 전체 지수에서는 Claude Fable 5.1(66점)과 Claude Opus 5(63점)에 뒤처집니다 — 가격에 관계없이 단일 최강 모델을 원한다면 Claude가 여전히 선두이고, 최저 비용으로 최전선급 에이전트 성능을 원한다면 Muse Spark 1.3이 단연 돋보입니다.

이번 주 출시 모델들의 직접 비교는 Muse Spark 1.3 vs Gemini 3.8 Flash vs Claude Fable 5.1 비교를 참고하세요.

앞으로의 계획

Meta는 로드맵에 더 큰 모델과 Muse Spark 오픈 웨이트(open-weights) 출시가 포함되어 있다고 밝혔습니다. 이는 Meta가 8월에 출시한 Muse Spark에서 증류된 30B 오픈 웨이트 모델 Muse Glimmer에 이은 것으로, 오픈 웨이트 계열이 계속 성장할 것으로 보입니다. Wang은 또한 안전성이 현재 내부적으로 가장 중요한 주제 중 하나라고 언급하며, Meta가 더 강력한 모델을 개발 중이라고 밝혔습니다.

결론

Muse Spark 1.3은 Meta가 진정으로 경쟁력 있는 가격으로 에이전트 및 코딩 작업의 최전선에 도달한 모델입니다. xhigh 변형은 현재 이용 가능하며 동급 인텔리전스 티어에서 작업당 최저 비용을 제공합니다; max 변형은 지수 상단에서 Claude 바로 다음에 위치합니다. 솔직한 주의사항: 벤치마크는 초기 단계이고, 작업당 비용은 1.2 대비 상승했으며, 두 가지 평가 항목이 소폭 하락했습니다. 하지만 에이전트를 구축하고 비용 대비 장기적 신뢰성을 중시한다면, 반드시 검토 목록에 올려야 할 모델입니다.

AI 워크포스에서 Muse Spark 1.3 활용하기

Muse Spark 1.3 같은 최전선 모델은 채팅 창이 아닌 실제 워크플로우 — 도구, 파일, 코드 리뷰, 다단계 계획 — 에 연결되었을 때 비로소 진가를 발휘합니다. Eigent는 멀티 에이전트 AI 워크포스를 로컬에서 실행하는 오픈소스 Cowork 데스크톱 앱으로, 모델에 구애받지 않아 각 작업에 적합한 모델을 라우팅하고 민감한 작업을 자신의 머신에서 처리할 수 있습니다. 에이전트가 GitHub PR을 처음부터 끝까지 리뷰하는 방법을 확인하고, Eigent를 다운로드해서 직접 사용해 보세요.

자주 묻는 질문

Muse Spark 1.3이란 무엇인가요?

Muse Spark 1.3은 코딩과 에이전트 작업을 위한 Meta의 최전선 추론 모델로, 2026년 9월 2일에 출시되었습니다. 텍스트, 이미지, 동영상 입력을 1M 토큰 컨텍스트 윈도우로 지원하며, Muse Code와 Meta의 Model API에서 이용 가능합니다. 5개월 만에 네 번째 Muse Spark 출시입니다.

Muse Spark 1.3 xhigh와 max의 차이점은 무엇인가요?

추론 예산이 다릅니다. Muse Spark 1.3 (xhigh)은 현재 이용 가능하며 Artificial Analysis 인텔리전스 지수에서 61점을 기록합니다. Muse Spark 1.3 (max)은 제한적 미리보기 중인 고성능 변형으로, 훨씬 더 많은 추론 토큰을 사용해 62점을 달성하며, 추가 안전성 테스트 후 더 넓게 출시될 예정입니다.

Muse Spark 1.3의 가격은 얼마인가요?

xhigh 변형의 가격은 Muse Spark 1.2와 동일합니다: 입력 토큰 1M당 $1.25, 출력 토큰 1M당 $4.25, 캐시 히트 시 1M당 $0.15. Artificial Analysis는 인텔리전스 지수 작업당 $0.55로 측정했습니다 — 59점 이상 모델 중 가장 낮은 비용입니다. max 변형의 가격은 아직 발표되지 않았습니다.

Muse Spark 1.3이 Muse Spark 1.2보다 더 낫나요?

대부분의 작업에서 그렇습니다. xhigh 변형은 지수 4포인트 상승과 에이전트 벤치마크에서 큰 폭의 향상을 보였습니다 — Tau3-Bench Banking은 35%에서 47%로, Terminal-Bench 2.1은 80%에서 85%로 상승했습니다. 두 가지 평가 항목(AA-LCR 및 AA-Omniscience)은 소폭 하락했고, 입력 토큰을 더 많이 사용하기 때문에 작업당 비용도 상승했습니다.

Muse Spark 1.3은 Claude 및 GPT와 어떻게 비교되나요?

Muse Spark 1.3 (xhigh)은 인텔리전스 지수에서 GPT-5.6 Sol (max) 및 Grok 4.6 (high)과 61점으로 동점이면서 작업당 비용은 훨씬 낮습니다. 62점의 max 변형은 Claude Fable 5.1(66점)과 Claude Opus 5(63점)에만 뒤처집니다. 전체 지수에서는 Claude가 선두이고, 작업당 비용과 Tau3-Bench Banking 에이전트 평가에서는 Muse Spark가 앞섭니다.

Muse Spark 1.3은 오픈 웨이트로 출시될 예정인가요?

Meta는 8월에 출시한 30B 오픈 웨이트 Muse Glimmer 모델에 이어 오픈 웨이트 Muse Spark 출시가 로드맵에 있다고 밝혔습니다. Muse Spark 1.3 오픈 웨이트의 구체적인 출시 일정은 아직 발표되지 않았습니다.

Recent Posts

Claude Fable 5.1과 Mythos 5.1: 새로운 기능 완벽 정리
Sep 3, 2026

Claude Fable 5.1과 Mythos 5.1: 새로운 기능 완벽 정리

Claude Fable 5.1과 Mythos 5.1 완벽 해설: 두 가지 안전장치 티어로 제공되는 동일한 모델, 새로운 벤치마크 결과, 약 25~45% 비용 절감, 그리고 접근 방법 안내.

EigentEigent
Gemini 3.8 Flash: 코딩과 AI 에이전트의 새로운 기능
Sep 3, 2026

Gemini 3.8 Flash: 코딩과 AI 에이전트의 새로운 기능

Gemini 3.8 Flash는 동일한 저렴한 가격에 코딩과 에이전트 추론 성능을 크게 향상시켰으며, 새로운 3.8 Flash Cyber 변형 모델도 출시되었습니다. 벤치마크, 가격, 사용 방법을 확인하세요.

EigentEigent
GPT-6 Astra: OpenAI의 새 모델이 실제로 하는 일
Sep 3, 2026

GPT-6 Astra: OpenAI의 새 모델이 실제로 하는 일

GPT-6 Astra는 OpenAI의 새 플래그십 모델입니다. 주요 기능, 벤치마크 성능, 가격 정책, 그리고 AGI 헤드라인 뒤에 숨겨진 주의사항을 정리했습니다.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

오늘 Eigent를 사용해보세요

오픈 소스 데스크톱 앱을 다운로드하세요. 여러분의 AI 워크포스가 여러분의 기기에서 실행됩니다.

Eigent 다운로드
Eigent

AI 워크포스 자동화에 대한 최신 소식, 튜토리얼, 출시 정보를 받아보세요.

구독해 주셔서 감사합니다!

제품Eigent환경요금엔터프라이즈
둘러보기솔루션활용 사례스킬플러그인블로그
개발자문서GitHubCAMEL-AI오픈소스 펀드파트너
다운로드오픈 소스용
회사회사 소개브랜드채용이용약관개인정보처리방침보안 및 신뢰쿠키 정책환불 및 체험 정책

모든 권리 보유 © 2026 EIGENT UK LTD