Meta Muse Glimmer: 로컬 에이전트를 실행하는 30B 오픈 웨이트 모델
Meta의 새로운 30B Apache-2.0 모델은 항상 켜져 있는 온디바이스 에이전트를 위해 설계되었습니다 — 단일 소비자용 GPU에서 실행 가능하며, Muse Spark 1.2 오픈 웨이트도 곧 출시 예정입니다.

Muse Glimmer는 Meta의 새로운 오픈 웨이트 AI 모델입니다 — 클라우드가 아닌 사용자의 노트북에서 항상 켜져 있는 AI 에이전트를 실행하기 위해 설계된 300억 파라미터, Apache 2.0 모델입니다. 2026년 8월 10일 Meta Superintelligence Labs에서 출시되었으며, 더 큰 Muse Spark 모델에서 증류(distillation)되어 단일 소비자용 GPU에서 실행됩니다. 이는 Meta가 명확한 방향성을 가지고 오픈 릴리스로 돌아온 것입니다: 에이전트의 미래는 소형화, 프라이버시 보호, 그리고 로컬 실행에 있다는 것입니다. Muse Glimmer가 무엇인지, 벤치마크 성능은 어떤지, 어떤 하드웨어가 필요한지, 그리고 어디에 활용할 수 있는지 살펴보겠습니다.
Muse Glimmer란 무엇인가?
Muse Glimmer는 Meta Superintelligence Labs에서 출시한 300억 파라미터 규모의 밀집형 멀티모달 모델로, Hugging Face에 가중치가 공개된 허용적인 Apache 2.0 라이선스로 배포됩니다. Meta는 이 모델을 항상 켜져 있는 로컬 에이전트 워크플로우에 최적화된 모델로 설명합니다 — 로컬 에이전트, 함수 호출(function calling), 로컬 코딩, LLM-as-a-judge 평가 등을 지원하며, Mac 또는 PC의 단일 소비자용 GPU에서 실행할 수 있을 만큼 소형화되었습니다.
이 포지셔닝은 중요한 의미를 가집니다. Meta는 Muse Glimmer를 최전선의 거대 모델들이 아닌 Google의 Gemma, Alibaba의 Qwen과 비교하며, 동급 크기 모델 중 선두 주자로 자리매김하고 있습니다. 이는 미래가 거대한 클라우드 시스템만이 아니라 사용자 자신의 기기에서 실행되는 소형 모델에도 있다는 Meta의 확신을 보여줍니다.
Meta는 또한 더 강력한 기반 모델인 Muse Spark 1.2의 오픈 웨이트도 곧 공개할 예정이라고 밝혔습니다 — 따라서 Muse Glimmer는 단발성 출시가 아닌 새로운 오픈 웨이트 패밀리의 첫 번째 모델일 가능성이 높습니다. (CNBC)
주요 사양 한눈에 보기
| 사양 | Muse Glimmer |
|---|---|
| 파라미터 | 30B 밀집형(dense) |
| 모달리티 | 전용 인식 인코더를 통한 멀티모달 (텍스트 + 이미지) |
| 컨텍스트 | 131K+ 토큰 |
| 라이선스 | Apache 2.0 |
| 증류 원본 | Muse Spark (더 큰 교사 모델) |
| 전체 정밀도 크기 | ~55–60 GB (BF16) |
| 4비트 양자화 | 20 GB 미만 (24 GB / 32 GB GPU에 적합) |
| 속도 향상 | DFlash 투기적 디코딩(speculative-decoding) 드래프터 모델 내장 |
| 지원 언어 | 100개 이상의 언어로 학습 |
이 중 몇 가지는 아래에서 더 자세히 살펴볼 필요가 있습니다 — 특히 벤치마크와 로컬 하드웨어 관련 내용은 이번 릴리스의 핵심입니다.
Meta의 학습 방식
Muse Glimmer는 증류(distillation) 전략의 산물입니다: 더 큰 모델의 지식을 가정에서 실행할 수 있을 만큼 작은 모델에 압축한 것입니다. Meta의 모델 카드에 따르면 학습은 세 단계로 진행되었습니다:
- 사전 학습(Pre-training): 교사 모델과 유사한 데이터 혼합으로 Muse Spark의 출력에 대한 로짓 증류(logit distillation)를 사용했습니다.
- 중간 학습(Mid-training): 더 풍부한 추론 트레이스와 유기적 데이터를 포함한 더 긴 컨텍스트, 에이전트 중심 데이터로 학습했습니다.
- 사후 학습(Post-training): 일반, 추론, 코딩, 에이전트 도메인 전반에 걸쳐 지도 미세 조정(supervised fine-tuning), 온폴리시 증류(on-policy distillation), 강화 학습(reinforcement learning)을 결합했습니다. (Meta AI)
Meta는 고급 AI 스케일링 프레임워크(Advanced AI Scaling Framework)에 따라 모델을 평가했으며, 모든 관련 안전 카테고리에 걸쳐 오픈 웨이트 릴리스 적합성을 검토했다고 밝혔습니다.
Muse Glimmer의 주요 기능
Meta는 이 모델을 단순한 챗봇이 아닌 진정한 에이전트로 소개합니다. Meta가 강조하는 기능들은 실제 에이전트 워크플로우에 직접 매핑됩니다:
- 엔드투엔드 작업 완료: DeepSearch QA, MCP-Atlas, 𝜏-Bench, SWE-Bench 등의 벤치마크에서 스캐폴드 내에서 작동하고, 코드를 작성 및 디버깅하며, 멀티턴 요청을 처음부터 끝까지 해결합니다.
- 신뢰할 수 있는 도구 사용: 긴 워크플로우 전반에 걸쳐 정확한 스키마로 함수를 호출합니다.
- 장기적 다단계 추론: 확장된 작업에 걸쳐 일관된 계획을 유지하며 긴 시간 범위에 걸쳐 추론합니다.
- 실패 복구: 도구 호출이 실패하거나 예상치 못한 결과를 반환할 때, 모델은 중단하는 대신 진단하고 재시도하도록 학습되었습니다.
- 멀티모달 입력: ~18억 파라미터 인식 인코더를 통해 에이전트가 대화와 함께 스크린샷, 차트, 문서를 해석할 수 있습니다.
- 조절 가능한 추론 깊이: 추론 깊이와 속도를 조절할 수 있는 다이얼 기능을 제공합니다.
커뮤니티 테스터들은 특히 도구 호출 기능이 이 크기의 모델 중에서 두드러진다고 평가했습니다 — 모델이 자율 에이전트의 엔진 역할을 할 때 가장 중요한 기능입니다.
벤치마크: 성능 비교
Meta는 Muse Glimmer를 동급 오픈 모델인 Gemma4-31B와 Qwen3.6-27B와 비교하며, 30B 모델로서 강력한 에이전트 성능 수치를 보고합니다. 출시 관련 보도에 따르면 MCP Atlas와 SWE-Bench Pro 등의 벤치마크에서 두 모델 모두를 능가합니다. 공개된 결과는 다음과 같습니다:
| 벤치마크 | Muse Glimmer | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|
| MCP Atlas | 75.5 | 54.2 | 62.5 |
| SWE-Bench Verified | 76.0 | — | — |
| SWE-Bench Pro | 51.2 | — | — |
| AIME 2026 | 94.7 | — | — |
두 가지 솔직한 주의사항이 있습니다. 첫째, 이 수치들은 출시 당일 벤더가 보고한 수치입니다 — Meta는 이전에 일부 Llama 4 벤치마크 점수를 높이기 위해 특수하고 미공개된 변형 모델을 사용했다고 인정한 전례가 있습니다. 이 표는 최종 판단이 아닌 출발점으로 참고하시기 바랍니다. 둘째, 일부 코딩 및 데스크톱 에이전트 벤치마크에서 Qwen과의 결과는 혼재되어 있습니다; Muse Glimmer가 모든 면에서 압도적인 것은 아닙니다. 공정한 평가: 에이전트 작업에서 동급 크기 모델 중 경쟁력 있거나 선두권에 있으며, 최전선 모델을 능가하는 것은 아닙니다.
Muse Glimmer 로컬 실행 방법
이 부분이 바로 이번 릴리스가 "로컬 에이전트"라는 명칭을 정당화하는 곳입니다. 전체 정밀도에서 30B 모델은 55 GB 이상의 메모리가 필요합니다 — 어떤 소비자용 GPU보다도 많습니다. Meta의 공식 ~4비트 양자화는 언어 모델을 20 GB 미만으로 압축하여, KV 캐시, 인식 인코더, 투기적 디코딩 드래프터를 포함해 24 GB 또는 32 GB 범위 내에서 실행할 수 있게 합니다. Meta는 이 압축이 에이전트 작업에서 최소한의 성능 저하만 발생시킨다고 밝혔습니다.
즉, MacBook이나 단일 RTX 5090과 같은 일반 하드웨어에서 실행 가능하며 — Ollama, LM Studio, vLLM과 같은 로컬 AI 도구에서 출시 첫날부터 지원됩니다.
응답성을 유지하기 위해 Muse Glimmer에는 경량 DFlash "드래프터"가 내장되어 있습니다 — 한 번에 전체 토큰 블록을 제안하는 소형 보조 네트워크로, 메인 모델이 병렬로 검증합니다. Meta는 이 투기적 디코딩이 M4-Max, M5-Max MacBook 및 RTX 5090에서 측정한 결과 동일한 출력 품질을 유지하면서 상당한 속도 향상을 제공한다고 보고합니다.
배포 범위도 광범위합니다: 엣지 환경을 위한 llama.cpp, ExecuTorch, MLX; 대규모 서빙을 위한 vLLM과 SGLang; 호스팅 액세스를 위한 Together AI, Fireworks AI, OpenRouter; 그리고 파인튜닝을 원한다면 PyTorch의 TorchTitan까지 지원합니다. (Meta AI)
출시 배경의 정치적 맥락
Muse Glimmer는 단순한 제품이 아닙니다 — 로비 활동의 도구이기도 합니다. Mark Zuckerberg는 출시와 함께 미국이 오픈소스 AI 생태계를 주도해야 한다는 에세이를 발표했으며, 미국 기업들이 추가적인 마찰 — 주로 학습 데이터 제한 — 에 직면해 있는 반면 해외 경쟁자들은 그렇지 않다고 주장했습니다. 그의 처방은 외국 모델을 금지하는 것이 아니라 — 이는 비효과적이라고 일축했습니다 — 국내 경쟁 환경을 공평하게 만드는 것입니다. 그는 Muse Glimmer를 탄생시킨 바로 그 기술인 증류(distillation)를 공개적으로 지지했습니다.
이면에는 Meta가 우려하는 경쟁이 있습니다. 중국 개발자들이 현재 오픈 웨이트 AI에서 속도를 주도하고 있으며, Moonshot의 Kimi K3와 Alibaba의 Qwen이 선두를 달리고, DeepSeek는 가장 저렴하게 실행할 수 있는 유능한 모델들을 출시하고 있습니다. Muse Glimmer는 이에 대한 Meta의 답변입니다 — 같은 방식으로 만들어진 효율적이고 다운로드 가능한 시스템입니다.
투자자 측면도 있습니다. Meta는 시장을 안심시키려 하고 있습니다 — 올해 최대 1,450억 달러로 예측되는 막대한 AI 지출(capex)이 성과를 내고 있으며, 작년 Alexandr Wang 주도로 설립된 Superintelligence Labs가 OpenAI와 Anthropic에 맞서 진전을 이루고 있다는 것을 보여주기 위해서입니다. 오픈 웨이트는 직접적인 수익보다는 개발자와 호감을 얻기 위해 설계된 전략의 일부입니다.
이는 주목할 만한 방향 전환입니다. Meta는 최근 Muse Spark 단계에서 클로즈드 경쟁자들을 따라잡기 위해 독점 모델로 전환한 것처럼 보였습니다; 추론 비용이 급등하고 기업들이 통제권을 원하면서, 다시 오픈 진영으로 돌아온 것입니다.
결론
Muse Glimmer는 오늘의 헤드라인입니다: 지금 바로 다운로드할 수 있는 30B Apache-2.0 오픈 웨이트 로컬 에이전트 모델이며, Muse Spark 1.2 오픈 웨이트도 곧 출시될 예정입니다. GPT나 Claude를 최전선 규모에서 능가하는 것보다는 강력하고 프라이버시를 보호하는 온디바이스 에이전트 — 단일 소비자용 GPU에 맞는 신뢰할 수 있는 도구 사용과 다단계 추론 — 에 더 초점을 맞추고 있습니다. 로컬에서 실행되고 데이터를 자체 하드웨어에 보관하는 에이전트가 로드맵에 포함되어 있다면, Gemma 및 Qwen과 함께 후보 목록에 올려야 할 모델입니다.
이런 오픈 웨이트 모델을 로컬에서 실제 업무에 활용하기
Muse Glimmer 같은 모델은 채팅 박스가 아닌 실제 업무 — 도구, 파일, 코드, 다단계 계획 — 에 연결될 때 비로소 가치를 발휘합니다. 그것이 바로 모델에 구애받지 않는 멀티 에이전트 플랫폼이 필요한 이유입니다. Eigent는 AI 인력을 로컬에서 실행하는 오픈소스 Cowork 데스크톱 앱으로, 작업별로 최적의 오픈 웨이트 모델을 연결하면서 민감한 데이터를 자체 기기에 보관할 수 있습니다. 에이전트가 GitHub PR을 엔드투엔드로 검토하는 방법을 확인하고, Eigent를 다운로드하여 직접 사용해 보세요.
자주 묻는 질문
Meta Muse Glimmer란 무엇인가요?
Muse Glimmer는 Meta Superintelligence Labs에서 2026년 8월 10일 Apache 2.0 라이선스로 출시한 300억 파라미터 오픈 웨이트 멀티모달 모델입니다. Meta의 더 큰 Muse Spark 모델에서 증류되었으며, 단일 소비자용 GPU에서 실행되는 항상 켜져 있는 로컬 AI 에이전트에 최적화되어 있습니다.
Muse Glimmer는 진정한 오픈소스인가요?
Meta는 다운로드, 수정, 자체 호스팅, 상업적 사용을 허용하는 허용적인 Apache 2.0 라이선스로 Hugging Face에 가중치를 공개했습니다. 이는 기존 Llama 커뮤니티 라이선스보다 더 허용적입니다. Meta는 또한 더 강력한 Muse Spark 1.2 모델의 오픈 웨이트도 곧 출시할 예정이라고 밝혔습니다.
Muse Glimmer를 실행하려면 어떤 하드웨어가 필요한가요?
전체 BF16 정밀도에서 모델은 약 55–60 GB의 메모리가 필요합니다. Meta의 공식 ~4비트 양자화는 이를 20 GB 미만으로 줄여 24 GB 또는 32 GB 범위 — RTX 5090과 같은 단일 고성능 소비자용 GPU 또는 고성능 MacBook — 에 맞출 수 있습니다. Ollama, LM Studio, vLLM에서 출시 첫날부터 실행 가능합니다.
Muse Glimmer는 Gemma 및 Qwen과 어떻게 비교되나요?
Meta는 Gemma4-31B 및 Qwen3.6-27B와 벤치마크를 비교하며 동급 크기에서 강력한 에이전트 결과를 보고합니다 — 예를 들어 MCP Atlas에서 54.2와 62.5 대비 75.5를 기록했습니다. 일부 코딩 및 데스크톱 에이전트 작업에서 Qwen과의 결과는 혼재되어 있으며, 모든 수치는 출시 시점에 벤더가 보고한 것이므로 출발점으로 참고하시기 바랍니다.
Muse Spark 1.2는 무엇인가요?
Muse Spark 1.2는 Meta의 더 강력한 기반 모델로 — Muse Glimmer가 증류된 더 큰 형제 모델입니다. Zuckerberg는 Meta가 Muse Spark 1.2의 가중치를 공개할 것이라고 밝혔으며, 이는 더 작은 Glimmer 모델을 넘어 오픈 릴리스로의 복귀를 확장하는 것입니다.
Muse Glimmer를 멀티 에이전트 플랫폼과 함께 사용할 수 있나요?
네. 오픈 웨이트이고 로컬 런타임에서 출시 첫날부터 자체 호스팅이 가능하기 때문에, Eigent와 같은 모델에 구애받지 않는 플랫폼이 에이전트 작업을 Muse Glimmer로 라우팅하면서 데이터를 자체 기기에 보관할 수 있습니다 — 프라이버시나 온디바이스 운영이 중요한 경우에 유용합니다.
Recent Posts

Grok Bot: SpaceXAI의 실제 업무를 수행하는 AI 팀원
Grok Bot은 SpaceXAI와 Cursor의 새로운 AI 에이전트로, 여러분의 도구에 직접 로그인해 실제 업무를 완수하는 팀원입니다. 기능, 사용 대상, 타 제품과의 비교를 정리했습니다.

Grok Bot vs. ChatGPT Work: 어떤 에이전틱 AI 워크포스가 더 뛰어날까?
Grok Bot vs ChatGPT Work 비교: 컴퓨터 사용 에이전트 vs 실행 모드, 자율성, 커넥터, 가격, 그리고 어떤 에이전틱 AI 워크포스가 팀에 적합한지 알아보세요.

Grok Bot vs Claude Cowork: 어떤 AI 동료가 실제로 일을 해낼까?
Grok Bot vs Claude Cowork를 컴퓨터 사용, 지속 메모리, 멀티 에이전트 팀, 가격, 제어 측면에서 비교 — 두 제품 모두 제공하지 않는 오픈소스 동료 옵션까지.