Thinking Machines Inkling: Mira Murati의 첫 번째 오픈 웨이트 모델 내부 살펴보기
리더보드 1위가 아닌 파인튜닝을 위해 설계된 975B 파라미터 멀티모달 MoE.

전 OpenAI CTO Mira Murati가 설립한 스타트업 Thinking Machines Lab이 자체 개발한 첫 번째 모델 Inkling을 공개했습니다. Inkling은 오픈 웨이트(open-weights) 멀티모달 Mixture-of-Experts 시스템입니다. 놀라운 점은 규모가 아니라 전략입니다. Inkling은 벤치마크 1위를 차지하기 위해 만들어진 것이 아니라, 이를 도입하는 조직이 직접 다운로드하고 파인튜닝하며 재구성할 수 있도록 설계되었습니다. 이 가이드에서는 Inkling의 사양, 벤치마크, "조절 가능한 추론 노력(controllable thinking effort)" 개념, 그리고 AI 에이전트를 구축하는 경우 오픈 웨이트 베이스 모델이 갖는 의미를 살펴봅니다.
Inkling이란 무엇인가?
Inkling은 Thinking Machines Lab의 첫 번째 공개 모델로, 2026년 7월 15일에 출시되었습니다. 약 18개월간의 비공개 인프라 작업 이후 나온 첫 번째 실질적인 성과물입니다 (TechCrunch).
연구소의 공식 출시 포스트에서 밝힌 주요 사실은 다음과 같습니다:
- 총 파라미터 975B, 활성 파라미터 41B — 토큰당 가중치의 일부만 활성화하는 Mixture-of-Experts (MoE) 트랜스포머로, 매우 큰 모델을 더 빠르고 저렴하게 실행할 수 있습니다.
- 100만 토큰 컨텍스트 윈도우.
- 45조 토큰으로 사전 학습 — 텍스트, 이미지, 오디오, 비디오를 포함하며 네 가지 모달리티 전반에 걸쳐 네이티브 추론이 가능합니다. 현재 출력은 코드, 구조화된 데이터, 스타일이 적용된 아티팩트 등 텍스트 형태입니다.
- 오픈 웨이트 — 전체 가중치가 Hugging Face에 공개되어 있으며, 원본 체크포인트와 NVIDIA Blackwell에서의 효율적인 추론을 위한 NVFP4 체크포인트 두 가지 형태로 제공됩니다.
- Inkling-Small 프리뷰 — 낮은 비용과 지연 시간을 위해 튜닝된 276B MoE (활성 파라미터 12B).
연구소 스스로 밝힌 가장 인상적인 문구는 다음과 같습니다: Inkling은 "오픈 또는 클로즈드 모델을 통틀어 현재 가장 강력한 모델이 아닙니다." 이것은 단순한 단서 조항이 아니라 전체 전략 그 자체입니다.
핵심 전략: 직접 파인튜닝하세요
대부분의 프론티어 연구소들 — OpenAI, Anthropic, Google — 은 범용 챗봇을 먼저 출시한 뒤 에이전트 기능을 추가하는 방식을 택합니다. Inkling은 이를 뒤집습니다. Thinking Machines는 Inkling을 완성된 제품보다는 커스터마이징을 위한 베이스로 마케팅합니다. 즉, 조직이 연구소의 파인튜닝 플랫폼인 Tinker를 통해 자체 워크플로우에 맞게 조정할 수 있는 폭넓고 균형 잡힌 파운데이션 모델입니다.
출시 전 공개된 회사 포스트에서 제시된 논거는, 중앙에서 학습된 후 동결된 모델은 각 조직이 자체 전문성에 맞게 조정할 수 있는 모델보다 성능이 떨어진다는 것입니다. 이 관점은 외부에서도 지지를 받고 있습니다. Microsoft의 Satya Nadella는 최근 클로즈드 모델에 의존하는 기업들이 사실상 "두 번 비용을 지불한다"고 경고했습니다 — 구독료로 한 번, 그리고 독점 지식을 타사의 미래 모델 버전에 제공함으로써 또 한 번 (TechCrunch).
Thinking Machines가 제시하는 가장 명확한 사례는 헤지펀드 Bridgewater Associates와의 프로젝트입니다. 연구원들이 Bridgewater의 금융 전문 지식으로 오픈 모델을 파인튜닝한 결과, 금융 추론 테스트에서 84.7%를 기록했으며 최고 수준의 독점 모델 대비 약 14분의 1의 비용으로 운영할 수 있었다고 합니다. 단, 이 수치는 두 회사의 자체 평가에서 나온 것으로 독립적인 검증을 거치지 않았다는 점을 유의해야 합니다.
트레이드오프는 리스크의 소유권입니다. 고객이 직접 Inkling을 파인튜닝하기 때문에, 커스터마이징의 안전성 유지 책임은 Thinking Machines가 아닌 고객에게 있습니다. 또한 이 수준의 파인튜닝에는 실질적인 머신러닝 역량이 필요합니다.
조절 가능한 추론 노력
에이전트 활용 측면에서 가장 주목할 만한 기능은 **조절 가능한 추론 노력(controllable thinking effort)**입니다. Inkling은 정확도와 속도·비용을 맞바꾸는 방식으로 추론 수준을 높이거나 낮출 수 있으며, 이 설정은 코딩 또는 에이전트 하네스 내부에서 조정할 수 있습니다. Hugging Face transformers에서는 명명된 레벨을 가진 reasoning_effort 인수로 노출됩니다.
이것이 중요한 이유: 프로덕션 에이전트에서 실질적인 제약은 대개 피크 벤치마크 점수가 아니라 비용과 지연 시간입니다. Inkling의 출시 자료는 노력 설정을 0.2에서 0.99까지 스윕하며, 경쟁 모델들이 기본값으로 달성하는 점수를 더 적은 토큰으로 달성하는 것을 보여줍니다. 대표적인 예시: Terminal Bench 2.1에서 Inkling은 NVIDIA의 Nemotron 3 Ultra와 동등한 성능을 약 3분의 1의 토큰으로 달성합니다.
흥미롭게도, 이 효율성은 강화 학습 과정에서 부분적으로 자연스럽게 나타났습니다. 3천만 회 이상의 RL 롤아웃을 거치면서 Inkling의 사고 연쇄(chain of thought)는 스스로 더 간결해졌습니다 — 관사와 접속사를 생략하면서도 이해 가능성을 유지하고 동일한 답에 도달했습니다. 이 압축은 직접적인 학습 목표가 아닌 효율성 자체에 의해 이루어졌습니다.
Inkling의 벤치마크
Inkling은 절대적인 선두 모델이 아닌 경쟁력 있는 오픈 웨이트 모델로 포지셔닝되어 있습니다. 출시 자료에서 제시된 대표적인 결과(노력 설정 0.99 기준)는 다음과 같습니다:
- SWEBench Verified: 77.6% — Nemotron 3 Ultra (70.7%) 앞서며, Kimi K2.6 (80.2%) 및 GLM 5.2 (80.0%)와 비슷한 수준, Claude Fable 5 (95.0%) 등 클로즈드 모델에는 뒤처짐.
- Terminal Bench 2.1 (최적 하네스): 63.8% — 오픈 웨이트 중 중간 수준; GLM 5.2 (82.7%)에 뒤처짐.
- GPQA Diamond: 87.2%; AIME 2026: 97.1% — 강력한 추론 능력.
- FORTRESS (적대적 안전성): 78.0% — 연구소가 비교한 오픈 웨이트 모델 중 가장 높은 내장 안전장치, 무해한 유사 쿼리에 대한 과도한 거부 없음.
- 멀티모달: MMMU Pro (비전) 73.5%, VoiceBench (오디오) 91.4% — 오픈 웨이트 옴니 모델 중 상위권 결과.
패턴은 의도적입니다: 단일 리더보드에서 급등하는 것이 아니라 텍스트, 에이전트, 멀티모달, 안전성 전반에 걸쳐 폭넓고 균형 잡힌 성능을 추구합니다. 여러 점수가 연구소 자체 또는 자체 보고 하네스에 의존하고 있어 독립적인 검증이 중요합니다.
구축 방법 (그리고 증류 문제)
기술적으로 궁금한 분들을 위한 아키텍처 참고 사항입니다. MoE 설계는 대체로 DeepSeek-V3를 따릅니다 (라우팅 전문가 256개, 공유 전문가 2개, 토큰당 활성 전문가 6개). 어텐션은 슬라이딩 윈도우와 글로벌 레이어를 5:1 비율로 교차하며, 주목할 점으로 Thinking Machines는 **RoPE 대신 상대적 위치 임베딩(relative positional embeddings)**을 사용하여 더 나은 길이 외삽(length extrapolation)을 보고합니다. 학습에는 NVIDIA GB300 NVL72 시스템에서 하이브리드 Muon/Adam 옵티마이저가 사용되었습니다.
회사가 솔직하게 인정하는 한 가지 주의 사항: 포스트 트레이닝을 부트스트랩하기 위해 다른 오픈 모델이 생성한 합성 데이터로 초기 지도 파인튜닝을 실행했으며, Moonshot AI의 Kimi K2.5도 포함되었습니다 — 이는 증류(distillation)로 알려진 방식입니다. 연구소는 이것이 전체 컴퓨팅의 소량에 불과하며 다음 모델에서는 완전히 자체적인 포스트 트레이닝을 사용할 것이라고 밝혔습니다.
속도에 대한 주장도 핵심 논거 중 하나입니다: OpenAI는 기술을 시장에 출시하는 데 약 5년이 걸렸고 Anthropic은 약 3년이 걸렸지만, Thinking Machines는 약 9개월 만에 해냈다고 말합니다.
AI 에이전트에서 오픈 웨이트가 중요한 이유
에이전트를 구축하는 팀에게 흥미로운 변화는 파라미터 수가 아니라 배포 모델입니다. 오픈 웨이트 베이스는 경제성을 바꿉니다: 클로즈드 제공업체에 API 호출당 비용을 지불하는 대신, 자체 인프라에서 모델을 실행하고, 자체 도메인에 맞게 파인튜닝하며, 결과 모델을 비공개로 유지할 수 있습니다. 이것은 로컬 오픈 에이전트 스택에 대한 관심을 이끄는 "자체 인력 보유" 논리와 동일합니다.
Inkling의 조절 가능한 추론 노력과 에이전트 하네스 학습은 이러한 환경에 잘 맞습니다. 어려운 단계에서는 느리게, 간단한 단계에서는 빠르게 — 자체 에이전트 루프 내에서 — 조정할 수 있는 모델은 길고 복잡한 다단계 워크플로우에 정확히 필요한 것입니다. 오픈 옵션을 검토 중이라면, Inkling이 비교 대상으로 삼는 다른 프론티어급 오픈 웨이트 모델들을 다룬 DeepSeek V4 Pro, GLM-5.2, Kimi K2.7 Code 리뷰를 참고하세요.
자체 오픈소스 AI 인력으로 실행해 보세요
Inkling의 핵심 전제 — 적응 가능하고 자체 호스팅된 AI가 획일적인 AI를 능가한다 — 는 멀티 에이전트 AI 인력을 로컬에서 실행하는 오픈소스 "Cowork" 데스크톱 앱 Eigent의 배경과 동일한 전략입니다. Inkling이 파인튜닝하는 베이스 모델이라면, Eigent는 그 위에 올라가는 인력 레이어입니다: 사용자가 선택한 모델을 사용하여 자신의 컴퓨터에서 실제 다단계 워크플로우를 자동화하는 에이전트 팀입니다. 벤치마크를 읽는 것에서 그치지 않고 오픈 웨이트 모델을 실제로 활용하고 싶다면, Eigent를 다운로드하고 지금 바로 자체 에이전트 워크플로우를 구축해 보세요.
Recent Posts

Eigent v1.0.3 릴리스 노트: 지속형 Task, Git 기반 Space, Workspace Bundle
Eigent v1.0.3은 Task 복구, Git 기반 Space, Session 내 도구, 파일 변경 검토, Workspace Bundle, 범위별 Memory, Ant Ling 지원을 추가합니다.

GLM-5.3-Flash: Z.ai의 멀티모달 모델, 10분의 1 가격으로
GLM-5.3-Flash 완전 분석: Z.ai의 첫 번째 네이티브 멀티모달 GLM-5 모델, 320B-A18B 하이브리드 아키텍처, MIT 라이선스, 1M 컨텍스트, 벤치마크, 가격 정보.

Cursor Origin: AI 에이전트를 위한 Git 포지, 완전 해설
Cursor Origin은 에이전트 시대를 위한 git 포지입니다. 얼리 베타에서 출시된 기능, GitHub 미러링 작동 방식, 에이전트가 할 수 있는 것, 그리고 현재 아직 부족한 점을 살펴봅니다.