logo
  • 환경
  • 엔터프라이즈
  • 요금제
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small: 더 큰 형제 모델을 능가하는 276B 모델

4분의 1 크기로 Inkling에 필적하거나 능가하는 효율적인 오픈 웨이트 MoE 모델

EigentEigent
Share to
Thinking Machines Inkling-Small: 더 큰 형제 모델을 능가하는 276B 모델
  • Inkling-Small이란?
  • 반전: 소형 모델이 대형 모델을 능가하다
  • Inkling-Small 벤치마크
  • 효율성의 근거: 비용과 연산
  • 멀티모달, 인식론, 안전성
  • 실행 방법
  • 효율적인 오픈 웨이트 모델이 AI 에이전트에 갖는 의미
  • 나만의 AI 인력으로 실현하기
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab이 Inkling-Small을 출시했습니다. 이 오픈 웨이트 Mixture-of-Experts 모델은 총 2760억 개의 파라미터와 120억 개의 활성 파라미터를 보유하며, 첫 번째 모델인 Inkling의 약 4분의 1 크기임에도 불구하고 추론 및 에이전트 코딩에서 Inkling에 필적하거나 능가합니다. 이 모델의 핵심은 규모가 아닌 효율성입니다. 이 가이드에서는 Inkling-Small의 사양, 출시 시 공개된 벤치마크 수치, 운영 비용, 그리고 AI 에이전트를 구축하는 개발자에게 효율적인 오픈 웨이트 모델이 갖는 의미를 다룹니다.

Inkling-Small이란?

Inkling-Small은 전 OpenAI CTO Mira Murati가 설립한 스타트업 Thinking Machines Lab의 두 번째 모델입니다. 이 모델은 연구소의 첫 번째 오픈 웨이트 출시작인 Inkling이 공개된 지 약 2주 후에 등장했으며, 핵심 원칙은 하나입니다. 성능은 유지하되 연산량을 줄이는 것입니다.

연구소의 출시 포스트와 모델 카드에서 발표한 주요 사실은 다음과 같습니다.

  • 총 2760억 개의 파라미터, 120억 개의 활성 파라미터 — 희소 MoE 트랜스포머 구조. Inkling의 총 9750억 개 / 활성 410억 개의 약 4분의 1 수준.
  • 100만 토큰 컨텍스트 윈도우.
  • 네이티브 멀티모달 — Inkling과 동일한 인코더 없는 아키텍처를 사용하여 텍스트, 이미지, 오디오를 처리.
  • 가변 추론 노력(Variable thinking effort) — 추론 수준을 조절하여 정확도와 속도 및 비용을 트레이드오프 가능.
  • Apache 2.0 라이선스의 오픈 웨이트, Hugging Face에서 제공 — 효율적인 추론을 위한 NVFP4 양자화 체크포인트 포함.
  • NVIDIA GB300 NVL72 시스템에서 학습.

아키텍처 측면에서는 42개 레이어의 디코더 전용 트랜스포머로, 각 토큰을 256개의 전문가 중 6개로 라우팅하며, 모든 토큰에 항상 활성화되는 2개의 공유 전문가가 추가됩니다(모델 카드). MoE 설계 방식은 Inkling과 동일한 계보를 따릅니다.

반전: 소형 모델이 대형 모델을 능가하다

놀라운 점은 Inkling-Small이 단순히 Inkling에 근접하는 수준이 아니라, 여러 벤치마크에서 앞서나간다는 것입니다. Thinking Machines는 출시 글에서 그 이유를 설명합니다. Inkling-Small은 더 큰 형제 모델보다 나중에 학습을 시작했기 때문에, 팀이 사전 학습 데이터 구성과 레시피를 개선한 뒤 **Inkling을 교사 모델로 활용한 온-폴리시 증류(on-policy distillation)**로 초기 체크포인트를 사후 학습할 수 있었습니다. 이후 2주간 에이전트 코딩 강화 학습을 추가로 진행했습니다(출시 포스트).

연구소의 표현을 빌리면, 그 결과 Inkling-Small은 추론과 에이전트 코딩에서 Inkling을 능가했으며, Inkling은 지식 범위와 사실성에서 여전히 우위를 유지합니다. 구체적인 예로, Humanity's Last Exam(텍스트 전용)에서 **31.6%**를 기록하여 Inkling의 29.7%를 앞섰으며, 연구소는 이 우위가 모든 추론 예산 수준에서 유지된다고 밝혔습니다.

Inkling-Small 벤치마크

아래의 모든 수치는 effort 0.99로 실행한 출시 결과입니다. 전반적으로 특정 리더보드에서 두드러지기보다는 균형 잡힌 범용 모델의 특성을 보입니다. 자체 평가 하네스가 사용된 경우 별도로 표시합니다.

벤치마크Inkling-SmallInkling비고
SWEBench Verified*80.2%77.6%에이전트 코딩
Terminal Bench 2.1* (최고 하네스)64.7%63.8%에이전트 도구 사용
GPQA Diamond89.5%87.2%추론
HLE (텍스트 전용)31.6%29.7%추론
AIME 202695.5%97.1%수학
ARC-AGI-240.1%36.5%추상적 추론
CritPt8.3%5.4%고난도 물리학
SimpleQA Verified20.6%43.9%사실성 (Inkling 우세)

*SWEBench Verified와 Terminal Bench 2.1은 Inkling 모델에 대해 연구소 자체 코딩 하네스를 사용하며, 외부 모델은 자체 보고 수치를 사용합니다. 이 점을 감안하여 모델 간 비교를 해석하시기 바랍니다. 독립적인 검증이 중요합니다.

두 가지 시사점이 있습니다. 첫째, 에이전트에 가장 중요한 코딩 및 추론 작업에서 소형 모델은 대형 모델과 적어도 동등한 수준입니다. 둘째, 트레이드오프는 사실성입니다. SimpleQA Verified에서 Inkling-Small은 20.6%로, Inkling의 43.9%에 크게 못 미칩니다. 파라미터가 적다는 것은 암기된 세계 지식이 적다는 의미이며, 이는 검색이나 도구가 진가를 발휘하는 영역입니다.

실제 동급 모델과 비교하면, Inkling-Small은 DeepSeek V4 Flash, Qwen3.5-397B-A17B, GLM 5.2 등 오픈 웨이트 경쟁 모델들과 경쟁력을 갖추며, 벤치마크에 따라 승패가 엇갈립니다.

효율성의 근거: 비용과 연산

핵심 가치 제안은 성능 대비 비용 곡선입니다. 토큰당 활성 파라미터가 120억 개에 불과하기 때문에, 유사한 품질 수준에서 Inkling-Small은 Inkling보다 서빙 비용이 저렴합니다.

  • 출력 가격: Inkling-Small은 $1.20 / 100만 토큰으로, Inkling의 $4.05 / 100만 토큰(출시 포스트)의 약 3분의 1 수준입니다.
  • 하드웨어 최소 요구 사항: BF16 체크포인트는 최소 600GB의 집계 VRAM이 필요합니다(예: NVIDIA B300 4개 또는 H200 8개). NVFP4 양자화 체크포인트는 이를 180GB로 줄여 단일 B300에서 실행 가능합니다(모델 카드, MarkTechPost).

단일 GPU 경로는 소규모 팀에게 핵심적인 의미를 갖습니다. 프론티어 연구소 수준의 클러스터 없이도, 스타트업이 임대한 B300 한 대로 2760억 파라미터 멀티모달 모델을 자체 호스팅할 수 있게 됩니다.

멀티모달, 인식론, 안전성

멀티모달. Inkling-Small은 Inkling과 동일한 네이티브 멀티모달 인코더 없는 설계를 사용합니다. 오디오는 dMel 스펙트로그램으로, 이미지는 40×40 패치로 분할하여 처리합니다. 연구소는 차트와 문서를 자르고 확대하는 등의 시각적 작업에 Python을 활용하는 모델의 능력이 향상되었다고 밝혔습니다. 대부분의 멀티모달 평가에서 더 낮은 비용으로 Inkling에 근접한 성능을 보입니다.

인식론. 실제 예측 질문에 대한 적절한 채점 규칙을 기반으로 강화 학습을 통해 보정(calibration)이 학습되었습니다. ForecastBench(검색 없음)에서 Brier Index 61.3 ± 0.46을 기록하여 Inkling의 60.1을 소폭 앞섰습니다(출시 포스트).

안전성. Inkling의 안전 레시피를 계승합니다. StrongREJECT는 **98.4%**이며, FORTRESS에서는 적대적 71.6% / 양성 96.9%를 기록합니다. 연구소는 소비자 대상 배포 시 Llama Guard와 같은 다운스트림 모더레이션을 추가 적용할 것을 권장합니다(MarkTechPost). Inkling과 마찬가지로, 오픈 웨이트를 파인튜닝하는 팀은 자신의 커스터마이징에 대한 안전성을 직접 책임집니다.

실행 방법

세 가지 경로가 있습니다(모델 카드):

  1. Hugging Face에서 가중치 다운로드 — BF16 또는 NVFP4 양자화 체크포인트.
  2. 연구소의 파인튜닝 플랫폼인 Tinker에서 파인튜닝 — API 접근 및 텍스트, 이미지, 오디오 채팅을 위한 Playground도 제공.
  3. 자체 호스팅을 원하지 않는 팀을 위한 서드파티 추론 제공업체 API 활용.

효율적인 오픈 웨이트 모델이 AI 에이전트에 갖는 의미

에이전트를 구축하는 팀에게 Inkling-Small은 Inkling이 시작한 변화를 더욱 선명하게 만듭니다. 자체 인프라에서 유능한 멀티모달 모델을 실행하고, 자신의 도메인에 맞게 파인튜닝하고, 결과물을 비공개로 유지할 수 있습니다. 폐쇄형 제공업체에 API 호출당 비용을 지불할 필요 없이 말입니다. 이제 달라진 점은 경제성입니다. 4분의 1 크기의 모델을 3분의 1 가격에, 단일 GPU 양자화 경로로 이용할 수 있게 되면서, 자체 호스팅이 '프론티어 연구소 예산'에서 '임대 인스턴스 하나'로 현실화됩니다.

가변 추론 노력은 에이전트 네이티브 기능입니다. 어려운 계획 단계에서는 모델을 느리게, 간단한 단계에서는 빠르게 실행할 수 있으며, 이 모든 것이 자체 루프 안에서 이루어집니다. 이는 길고 복잡한 다단계 워크플로우에 정확히 필요한 기능입니다. 오픈 소스 옵션을 비교하고 있다면, 원본 Thinking Machines Inkling 리뷰에서 더 큰 모델과 직접 파인튜닝 방식에 대해 더 자세히 다루고 있습니다.

나만의 AI 인력으로 실현하기

Inkling-Small의 핵심 전제 — 직접 커스터마이징할 수 있는 효율적인 자체 호스팅 모델이 획일적인 솔루션보다 낫다는 것 — 는 Eigent의 철학과 동일합니다. Eigent는 멀티 에이전트 AI 인력을 로컬에서 실행하는 오픈 소스 "Cowork" 데스크톱 앱입니다. Inkling-Small이 파인튜닝하는 기반 모델이라면, Eigent는 그 위에 올라가는 인력 레이어입니다. 실제 다단계 워크플로우를 사용자가 선택한 모델로 자동화하는 에이전트 팀입니다. 벤치마크 표를 읽는 것에서 그치지 않고 오픈 웨이트 모델을 실제로 활용하고 싶다면, Eigent를 다운로드하여 나만의 에이전트 워크플로우를 구축해 보세요.

Recent Posts

Periodic Neon: 실험실 훈련 AI로 최첨단 모델을 능가하는 과학 AI
Sep 18, 2026

Periodic Neon: 실험실 훈련 AI로 최첨단 모델을 능가하는 과학 AI

Periodic Neon은 물리적 실험실 데이터로 훈련된 1조 파라미터 AI로, 회절 분석에서 GPT-6 Astra를 능가합니다. 이 모델이 무엇을 하는지, 왜 중요한지 알아보세요.

EigentEigent
Jev란 무엇인가? TypeSafe AI의 System One 모델 설명
Sep 18, 2026

Jev란 무엇인가? TypeSafe AI의 System One 모델 설명

TypeSafe AI의 Jev는 텍스트 대신 타입이 지정된 확률적 결정을 반환하는 System One 모델입니다. 작동 방식, 비용, 그리고 활용 위치를 알아보세요.

EigentEigent
Meta Muse: 예약, 구매, 협상까지 처리하는 개인 AI 에이전트
Sep 9, 2026

Meta Muse: 예약, 구매, 협상까지 처리하는 개인 AI 에이전트

Meta Muse는 채팅으로 여행 예약, 쇼핑, 요금 협상까지 처리하는 개인 AI 에이전트입니다. 기능, 가격, 보안, 비교 분석을 확인하세요.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

오늘 Eigent를 사용해보세요

오픈 소스 데스크톱 앱을 다운로드하세요. 여러분의 AI 워크포스가 여러분의 기기에서 실행됩니다.

Eigent 다운로드
Eigent

AI 워크포스 자동화에 대한 최신 소식, 튜토리얼, 출시 정보를 받아보세요.

구독해 주셔서 감사합니다!

제품Eigent환경요금엔터프라이즈
둘러보기솔루션활용 사례스킬플러그인블로그
개발자문서GitHubCAMEL-AI오픈소스 펀드파트너
다운로드오픈 소스용
회사회사 소개브랜드채용이용약관개인정보처리방침보안 및 신뢰쿠키 정책환불 및 체험 정책

모든 권리 보유 © 2026 EIGENT UK LTD