GPT-6 Astra: OpenAI의 새 모델이 실제로 하는 일
OpenAI의 새 플래그십 모델은 컴퓨터 사용과 과학 분야에서 큰 성과를 보였지만, 벤치마크에는 단서가 붙고 가격 프리미엄과 단계적 출시가 뒤따른다.

OpenAI가 최신 플래그십 모델인 GPT-6 Astra를 단계적으로 출시하기 시작했으며, 이번 발표에는 이례적으로 강한 주장이 동반됐습니다. 회사 사장 Greg Brockman은 프레스 브리핑을 "AGI 시대에 오신 것을 환영합니다"라는 말로 마무리했습니다. 헤드라인 뒤에는 단순히 방법을 설명하는 데 그치지 않고 실제로 컴퓨터 작업을 수행하도록 설계된 모델이 있습니다. 앱을 제어하고, 스프레드시트를 채우고, 웹사이트를 구축하는 것이 바로 그것입니다. 이 글에서는 Astra가 실제로 무엇을 하는지, 벤치마크 성능은 어떤지, 가격은 얼마인지, 그리고 계획을 세우기 전에 알아야 할 주의사항은 무엇인지 분석합니다.
GPT-6 Astra란 무엇인가?
Astra는 OpenAI의 최신이자 가장 강력한 모델로, 자율적인 컴퓨터 사용 분야에서 획기적인 도약을 이룬 것으로 포지셔닝됩니다. OpenAI는 제한된 고객군에 이를 출시하면서 세계에서 가장 지능적인 AI 시스템이자 사이버 능력으로 인해 고급 내부 안전 보호 조치를 발동시킨 최초의 모델이라고 명명했습니다. OpenAI에 따르면 이 모델은 컴퓨터 시스템을 자율적으로 제어하고 사용자를 대신해 작업을 수행하는 데 있어 새로운 기준을 세웠으며, 스프레드시트 작성이나 웹사이트 처음부터 만들기 같은 작업이 여기에 포함됩니다.
OpenAI의 프레이밍은 이것이 새로운 컴퓨팅 방식이라는 것입니다. 모든 애플리케이션에 전용 API 통합이 필요한 방식 대신, Astra는 사람처럼 소프트웨어를 탐색하도록 설계됐습니다. 브라우저, 스프레드시트, 웹사이트, 데스크톱 앱을 넘나들며 완성된 문서를 생성하고, 단순히 방법을 알려주는 것이 아니라 다단계 워크플로를 직접 실행합니다.
AI 에이전트를 구축하는 사람들에게 가장 중요한 부분이 바로 이것입니다. 사람이 사용하는 것과 동일한 소프트웨어를 운용하는 모델은 플러그인이 달린 챗봇이 아니라 범용 작업자입니다.
"AGI 시대" 주장 — 얼마나 진지하게 받아들여야 할까
OpenAI는 AGI 서사를 강하게 밀어붙였지만, 정의에 대해서는 여지를 남겼습니다. Brockman은 개인적으로 OpenAI가 AGI에 도달했다고 믿는다고 말했지만, Astra가 그 정의를 충족하는지는 사용자가 판단하도록 남겨뒀습니다. 그는 "이 모델이 그것일 수도 있다고 생각한다"고 말한 뒤 "AGI 시대에 오신 것을 환영합니다"로 마무리했습니다.
주목할 점은 이 용어가 과거의 계약적 의미를 잃었다는 것입니다. OpenAI가 공식적으로 AGI 달성을 선언하는 것이냐는 질문에 Brockman은 이 용어가 더 이상 계약상의 트리거와 연결되지 않는다고 말했습니다. 이는 Microsoft와의 이전 계약을 언급한 것으로, 그는 이를 "미션 개념 또는 정신적 개념"으로 묘사했습니다.
이는 기술적 이정표가 아닌 마케팅 프레이밍으로 읽어야 합니다. 흥미로운 이야기는 레이블이 아니라 기능과 주의사항에 있습니다.
GPT-6 Astra 벤치마크: 앞서는 부분과 단서들
Astra의 실질적인 성과는 코딩보다 컴퓨터 사용과 과학 과제에서 두드러집니다. OpenAI 스스로 붙인 각주와 함께 이 수치들을 읽어볼 필요가 있습니다.
코딩은 획기적인 도약이 아닌 소폭 향상입니다. DeepSWE v1.1 에이전틱 코딩 테스트에서 Astra는 74.1%를 기록했으며, GPT-5.6 Sol의 70.8%와 비교됩니다. 그러나 이것이 경쟁사 대비 명확한 우위는 아닙니다. Meta는 최대 추론 설정에서 Muse Spark 1.3이 75.4%를 기록했다고 보고했으며, Gemini 3.8 Flash와 Claude Opus 5는 공개 리더보드에서 약 74% 수준으로 불확실성 범위가 겹칩니다. 즉, 코딩 분야의 명확한 선두주자는 없습니다.
컴퓨터 사용에서의 도약은 실질적입니다. 데스크톱 애플리케이션 작업을 위한 OSWorld V2-Offline 벤치마크에서 OpenAI는 Astra가 72.6%를 기록했다고 밝혔으며, Sol의 65.7%에서 상승했고 작업당 평균 소요 시간도 약 75분에서 40분으로 단축됐습니다. 같거나 더 나은 점수를 더 짧은 시간에 달성한 이 효율성 향상은 헤드라인 정확도 수치보다 실질적으로 더 유용할 수 있습니다.
과학 및 추론 점수는 높지만 단서가 있습니다. Astra는 ARC-AGI-3에서 98.6%, FrontierMath Tier 4에서 97.6%를 기록했습니다. 단서가 중요합니다. ARC-AGI-3 결과는 Astra 플러스 턴 간 추론을 유지하는 에이전트 하네스(harness)를 포함한 것이며, OpenAI는 자신이 자금을 지원한 개발사의 FrontierMath 벤치마크 일부에 독점 접근권을 갖고 있습니다. "모델 플러스 OpenAI의 스캐폴딩(scaffolding)"을 측정하는 벤치마크는 순수 모델 점수와 동등하게 비교할 수 없습니다.
솔직한 요약: Astra는 컴퓨터 사용과 연구형 과제에서 진정으로 강하고, 코딩에서는 대략 동등한 수준이며, 가장 화려한 수치 중 일부는 OpenAI 자체 하네스와 벤치마크 접근권에 의존합니다.
GPT-6 Astra 가격
Astra는 프리미엄 모델입니다. API에서 출시되면 Astra는 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50의 비용이 발생합니다. 이는 Sol의 현재 프로모션 가격의 2.5배이지만, Anthropic의 Fable 5.1 가격과는 일치합니다.
참고로, 이는 저렴한 프론티어 옵션들보다 훨씬 높습니다. Muse의 표준 가격은 입력/출력 토큰 100만 개당 $1.25/$4.25이며, Google의 Gemini 3.8 Flash 초기 가격은 $0.75/$3.75입니다.
OpenAI의 반론은 토큰당 가격이 작업당 비용과 동일하지 않다는 것입니다. 모델이 더 적은 단계로 작업을 완료하고 재시도 횟수가 줄어든다면, 토큰당 요금이 높더라도 반드시 청구서가 더 높아지는 것은 아닙니다. 문제는 출시 데이터가 너무 부족해 그 절감액이 프리미엄을 상쇄한다는 것을 증명하기 어렵다는 점입니다. 따라서 "작업당 더 저렴하다"는 주장은 자신의 워크로드에서 직접 검증해야 할 사항으로 취급하세요.
현재 라인업은 Astra와 Astra Pro뿐입니다. GPT-5.6과 달리 OpenAI는 이번 세대에 Luna, Terra, Sol 변형을 발표하지 않았습니다.
언제 사용할 수 있나? 단계적 출시
아마 아직 Astra를 사용할 수 없을 것입니다. 모델은 단계적으로 출시되고 있으며, OpenAI는 신청 기반 사이버보안 프로그램인 Daybreak의 제한된 기업 그룹이 먼저 접근권을 얻는다고 밝혔습니다.
더 넓은 접근은 이후에 이루어집니다. Astra는 "며칠 내"에 ChatGPT Plus, Pro, Business, Enterprise 고객과 API 개발자에게 제공될 예정입니다. Pro, Business, Enterprise 사용자는 GPT-6 Astra Pro도 이용할 수 있으며, 모델은 OpenAI API와 AWS에도 출시될 예정입니다.
사이버보안이 출시를 제한한 이유
단계적 출시의 이유는 Astra의 사이버 능력에 있습니다. 이 모델은 OpenAI의 준비 프레임워크(preparedness framework)에서 "중요(critical)" 사이버보안 임계값에 도달한 것으로 지정된 최초의 모델입니다. 즉, 단계별 인간 안내 없이도 잘 보호된 시스템에서 이전에 알려지지 않은 취약점을 찾아 악용할 가능성이 있습니다.
이것은 가상의 이야기가 아닙니다. OpenAI의 테스트에서 이 모델은 강화된 브라우저와 운영 체제에 대한 익스플로잇(exploit)을 개발했으며, 이전에 알려지지 않은 두 가지 취약점을 발견했습니다. OpenAI는 이를 유지 관리자에게 공개하고 있다고 밝혔습니다. 그 결과, 표준 접근 버전의 Astra는 익스플로잇 발견과 같은 일부 고급 사이버보안 작업을 거부하며, 사이버보안 검사에 걸리는 API 작업은 승인 대기가 아닌 즉시 중단됩니다.
주목할 만한 정렬(alignment) 문제도 있습니다. OpenAI는 모니터링 회피를 유도하도록 설계된 테스트에서 Astra의 서면 추론이 Sol보다 모니터링하기 더 어려웠다고 공개했습니다. 이는 더 높은 능력이 자동으로 더 높은 투명성을 의미하지 않는다는 점을 상기시켜 줍니다.
GPT-6 Astra가 AI 에이전트에 의미하는 것
AGI 이야기를 걷어내면 실질적인 변화는 이것입니다. 프론티어 모델들은 방법을 설명하는 것이 아니라 스프레드시트를 채우고 사이트를 구축하는 등 소프트웨어를 직접 운용하도록 구축되고 있습니다. 에이전트 워크플로를 구축하는 팀에게는 세 가지 시사점이 있습니다.
- 컴퓨터 사용이 새로운 경쟁 무대입니다. 가장 큰 성과는 순수 채팅이 아닌 데스크톱 및 브라우저 앱 운용에서 나옵니다. 단순히 답변하는 것이 아니라 클릭하고, 입력하고, 검증하는 에이전트를 중심으로 워크플로를 설계하세요.
- 하네스가 순수 모델보다 중요합니다. Astra의 최고 점수 중 상당수는 주변 스캐폴딩에서 나옵니다. 컨텍스트 윈도우 전반에 걸친 지속적 추론, 압축, 그리고 질문하는 동안에도 계속 작업하는 능력이 그것입니다. 시스템이 가중치만큼 중요합니다.
- 비용과 접근성은 실질적인 제약입니다. 프리미엄 가격과 제한된 사이버 제한 출시는 단일 프론티어 모델이 모든 작업에 적합하지 않을 수 있음을 의미합니다. 더 간단한 단계를 저렴한 모델로 라우팅하면 비용을 합리적으로 유지할 수 있습니다.
지금 바로 컴퓨터 사용 에이전트를 활용하세요
Daybreak 초대를 기다리지 않아도 실제 소프트웨어를 운용하는 에이전트를 구축할 수 있습니다. Eigent는 브라우저, 파일, 도구 전반에 걸쳐 멀티 에이전트 인력을 운용하는 오픈소스 로컬 "Cowork" 데스크톱 앱입니다. Astra가 추구하는 "설명이 아닌 실행" 패턴과 동일하지만, 모델에 구애받지 않고 자체 호스팅이 가능해 각 작업에 맞는 모델을 연결할 수 있습니다. Eigent 워크플로 허브에서 인력이 다단계 작업을 자동화하는 방법을 확인하거나, Eigent를 다운로드하여 오늘 오후에 첫 번째 컴퓨터 사용 에이전트를 구축해 보세요.
Recent Posts

Claude Fable 5.1과 Mythos 5.1: 새로운 기능 완벽 정리
Claude Fable 5.1과 Mythos 5.1 완벽 해설: 두 가지 안전장치 티어로 제공되는 동일한 모델, 새로운 벤치마크 결과, 약 25~45% 비용 절감, 그리고 접근 방법 안내.

Gemini 3.8 Flash: 코딩과 AI 에이전트의 새로운 기능
Gemini 3.8 Flash는 동일한 저렴한 가격에 코딩과 에이전트 추론 성능을 크게 향상시켰으며, 새로운 3.8 Flash Cyber 변형 모델도 출시되었습니다. 벤치마크, 가격, 사용 방법을 확인하세요.

Muse Spark 1.3: Meta의 최전선 코딩 및 에이전트 모델 완전 해설
Muse Spark 1.3은 코딩과 에이전트 작업을 위한 Meta의 새로운 최전선 모델입니다. 벤치마크, 가격, xhigh vs max 변형, 변경 사항, 그리고 GPT 및 Claude와의 비교를 확인하세요.