logo
  • 环境
  • 企业版
  • 价格
Blogs
Sep 3, 2026

GPT-6 Astra:OpenAI 新模型究竟能做什么

OpenAI 最新旗舰模型在计算机操控与科学任务上取得重大突破——但基准测试存在注脚,定价偏高,且分阶段推出。

EigentEigent
Share to
GPT-6 Astra:OpenAI 新模型究竟能做什么
  • GPT-6 Astra 是什么?
  • "AGI 时代"的声明——该如何看待?
  • GPT-6 Astra 基准测试:领先之处与注脚
  • GPT-6 Astra 定价
  • 何时可以使用?分阶段推出计划
  • 为何网络安全因素限制了发布节奏
  • GPT-6 Astra 对 AI 智能体意味着什么
  • 立即部署计算机操控智能体
Automate Everything with
AI Workforce on Desktop
Download Eigent

OpenAI 已开始推出其最新旗舰模型 GPT-6 Astra,此次发布伴随着一个异常高调的声明:公司总裁 Greg Brockman 在新闻发布会结束时说道:"欢迎来到 AGI 时代。"这一标题背后,是一个专为执行计算机任务而生的模型——控制应用程序、填写电子表格、搭建网站——而非仅仅描述如何操作。本文将详细解析 Astra 的实际功能、基准测试表现、定价方案,以及在将其纳入规划之前值得了解的注意事项。

GPT-6 Astra 是什么?

Astra 是 OpenAI 迄今最强大的模型,定位为自主计算机操控能力的重大飞跃。OpenAI 向有限数量的客户发布了该模型,将其标榜为全球最智能的 AI 系统,也是首个因其网络安全能力而触发内部高级安全保护措施的模型。该公司表示,Astra 在自主控制计算机系统、代表用户执行任务方面树立了新的标杆——例如填写电子表格、从零开始创建网站。

OpenAI 的定位是:这是一种全新的计算模式。无需为每个应用程序单独进行 API 集成,Astra 被设计为像人一样操控软件——跨浏览器、电子表格、网站和桌面应用运行,生成完整文档,执行多步骤工作流,而不仅仅是告诉你该怎么做。

对于构建 AI 智能体(AI agents)的开发者而言,这一点至关重要:一个能操控人们日常使用软件的模型,是通用型工作者,而非带插件的聊天机器人。

"AGI 时代"的声明——该如何看待?

OpenAI 大力渲染 AGI 叙事,但对定义有所保留。Brockman 表示他个人认为 OpenAI 已达到 AGI,同时将判断权留给用户——他说"我认为这个模型可能就是了",随后以"欢迎来到 AGI 时代"作结。

值得注意的是,这一术语已失去其原有的合同约束力。当被问及 OpenAI 是否正式宣布实现 AGI 时,Brockman 表示该术语不再与合同触发条款挂钩——这指的是此前与 Microsoft 的协议——并将其描述为"使命概念或精神概念"。

将其理解为营销话语而非技术里程碑更为恰当。真正值得关注的是模型的能力与注意事项,而非标签本身。

GPT-6 Astra 基准测试:领先之处与注脚

Astra 的真正进步体现在计算机操控和科学任务上,而非编程。阅读这些数据时,有必要关注 OpenAI 自身附加的注脚。

编程能力是小幅提升,而非突破性飞跃。 在 DeepSWE v1.1 智能体编程测试中,Astra 得分 74.1%,而 GPT-5.6 Sol 为 70.8%。但这并不意味着对竞争对手的明显领先——Meta 报告 Muse Spark 1.3 在最大推理设置下达到 75.4%,Gemini 3.8 Flash 和 Claude Opus 5 在公开排行榜上约为 74%,且不确定性范围有所重叠。换言之,目前没有明确的编程领域王者。

计算机操控是真正的突破所在。 在桌面应用操控基准测试 OSWorld V2-Offline 中,OpenAI 表示 Astra 得分 72.6%,高于 Sol 的 65.7%,每项任务的平均耗时从约 75 分钟缩短至 40 分钟。这种效率提升——以更短时间取得相同甚至更好的成绩——可以说比单纯的准确率数字更具实用价值。

科学与推理得分较高,但存在注脚。 Astra 在 ARC-AGI-3 上得分 98.6%,在 FrontierMath Tier 4 上得分 97.6%。注脚不可忽视:ARC-AGI-3 的结果反映的是 Astra 加上一个在对话轮次间保留推理的智能体框架,而 OpenAI 对部分 FrontierMath 基准拥有独家访问权,且该基准的开发者由 OpenAI 资助。衡量"模型加 OpenAI 框架"的基准测试,与原始模型得分并不具有直接可比性。

客观总结:Astra 在计算机操控和研究型任务上确实表现强劲,编程能力大致与竞争对手持平,而其中几个最亮眼的数字依赖于 OpenAI 自有框架和基准访问权限。

GPT-6 Astra 定价

Astra 是一款高端模型。一旦在 API 中上线,Astra 的定价为每百万输入 token 10 美元、每百万输出 token 50 美元——是 Sol 当前促销价格的 2.5 倍,但与 Anthropic 的 Fable 5.1 定价持平。

作为参考,这远高于更经济的前沿模型选项。Muse 的标准价格为每百万输入/输出 token 1.25 美元/4.25 美元,Google Gemini 3.8 Flash 的入门价格为 0.75 美元/3.75 美元。

OpenAI 的反驳论点是:每 token 价格不等于每任务成本——如果模型能以更少步骤完成任务、减少重试次数,更高的每 token 费率不一定意味着更高的账单。问题在于,发布时的数据过于稀少,无法证明这些节省能够抵消溢价,因此"每任务成本更低"这一说法需要在自身工作负载上加以验证。

目前产品线仅有 Astra 和 Astra Pro——与 GPT-5.6 不同,OpenAI 尚未为本代产品宣布 Luna、Terra 和 Sol 变体。

何时可以使用?分阶段推出计划

你现在很可能还无法使用 Astra。该模型正在分阶段推出,OpenAI 表示其基于申请的网络安全项目 Daybreak 中的有限企业客户将获得优先访问权。

更广泛的访问权限随后跟进。Astra 将在"未来几天内"向 ChatGPT Plus、Pro、Business 和 Enterprise 用户及 API 开发者开放。Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro,该模型也计划登陆 OpenAI API 和 AWS。

为何网络安全因素限制了发布节奏

分阶段推出的原因在于 Astra 的网络安全能力。它是 OpenAI 首个被认定达到其"关键"网络安全阈值的模型——根据其准备框架,这意味着该模型有可能在无需逐步人工指导的情况下,在受到严密保护的系统中发现并利用未知漏洞。

这并非假设。在 OpenAI 的测试中,该模型为经过加固的浏览器和操作系统开发了漏洞利用程序,并发现了两个此前未知的漏洞,OpenAI 表示正在向相关维护者披露。因此,Astra 的标准访问版本拒绝执行某些高级网络安全任务(如漏洞发现),触发网络安全检查的 API 任务将被直接停止,而非暂停等待审批。

还有一个值得关注的对齐问题:OpenAI 披露,在旨在引发监控规避的测试中,Astra 的书面推理过程比 Sol 更难以监控——这提醒我们,更强的能力并不自动意味着更高的透明度。

GPT-6 Astra 对 AI 智能体意味着什么

抛开 AGI 的话语,实际转变在于:前沿模型正被构建为直接操控软件,填写电子表格、搭建网站,而非描述如何操作。对于构建智能体工作流的团队,有三点值得关注:

  • 计算机操控是新的竞争焦点。 最大的进步在于操控桌面和浏览器应用,而非原始对话能力。围绕能够点击、输入和验证的智能体设计工作流——而不仅仅是回答问题。
  • 框架比原始模型更重要。 Astra 的几项最佳得分来自其周边框架:跨上下文窗口的持久推理、压缩机制,以及在向用户提问的同时继续工作的能力。系统架构与模型权重同等重要。
  • 成本与访问权限是真实约束。 高溢价定价和受限的、网络安全审查的分阶段推出,意味着单一前沿模型并不适合所有任务。将较简单的步骤路由至更经济的模型,才能控制成本。

立即部署计算机操控智能体

无需等待 Daybreak 邀请,你今天就可以构建能操控真实软件的智能体。Eigent 是一款开源本地"协作"桌面应用,可在浏览器、文件和工具之间运行多智能体工作团队——与 Astra 所追求的"执行任务,而非描述任务"模式相同,但不依赖特定模型且支持本地部署,让你可以为每项任务接入最合适的模型。欢迎访问 Eigent 工作流中心,了解多智能体团队如何自动化多步骤任务,或下载 Eigent,今天下午就构建你的第一个计算机操控智能体。

Recent Posts

Claude Fable 5.1 与 Mythos 5.1:新功能详解
Sep 3, 2026

Claude Fable 5.1 与 Mythos 5.1:新功能详解

Claude Fable 5.1 与 Mythos 5.1 详解:同一模型的两个安全防护层级,附最新基准测试成绩、约 25% 至 45% 的成本降幅及访问方式说明。

EigentEigent
Gemini 3.8 Flash:编程与 AI 智能体的全新升级
Sep 3, 2026

Gemini 3.8 Flash:编程与 AI 智能体的全新升级

Gemini 3.8 Flash 在保持与 3.7 Flash 相同低价的前提下,大幅提升了编程能力和智能体推理能力,并推出全新的 3.8 Flash Cyber 变体。本文涵盖基准测试、定价及使用方法。

EigentEigent
Muse Spark 1.3:Meta 前沿编程与智能体模型详解
Sep 3, 2026

Muse Spark 1.3:Meta 前沿编程与智能体模型详解

Muse Spark 1.3 是 Meta 最新的前沿编程与智能体模型。查看基准测试、定价、xhigh 与 max 变体对比、版本变化及与竞品的横向比较。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

感谢订阅!

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD