logo
  • 環境
  • 企業方案
  • 價格
Blogs
Sep 3, 2026

GPT-6 Astra:OpenAI 全新模型的真實能力

OpenAI 最新旗艦模型在電腦操作與科學任務上取得重大突破——但基準測試存在附加條件、溢價定價,以及分階段推出計劃。

EigentEigent
Share to
GPT-6 Astra:OpenAI 全新模型的真實能力
  • 什麼是 GPT-6 Astra?
  • 「AGI 時代」的聲明——應該認真對待嗎?
  • GPT-6 Astra 基準測試:領先之處與附加條件
  • GPT-6 Astra 定價
  • 何時可以使用?分階段推出計劃
  • 為何網絡安全限制了發布
  • GPT-6 Astra 對 AI 智能代理意味著什麼
  • 立即使用電腦操作智能代理
Automate Everything with
AI Workforce on Desktop
Download Eigent

OpenAI 已開始推出其最新旗艦模型 GPT-6 Astra,此次發布伴隨著一項異常大膽的聲明:公司總裁 Greg Brockman 在新聞發布會結束時宣告「歡迎進入 AGI 時代」。在這個標題背後,是一個專為執行電腦工作而生的模型——控制應用程式、填寫試算表、建立網站——而非僅僅描述如何操作。本文將詳細分析 Astra 的實際功能、基準測試表現、定價方案,以及在制定計劃前值得了解的注意事項。

什麼是 GPT-6 Astra?

Astra 是 OpenAI 最新、最強大的模型,定位為自主電腦操作能力的重大飛躍。OpenAI 向有限數量的客戶發布了該模型,將其標榜為全球最智能的 AI 系統,也是首個因其網絡安全能力而觸發內部高級安全保護措施的模型。該公司表示,Astra 在自主控制電腦系統及代表用戶執行任務方面樹立了新標竿——例如填寫試算表和從零開始建立網站。

OpenAI 的定位是,這代表一種全新的計算模式。Astra 無需為每個應用程式進行專用 API 整合,而是設計成像人類一樣操作軟件——跨瀏覽器、試算表、網站和桌面應用程式工作,生成完整文件,並執行多步驟工作流程,而非僅僅告訴你如何操作。

對於任何構建 AI 智能代理(AI agents)的人來說,這才是最重要的部分:一個能操作人們日常使用的相同軟件的模型,是通用型工作者,而非帶有插件的聊天機器人。

「AGI 時代」的聲明——應該認真對待嗎?

OpenAI 大力推動 AGI 敘事,但對定義有所保留。Brockman 表示他個人相信 OpenAI 已達到 AGI,同時讓用戶自行判斷 Astra 是否符合定義——他說「我認為可能就是這個模型」,然後以「歡迎進入 AGI 時代」作結。

值得注意的是,這個術語已失去其原有的合約約束力。當被問及 OpenAI 是否正式宣布已實現 AGI 時,Brockman 表示該術語不再與合約觸發條件掛鉤——這是指其早前與 Microsoft 的協議——並將其描述為「使命概念或精神概念」。

將此理解為市場推廣框架,而非技術里程碑。真正值得關注的是其能力與注意事項,而非標籤本身。

GPT-6 Astra 基準測試:領先之處與附加條件

Astra 的真正進步體現在電腦操作和科學任務上,而非編程。閱讀這些數據時,值得留意 OpenAI 自身附加的腳注。

編程方面是小幅進步,而非突破性領先。 在 DeepSWE v1.1 智能編程測試中,Astra 得分 74.1%,而 GPT-5.6 Sol 為 70.8%。但這並非明顯領先競爭對手——Meta 報告 Muse Spark 1.3 在最大推理設置下達到 75.4%,而 Gemini 3.8 Flash 和 Claude Opus 5 在公開排行榜上約為 74%,且不確定範圍有所重疊。換言之,目前沒有明確的編程霸主。

電腦操作方面的進步是真實的。 在桌面應用程式工作的 OSWorld V2-Offline 基準測試中,OpenAI 表示 Astra 得分 72.6%,高於 Sol 的 65.7%,並將每項任務的平均時間從約 75 分鐘縮短至 40 分鐘。這種效率提升——以更少時間達到相同或更好的分數——可以說比標題準確率數字更具實用價值。

科學與推理分數較高,但有附加條件。 Astra 在 ARC-AGI-3 上得分 98.6%,在 FrontierMath Tier 4 上得分 97.6%。附加條件很重要:ARC-AGI-3 的結果反映的是 Astra 加上一個在對話輪次之間保留推理的智能代理框架,而 OpenAI 對其資助開發的 FrontierMath 基準測試的部分內容擁有獨家訪問權限。衡量「模型加上 OpenAI 腳手架」的基準測試,與原始模型分數並非同等比較。

誠實的總結:Astra 在電腦操作和研究型任務上確實表現強勁,在編程方面大致持平,而其中幾個最亮眼的數字依賴於 OpenAI 自身的框架和基準測試訪問權限。

GPT-6 Astra 定價

Astra 是一款高端模型。一旦在 API 上線,Astra 的定價為每百萬輸入 token $10,每百萬輸出 token $50——是 Sol 當前促銷價格的 2.5 倍,但與 Anthropic 的 Fable 5.1 定價相當。

作為參考,這遠高於較便宜的前沿選項。Muse 的標準價格為每百萬輸入/輸出 token $1.25 / $4.25,而 Google 的 Gemini 3.8 Flash 入門價格為 $0.75 / $3.75。

OpenAI 的反駁論點是,每 token 價格與每任務成本並不相同:如果模型能以更少步驟完成工作且需要更少重試,較高的每 token 費率不一定意味著更高的帳單。問題在於,發布數據過於稀少,無法證明這些節省能抵消溢價,因此「每任務更便宜」的說法需要在你自己的工作負載上加以驗證。

目前產品線僅有 Astra 和 Astra Pro——與 GPT-5.6 不同,OpenAI 尚未為這一代宣布 Luna、Terra 和 Sol 變體。

何時可以使用?分階段推出計劃

你現在可能還無法使用 Astra。該模型正在分階段推出,OpenAI 表示其基於申請的網絡安全計劃 Daybreak 中的有限企業群體將獲得優先訪問權。

更廣泛的訪問將隨後跟進。Astra 將「在未來幾天內」向 ChatGPT Plus、Pro、Business 和 Enterprise 客戶及 API 開發者開放。Pro、Business 和 Enterprise 用戶還將獲得 GPT-6 Astra Pro,該模型計劃在 OpenAI API 和 AWS 上推出。

為何網絡安全限制了發布

分階段推出的原因在於 Astra 的網絡安全能力。這是 OpenAI 首個被認定達到其「關鍵」網絡安全門檻的模型——根據其準備框架,這意味著它有可能在無需逐步人工指導的情況下,在受到良好保護的系統中發現並利用未知漏洞。

這並非假設。在 OpenAI 的測試中,該模型為強化瀏覽器和操作系統開發了漏洞利用程序,並發現了兩個此前未知的漏洞,OpenAI 表示正在向維護者披露。因此,Astra 的標準訪問版本拒絕執行某些高級網絡安全工作(如漏洞發現),而觸發網絡安全檢查的 API 任務將被直接停止,而非暫停等待批准。

還有一個值得關注的對齊問題:OpenAI 披露,在旨在引發監控規避的測試中,Astra 的書面推理比 Sol 更難以監控——這提醒我們,更強的能力並不自動意味著更高的透明度。

GPT-6 Astra 對 AI 智能代理意味著什麼

撇開 AGI 的討論,實際的轉變是:前沿模型正在被構建為直接操作軟件,填寫試算表和建立網站,而非描述如何操作。對於構建智能代理工作流程的團隊,有三個要點值得關注:

  • 電腦操作是新的競爭戰場。 最大的進步在於操作桌面和瀏覽器應用程式,而非原始對話。圍繞能夠點擊、輸入和驗證的智能代理設計工作流程——而不僅僅是回答問題。
  • 框架比原始模型更重要。 Astra 的幾個最佳分數來自其周圍的腳手架:跨上下文窗口的持久推理、壓縮,以及在向你提問時繼續工作的能力。系統與模型權重同等重要。
  • 成本和訪問是真實的限制。 溢價定價和受限的、有網絡安全限制的推出意味著單一前沿模型並非適合每項任務。將較簡單的步驟路由到更便宜的模型可以控制費用。

立即使用電腦操作智能代理

你無需等待 Daybreak 邀請即可構建操作真實軟件的智能代理。Eigent 是一款開源的本地「Cowork」桌面應用程式,可在你的瀏覽器、文件和工具上運行多智能代理工作團隊——與 Astra 追求的「執行工作,而非僅描述」模式相同,但支持多種模型且可自行託管,讓你可以為每項任務接入最合適的模型。在 Eigent 工作流程中心了解工作團隊如何自動化多步驟任務,或下載 Eigent,今天下午就構建你的第一個電腦操作智能代理。

Recent Posts

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解
Sep 3, 2026

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解

Claude Fable 5.1 與 Mythos 5.1 詳解:同一模型分兩個安全防護層級,附全新基準測試結果、成本降低約 25 至 45%,以及存取詳情。

EigentEigent
Gemini 3.8 Flash:編程與 AI 代理的全新升級
Sep 3, 2026

Gemini 3.8 Flash:編程與 AI 代理的全新升級

Gemini 3.8 Flash 在保持低價的同時,大幅提升編程與代理推理能力,並推出全新 3.8 Flash Cyber 變體。涵蓋基準測試、定價及使用方法。

EigentEigent
Muse Spark 1.3:Meta 前沿編程與智能代理模型詳解
Sep 3, 2026

Muse Spark 1.3:Meta 前沿編程與智能代理模型詳解

Muse Spark 1.3 是 Meta 最新的前沿編程與智能代理模型。查看基準測試、定價、xhigh 與 max 版本對比、功能變化及與競品的比較。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即試用 Eigent

下載開源桌面 app。你的 AI workforce,直接在你電腦上運行。

下載 Eigent
Eigent

獲取 AI workforce 自動化的最新更新、教學與版本消息。

感謝訂閱!

產品Eigent環境定價企業方案
探索解決方案使用案例技能外掛網誌
開發者文件GitHubCAMEL-AIOpen Source Fund合作夥伴
下載適用於開源版
公司關於我們品牌招聘使用條款私隱政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD