logo
  • 環境
  • 企業方案
  • 價格方案
Blogs
Sep 3, 2026

GPT-6 Astra:OpenAI 新模型究竟能做什麼

OpenAI 最新旗艦模型在電腦操作與科學推理上大幅躍進——但亮眼的基準測試背後有星號附注、溢價定價,以及分階段推出計畫。

EigentEigent
Share to
GPT-6 Astra:OpenAI 新模型究竟能做什麼
  • 什麼是 GPT-6 Astra?
  • 「AGI 時代」的宣言——該認真看待到什麼程度?
  • GPT-6 Astra 基準測試:領先之處與星號附注
  • GPT-6 Astra 定價
  • 何時可以使用?分階段推出計畫
  • 為何網路安全能力限制了發布節奏
  • GPT-6 Astra 對 AI 智能代理意味著什麼
  • 立即部署電腦操作智能代理
Automate Everything with
AI Workforce on Desktop
Download Eigent

OpenAI 已開始推出其最新旗艦模型 GPT-6 Astra,此次發布伴隨著一項異常大膽的宣言:公司總裁 Greg Brockman 在新聞發布會結尾高呼「歡迎來到 AGI 時代。」標題背後,是一個被設計來執行電腦工作的模型——操控應用程式、填寫試算表、建立網站——而非僅僅描述如何操作。本文將拆解 Astra 的實際功能、基準測試表現、定價方案,以及在規劃部署前值得了解的注意事項。

什麼是 GPT-6 Astra?

Astra 是 OpenAI 目前最新、最強大的模型,定位為自主電腦操作能力的重大躍進。OpenAI 向有限客戶群推出此模型,將其標榜為全球最智慧的 AI 系統,也是首個因網路安全能力而觸發內部進階安全防護機制的模型。OpenAI 表示,Astra 在自主控制電腦系統、代替使用者執行任務方面樹立了新標竿——例如填寫試算表、從零開始建立網站。

OpenAI 的定位框架是:這是一種全新的運算模式。Astra 不需要為每個應用程式建立專屬的 API 整合,而是被設計成像人一樣操作軟體——跨瀏覽器、試算表、網站與桌面應用程式運作,產出完整文件,並執行多步驟工作流程,而非僅告訴你該怎麼做。

對於任何正在建構 AI 智能代理(AI agents)的人來說,這才是最關鍵之處:一個能操作人們日常使用軟體的模型,是通用型工作者,而非附帶外掛的聊天機器人。

「AGI 時代」的宣言——該認真看待到什麼程度?

OpenAI 大力渲染 AGI 敘事,但同時也對定義有所保留。Brockman 表示他個人相信 OpenAI 已達到 AGI,同時讓使用者自行判斷 Astra 是否符合定義——他說「我認為可能就是這個模型」,隨後以「歡迎來到 AGI 時代」作結。

值得注意的是,這個術語已失去其原有的合約效力。當被問及 OpenAI 是否正式宣告達成 AGI 時,Brockman 表示該術語不再與合約觸發條款掛鉤——此前與 Microsoft 的協議中曾有此約定——並將其描述為「使命概念或精神概念」。

請將此解讀為行銷框架,而非技術里程碑。真正值得關注的是模型的實際能力與注意事項,而非標籤本身。

GPT-6 Astra 基準測試:領先之處與星號附注

Astra 的真正進步體現在電腦操作與科學任務上,而非程式撰寫。閱讀這些數字時,值得留意 OpenAI 自己附加的腳注。

程式撰寫是小幅進步,並非大幅領先。 在 DeepSWE v1.1 自主程式撰寫測試中,Astra 得分 74.1%,GPT-5.6 Sol 為 70.8%。但這並非明顯領先競爭對手——Meta 的 Muse Spark 1.3 在最大推理設定下達到 75.4%,Gemini 3.8 Flash 與 Claude Opus 5 在公開排行榜上約為 74%,且不確定範圍有所重疊。換言之,目前並無明確的程式撰寫霸主。

電腦操作才是真正的躍進所在。 在桌面應用程式操作的 OSWorld V2-Offline 基準測試中,OpenAI 表示 Astra 得分 72.6%,高於 Sol 的 65.7%,且每項任務的平均耗時從約 75 分鐘縮短至 40 分鐘。這種效率提升——以更短時間達到相同或更好的分數——可以說比單純的準確率數字更具實用價值。

科學與推理分數亮眼,但有附注。 Astra 在 ARC-AGI-3 上得分 98.6%,在 FrontierMath Tier 4 上得分 97.6%。星號很重要:ARC-AGI-3 的結果反映的是 Astra 加上一個在對話輪次間保留推理的代理框架(agent harness),而 OpenAI 對其資助開發的 FrontierMath 基準測試部分內容擁有獨家存取權。「模型加上 OpenAI 腳手架」的測量結果,與原始模型分數並非同等條件的比較。

誠實的總結是:Astra 在電腦操作與研究型任務上確實表現強勁,在程式撰寫上大致與競爭對手持平,而幾個最亮眼的數字依賴於 OpenAI 自有的框架與基準測試存取權。

GPT-6 Astra 定價

Astra 是一款高端模型。一旦在 API 上線,Astra 的定價將為每百萬輸入 token $10 美元、每百萬輸出 token $50 美元——是 Sol 目前促銷價格的 2.5 倍,但與 Anthropic 的 Fable 5.1 定價相當。

作為參考,這遠高於較便宜的前沿選項。Muse 的標準定價為每百萬輸入/輸出 token $1.25 / $4.25 美元,Google 的 Gemini 3.8 Flash 推出價格為 $0.75 / $3.75 美元。

OpenAI 的反駁論點是:每 token 的價格不等於每項任務的成本——如果模型能以更少步驟完成工作、減少重試次數,較高的每 token 費率不一定意味著更高的帳單。問題在於,目前的發布數據過於稀少,無法證明這些節省能抵消溢價,因此「每項任務更便宜」的說法仍需在自己的工作負載上驗證。

目前的產品線僅有 Astra 與 Astra Pro——與 GPT-5.6 不同,OpenAI 尚未為此世代宣布 Luna、Terra 和 Sol 等變體版本。

何時可以使用?分階段推出計畫

你現在可能還無法使用 Astra。模型正在分階段推出,OpenAI 表示其申請制網路安全計畫 Daybreak 中的有限企業群體將獲得優先存取權。

更廣泛的存取將隨後跟進。Astra 將在「未來幾天內」向 ChatGPT Plus、Pro、Business 和 Enterprise 客戶及 API 開發者開放。Pro、Business 和 Enterprise 用戶還將獲得 GPT-6 Astra Pro,且該模型預計將登陸 OpenAI API 與 AWS。

為何網路安全能力限制了發布節奏

分階段推出的原因在於 Astra 的網路安全能力。這是 OpenAI 首個被認定達到其「關鍵」網路安全門檻的模型——依據其準備度框架,這意味著該模型有潛力在無需逐步人工引導的情況下,在防護完善的系統中發現並利用未知漏洞。

這並非假設性風險。在 OpenAI 的測試中,該模型為強化瀏覽器和作業系統開發了漏洞利用程式,並發現了兩個先前未知的漏洞,OpenAI 表示正在向維護者披露。因此,Astra 的標準存取版本拒絕執行部分進階網路安全工作(如漏洞發現),而觸發網路安全檢查的 API 任務將被直接停止,而非暫停等待審核。

還有一個值得關注的對齊問題:OpenAI 披露,在旨在引發監控規避的測試中,Astra 的書面推理過程比 Sol 更難以監控——這提醒我們,更強的能力不自動等於更高的透明度。

GPT-6 Astra 對 AI 智能代理意味著什麼

撇開 AGI 的說法,實際的轉變是:前沿模型正被建構為直接操作軟體,填寫試算表、建立網站,而非描述如何操作。對於建構代理工作流程的團隊,有三個重要啟示:

  • 電腦操作是新的競爭戰場。 最大的進步在於操作桌面與瀏覽器應用程式,而非原始對話。設計工作流程時,應圍繞能夠點擊、輸入和驗證的代理,而非僅僅回答問題的代理。
  • 框架比原始模型更重要。 Astra 幾個最佳分數來自其周圍的腳手架:跨上下文視窗的持久推理、壓縮機制,以及在提問時仍能持續工作的能力。系統架構與模型權重同等重要。
  • 成本與存取是真實的限制條件。 溢價定價與受限的網路安全分階段推出,意味著單一前沿模型並非適合所有任務。將較簡單的步驟路由至更便宜的模型,才能控制帳單在合理範圍內。

立即部署電腦操作智能代理

你不必等待 Daybreak 邀請,就能建構操作真實軟體的智能代理。Eigent 是一款開源、本地端的「Cowork」桌面應用程式,可在你的瀏覽器、檔案與工具間運行多智能代理工作團隊——與 Astra 追求的「執行工作,而非描述工作」模式相同,但不依賴特定模型且可自行託管,讓你能為每項任務接入最合適的模型。前往 Eigent 工作流程中心了解多智能代理如何自動化多步驟任務,或下載 Eigent,今天下午就建構你的第一個電腦操作智能代理。

Recent Posts

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解
Sep 3, 2026

Claude Fable 5.1 與 Mythos 5.1:全新功能詳解

Claude Fable 5.1 與 Mythos 5.1 詳解:同一模型提供兩種安全防護等級,附全新基準測試成績、約 25 至 45% 的成本降幅,以及存取方式說明。

EigentEigent
Gemini 3.8 Flash:程式開發與 AI 代理的全新升級
Sep 3, 2026

Gemini 3.8 Flash:程式開發與 AI 代理的全新升級

Gemini 3.8 Flash 在維持低廉價格的同時,大幅提升程式開發與代理推理能力,並推出全新 3.8 Flash Cyber 變體。本文涵蓋基準測試、定價及使用方式。

EigentEigent
Muse Spark 1.3:Meta 前沿程式碼與智能代理模型完整解析
Sep 3, 2026

Muse Spark 1.3:Meta 前沿程式碼與智能代理模型完整解析

Muse Spark 1.3 是 Meta 最新的前沿程式碼與智能代理模型。深入了解基準測試、定價、xhigh 與 max 版本差異、功能變化及與競品的比較。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

立即體驗 Eigent

下載開源桌面應用,在本地以 AI 工作團隊開始自動化。

下載 Eigent
Eigent

掌握 AI 工作團隊自動化的最新更新與教學內容。

感謝您的訂閱!

產品Eigent環境價格方案企業方案
探索解決方案使用情境技能插件部落格
開發者文件GitHubCAMEL-AI開源基金合作夥伴
下載開源版
公司關於我們品牌招募使用條款隱私權政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD