GPT-6 Astra 正式登場!OpenAI 最強模型能自己操作電腦,跟 Claude Fable 5.1、Gemini 3.8 Flash 分數比一比

0
10 人次

GPT-6 Astra 正式登場!OpenAI 最強模型能自己操作電腦,跟 Claude Fable 5.1、Gemini 3.8 Flash 分數比一比

這幾天 AI 圈的更新真的多到讓人眼花撩亂。OpenAI 才剛在 9 月 1 日說明 Astra 的關鍵級資安能力與防護措施,隔沒兩天就在 2026 年 9 月 3 日直接端出了旗艦新模型 GPT-6 Astra,官方主打電腦操作、專業工作與研究能力;單一評測高分不能證明已達 AGI(通用人工智慧)。

這次最有話題性的重點,是 GPT-6 Astra 不只會聊天、寫程式,還能直接幫你操作電腦:官方展示包含填表單、更新 CRM 資料、整理行事曆與科學數據分析,實際仍取決於工具、權限與任務條件。加上官方公布的多項 AI 測試分數幾乎都刷新紀錄,讓人好奇它跟同時期的 Claude Fable 5.1、Google 剛發表的 Gemini 3.8 Flash 比起來,到底誰的分數比較好看。

這篇阿正老師就帶大家看懂 GPT-6 Astra 到底新在哪裡、官方公布的 benchmark 分數怎麼解讀,並整理跟其他旗艦模型的分數比較表,讓大家心裡有個底。



一、GPT-6 Astra 是什麼?官方介紹影片搶先看

GPT-6 Astra 是 OpenAI 目前最新的旗艦模型,2026 年 9 月 3 日先開放給部分企業客戶使用,官方表示接下來數天內會逐步擴大到所有 ChatGPT Plus、Pro、Business、Enterprise 訂閱用戶,並計畫透過 OpenAI API、Microsoft Azure、AWS Bedrock 提供;實際開通狀態須向各平台與帳號確認。OpenAI 也同步釋出官方介紹影片《Introducing GPT-6 Astra: the most intelligent and aligned model in the world.》,有興趣看官方怎麼展示新功能的朋友,可以直接點這裡觀看 OpenAI 官方 YouTube 影片

官方把這次更新的重點放在四大方向:電腦操作(填表單、更新客戶資料、整理行事曆、上網查資料)、專業文書工作(生成並排版文件、簡報、試算表)、軟體工程(寫程式、測試、抓 bug)、以及科學研究(數學證明、健康資料分析)。官方也提到透過內建的 Sites 功能,甚至可以直接請它做網站並上架託管。

image_689C4F5F

官方網站 openai.com 官方公告
版本 / API 型號 GPT-6 Astra(API 型號 gpt-6-astra)(發布日期2026-09-03)
支援系統/管道 ChatGPT(Plus/Pro/Business/Enterprise,分階段開放)、OpenAI API、Microsoft Azure、AWS Bedrock
費用 訂閱用戶在原有額度內使用;API 標準定價輸入每百萬 token 10 美元/輸出 50 美元(詳見第五章)
繁體中文 / 台灣可用性 ChatGPT 既有介面可使用正體中文;本文未實測 Astra 中文表現與台灣帳號開通狀態,以實際模型選單與官方公告為準
軟體下載 ChatGPT 官方入口

✅ 優點

  • 電腦操作能力大幅進步,官方稱任務完成速度比前代快將近一倍
  • 多項數學、科學、程式相關 benchmark 分數為目前業界公布最高水準之一
  • API、Azure 與 AWS Bedrock 均列入開放計畫,實際供應須另確認

⚠️ 缺點

  • 分階段開放,剛發布時不是所有付費用戶都能立刻用到
  • API 定價偏高,長內文(超過 27.2 萬 token)與快速模式費用更高
  • 部分第三方獨立驗證分數不如官方公布數字亮眼,實際表現建議自行測試判斷

阿正老師點評:以我的使用習慣來看,「電腦操作」這種能自己動手完成瑣事的功能,對一般辦公室工作者的吸引力其實比單純聊天更大。不過阿正老師目前還沒有實際測試環境可以驗證,建議測試時可以先從整理行事曆、填制式表單這類低風險的小任務開始觀察,比較能抓到它實際好不好用的手感。

二、效能大躍進:官方公布的 Benchmark 數據

OpenAI 這次公布的官方 benchmark 分數,跟前一代 GPT-5.6 Sol 相比進步幅度確實不小,尤其是數學推理與資安相關的測試項目。以下是官方公告整理的對照表:

GPT-6 Astra 與 GPT-5.6 Sol 官方評測對照
評測項目 測什麼 GPT-6 Astra GPT-5.6 Sol(前代)
ARC-AGI-3 抽象推理能力 99.9% 7.8%
FrontierMath Tier 4(v2) 高階數學證明 97.6% 83.0%
GPQA Diamond 研究所級科學問答 96.0% 94.6%
Terminal-Bench 4.0 終端機/指令列代理任務 57.9% 37.3%
ExploitBench 資安漏洞利用能力 100% 78.5%
OSWorld 2.0 實際操作電腦完成任務 72.6% 65.7%

官方也提到,在資安測試中 GPT-6 Astra 找到了兩個先前未知的零時差漏洞(zero-day),1.9 倍速度則來自 Mind2Web 上模型與新版 Codex 執行環境的綜合改善,不能當成所有任務一律快 1.9 倍。這些數字看起來確實很驚人,但阿正老師要提醒一件事:以上都是 OpenAI 官方自行公布的分數,跟其他研究機構的獨立驗證結果不一定完全對得起來,第三章比較表會再進一步說明這個落差。

⚠️ 以上依OpenAI 發表頁整理,並非本站實測。OSWorld 2.0 為 v2026.08.08 離線子集及部分得分;ExploitBench 為未套用正式產品防護的評估。官方取各推理強度最高分,研究環境與正式產品可能不同。不同評測的百分比不是同一能力量尺。

三、跟其他旗艦模型比一比:GPT-6 Astra vs Claude Fable 5.1 vs Gemini 3.8 Flash

比較前先分清來源與評測版本。OpenAI 發表頁引用的 Artificial Analysis 智慧指數是 v4.1.1;2026-09-05 本次讀取模型頁時已標示 v4.2,不能混用。以下分列第三方智慧指數與 OpenAI 公告的個別評測,不統稱為第三方獨立實測。

三款模型 Artificial Analysis v4.2 智慧指數比較
來源/評測 GPT-6 Astra Claude Fable 5.1 Gemini 3.8 Flash
Artificial Analysis 智慧指數 v4.2 55(max) 57(max,預設 fallback) 47(high)
OpenAI 公告:GPQA Diamond 96.0% 93.7% 95.3%
OpenAI 公告:DeepSWE v1.1 74.1% 67.4% 73.8%
OpenAI 公告:Terminal-Bench 4.0 57.9% 55.8% 19.1%
OpenAI 公告:OSWorld 2.0 離線子集 72.6% 未列出 未列出
OpenAI 公告:Humanity’s Last Exam(含工具) 57.2% 65.0% 未列出
Artificial Analysis 所列基本 API 美元單價/百萬 tokens $10/$50 $10/$50 $0.75/$3.75

第三方來源:Astra(max)Fable 5.1(max with fallback)Gemini 3.8 Flash(high)。智慧指數採模型摘要顯示值,並非正確率百分比;推理設定不相同。單價為基本輸入/輸出費率,未含快取、長內文、工具或平台附加費,不代表每項任務的總成本。

其他評測出自OpenAI 發表頁。原稿 Fable 的 OSWorld 77.9% 無法與此離線子集同條件核對,故不並列;未列出不等於零分。原稿編碼代理指數未取得完整同版本佐證,暫不作排名。

阿正老師點評:這次 v4.2 智慧指數中 Fable 較高,Astra 在上表部分程式評測較高;不能由單一指數推論所有任務都領先。挑選時應搭配自己的任務測試、工具、回應時間與總費用。

四、資安評級升級:OpenAI「關鍵」等級資安能力模型

值得特別提出來講的是,OpenAI 於 9 月 1 日確認 Astra 達到自家框架的「關鍵」(Critical)等級資安能力門檻。簡單說,就是官方認為這顆模型在資安攻防上的能力已經強到需要額外把關。

⚠️ 為了因應這個評級,OpenAI 表示已加強網路濫用防護機制,並對部分高階安全相關能力實施更嚴格的存取限制。額外檢查也可能使合法任務暫停或停止,但如果你的工作跟資安研究相關,實際能用到的功能範圍可能會比想像中受限,建議以官方公告當下的說明為準。

五、費用與取得方式

image_75643ABB

一般訂閱用戶:GPT-6 Astra 目前先開放給部分企業客戶,官方表示接下來數天內會逐步擴大到所有 ChatGPT Plus、Pro、Business、Enterprise 訂閱用戶,在既有訂閱額度內即可使用,實際開放時間請以 ChatGPT 官網模型選單當下顯示為準。

開發者與企業:API 型號為 gpt-6-astra,標準模式每百萬 token 輸入 10 美元、輸出 50 美元;若使用速度加倍的「快速模式」,費用也是雙倍;輸入內文超過 27.2 萬 token 的長內文模式,則是輸入 20 美元、輸出 75 美元。Azure 與 AWS Bedrock 亦列入開放計畫,實際供應須向平台確認。超過 272K 輸入 tokens 時,上述加價適用整個請求,而非只對超出部分計費;Fast 模式為適用費率的兩倍。官方模型與費率文件

image_60100670

⚠️ 各方案的實際開放時程、用量額度可能隨時調整,正式使用前請以 OpenAI 官方公告頁面當下資訊為準。

六、阿正老師的總結

GPT-6 Astra 這次的更新重點很明確:把「電腦操作」這件事做得更成熟,同時在數學推理、資安等硬指標上刷新了自家紀錄。不過對照同一週登場的 Claude Fable 5.1 與 Gemini 3.8 Flash,可以發現 2026 年下半年的 AI 旗艦戰其實是「各擅勝場」而非一家獨大。

需要 AI 幫忙操作電腦完成瑣事的辦公室用戶

GPT-6 Astra。電腦操作與任務自動化是這次更新的主打強項,官方公布的完成速度也明顯提升。

重視綜合推理能力與程式代理表現的開發者

Claude Fable 5.1。本次讀取的 Artificial Analysis v4.2 智慧指數較高,但不能推論所有程式任務都領先。

需要大量、低成本呼叫 AI 的應用場景

Gemini 3.8 Flash。Artificial Analysis 模型頁列出的基本輸入/輸出單價較低;仍需比較實際耗用 tokens、快取與重試成本。


旗艦模型的分數大戰,才剛開始

短短一週內三大旗艦模型輪番登場,AI 圈的競爭速度真的快到讓人跟不上。分數高不代表實際用起來一定順手,阿正老師還是建議大家依照自己的實際使用情境(寫程式、辦公室文書、還是大量批次處理)挑選最適合的模型。你已經用過 GPT-6 Astra 了嗎?覺得電腦操作功能好不好用?

歡迎在下面留言跟阿正老師分享!

留下回覆

請輸入你的評論!
請在這裡輸入你的名字