GPT-6 Astra 登場:OpenAI 宣告「AGI 世代」的野心與隱憂

一、事件本身:OpenAI 正式發表 GPT-6 Astra

2026 年 9 月 3 日,OpenAI 正式發表新一代旗艦模型 GPT-6 Astra,官方形容它是「世界上最聰明也最對齊的模型(the world's most intelligent and aligned model)」,並稱其在電腦操作、瀏覽、軟體工程、資訊安全、科學與專業工作上都達到業界頂尖水準。

GPT-6 Astra 主視覺

▲ GPT-6 Astra:OpenAI 稱其為「世界上最聰明也最對齊的模型」

這次發表最特別的地方,不在於「又一個更強的模型」,而在於 OpenAI 自己在發表前兩天(9 月 1 日)就先公告:Astra 已經達到其《Preparedness Framework》中「關鍵(Critical)網路安全能力」門檻——這是 OpenAI 史上第一次把自家模型評為這個等級。


二、關鍵數據:它到底有多強?

綜合 OpenAI 官方公告與國際媒體報導,幾個最常被引用的指標如下:

GPT-6 Astra 基準測試表現

▲ 多項基準測試改寫紀錄,但測試條件的透明度仍受質疑

項目 表現 意義
FrontierMath Tier 4 約 98% 接近「飽和」研究級數學題庫,官方稱已協助解出長年未解的開放問題
ARC-AGI-3 各家報導介於 98.6%~99.9% 半年前同類測試僅約 7.8%,跳幅極大(但測試設定未完全揭露)
電腦操作(Computer Use) 速度約 1.9 倍提升 對 AI Agent、自動化流程是最實際的進步
資安能力 首度評為 Critical 等級 可在少量人為介入下,自行找出未知漏洞並發展利用方式

OpenAI 總裁 Greg Brockman 甚至表示,這個模型「可能已可被視為 AGI」。多家外媒的標題也圍繞著這句話打轉——The Verge 用了「entered the AGI era」,WIRED 則說 OpenAI 認為它「可能開啟 AGI 世代」。


三、媒體與社群怎麼看:熱度之外的雜音

這波發表在 X(原 Twitter)與 Facebook 技術社群引發大量討論,但風向並非一面倒的讚嘆,大致可分成三派:

1. 樂觀派:這是真正的世代交替

支持者關注的是「電腦操作」與「長時間代理任務(agentic workloads)」的躍進。實際案例上,手遊工作室 Playco 表示在遊戲原型開發流程中導入 GPT-6 Astra 後,人工修正次數約減少 50%。對開發者而言,這種「可持續跑完長任務」的能力,比多考幾分數學更有感。

2. 質疑派:分數漂亮,但星號很多

The New Stack 的評論標題相當直白:「GPT-6 Astra 攻克了最難的基準測試,但那個星號比分數更重要。」 質疑集中在兩點:

  • 測試設定未完全公開:ARC-AGI-3 的推論資源、嘗試次數等條件不透明,難以與其他模型公平比較。
  • 價格與定位:Astra 屬於高價位模型,而在純程式開發領域,它並未明顯甩開競爭對手

3. 資安派:最該被討論的其實是風險

AI 資安雙面刃

▲ 首度達到「關鍵網路安全能力」門檻,是能力宣言也是風險警告

先前 OpenAI 模型曾涉入 Hugging Face 內部系統遭入侵的爭議事件。這次 OpenAI 特別強調已針對 Astra 加上更強防護:訓練模型更穩定地拒絕有害的網路攻擊請求、遵守安全限制,並延後了部分開發與發布時程來做測試。官方也回溯測試(backtesting)認為,若當時已有這些防護,Hugging Face 事件可被阻止。

「只要具備適當工具與存取權限,它無須人員逐步引導,就能在許多防護嚴密的系統中找出過去未知的安全缺陷,並開發利用方式。」
—— OpenAI《邁向 Astra:關鍵能力與前沿防護措施》

這句話同時是能力宣言,也是風險警告。


四、什麼時候能用?怎麼用?

分階段釋出(staged release)

  1. 首波:Daybreak 合作夥伴與部分企業客戶當日取得存取權。
  2. 接續數日:付費 ChatGPT 方案(Plus、Pro、Business、Enterprise)陸續開通。
  3. API:模型代號為 gpt-6-astra,另將上架 Amazon Bedrock。
  4. 免費方案:尚未公布時程。

此外,Codex 也同步獲得持久化記憶(persistent memory)能力,對長期專案的開發輔助是相當實際的加分。


五、崽崽貓觀點

撇開行銷語言,我認為這次發表有三個值得記住的重點:

  • 「AGI」目前仍是行銷詞彙,不是技術定義。 benchmark 分數再高,只要測試條件不透明,就不該直接等同於通用智慧。保持期待,但也保持懷疑。
  • 真正的變化在 Agent,不在聊天。 電腦操作速度 1.9 倍、長任務穩定度提升、Codex 持久記憶——這三項加起來,才是會改變日常開發方式的東西。
  • 資安能力是雙面刃。 一個能自主找出未知漏洞的模型,防守方與攻擊方都想要。OpenAI 願意主動標示 Critical 等級並延後發布,方向是對的,但真正的考驗會在往後幾個月的實際使用中浮現。

對台灣的開發者與企業來說,短期最務實的做法是:先在非關鍵流程試水溫,評估它在你實際工作流中的投資報酬率,而不是急著把核心系統交給一個上線不到一週的模型。


參考來源

※ 本文整理自 2026 年 9 月 3~4 日之公開報導,模型能力與釋出時程可能隨官方更新而變動。

Copyright © 2025 - 崽崽貓 zaizaicat