OpenAI 已在 8 月 1 日確認 Astra 為其下一代大型模型家族名稱。這款尚未釋出的新系統,已成功解出 10 題數學問題,時間點剛好緊接在 Anthropic 推出 Claude Opus 5 之後一週。
重點整理:
- OpenAI 於 8 月 1 日在一篇研究文章中首度公開 Astra 名稱,並披露它解出 10 道數學難題。
- Astra 採多代理協作架構,可在單一問題上連續推理數小時甚至數天,目前仍未公布上市時程。
- Claude Opus 5 已於 7 月 24 日上線,定價每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元,支援 100 萬 Token 脈絡視窗。
OpenAI Astra:模型細節與定位
OpenAI 在一篇研究文章中正式公布 Astra 的名稱,並將 10 項數學與理論電腦科學成果歸功於 Astra 的內部版本。這些問題皆已懸而未解至少十年,涵蓋高維幾何、編碼理論與量子複雜度理論,其中一項證明則建立了「非 sofic 群」存在性的結果。
Astra 的賣點不在於純粹計算速度,而是「長時間推理能力」:它能協調多個代理(agents)針對同一個問題協作數小時甚至數天,讓 AI 能處理過去被視為必須長期投入的高難度研究題目。
先前報導指出,Astra 會與 Sol、Terra、Luna 等模型家族並列,尚未決定是否掛上 GPT-6 或 GPT-5.7 之名,也沒有任何正式上市時間表。Sam Altman 已在華府向政策制定者進行 Astra 系列的示範展示,市場預期這個家族將成為美國聯邦規劃中「事前審查」框架下的首批審查對象。
延伸閱讀:AI 基礎建設:發薪日貸款商急轉彎砸 10 億搶進資料中心
Claude Opus 5:定價與評測表現
Anthropic 已在 7 月 24 日正式推出 Claude Opus 5,定價每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元,與前一代 Opus 4.8 相同。根據第三方測試,Opus 5 在 Artificial Analysis Intelligence Index 指數上取得 61 分,位居榜首,同時單一任務成本約為 Fable 5 的一半。
Opus 5 提供 100 萬 Token 的脈絡視窗(context window),最大輸出上限為 128,000 Tokens。在 ARC-AGI-3 測試上拿下 30.2% 的成績,大約是次佳公開結果的三倍;在 Terminal-Bench 2.1 的最高強度設定下也達到 89.1% 的表現。一名 Anthropic 發言人接受訪問時建議,企業在做出採用決策前,最好以「一個邊界明確的短任務」與「一個長期複雜任務」同時比較不同模型的實際表現。
Astra:專家怎麼看?
目前 Astra 尚未公布價格、評測成績或第三方實測結果,讓市場面臨的是「實際可用產品」與「研究突破宣示」之間的選擇。
曼徹斯特大學數學家 Thomas Bloom 在 X 上形容這 10 項成果是「大新聞」,並評價其重要性高於 OpenAI 先前發表的證明。
不過,Bloom 也反駁了「AI 將取代數學家」的說法,強調 Astra 是由人類設計與訓練,而且訓練資料本身就大量來自數學家長年的研究成果。OpenAI 研究員 Noam Brown 則指出,這次的突破並未攻克千禧年懸賞難題(Millennium Prize Problems),團隊在每個問題上投入的運算資源也稱不上「砸重本」。
認知科學家 Gary Marcus 在其 Substack 上表示,這些成果在學術上是真實而令人印象深刻,但被過度包裝成「整個領域已被 AI 解決」,與實際情況有相當落差。
Astra 的發布緊接著同系統家族在今年 5 月的另一項里程碑:該系統當時推翻了離散幾何中懸宕 80 年的「Erdos 單位距離猜想」。當時,費爾茲獎得主 Tim Gowers 就曾表示,自己會毫不猶豫地推薦這份證明刊登在《Annals of Mathematics》。






