OpenAI 8 月 1 日確認,下一代大型模型家族名為 Astra。這個仍未公開的系統曾解出 10 條數學難題,消息剛好在 Anthropic 推出 Claude Opus 5 一周之後曝光。
重點整理:
- OpenAI 8 月 1 日在一篇研究貼文中,首次確認 Astra 名稱,並披露其解出十項數學問題。
- Astra 的賣點是可同時協調多個代理(agents),就單一問題連續運算數小時甚至數天,目前仍未發布亦未有時間表。
- Claude Opus 5 已於 7 月 24 日推出,定價為每百萬輸入 tokens 5 美元、輸出 tokens 25 美元,並提供 100 萬 tokens 脈絡視窗(context window)。
OpenAI Astra 模型詳情
OpenAI 在一篇研究貼文中公佈 Astra 名稱,並將十項在數學及理論計算機科學領域、至少懸而未決逾十年的問題成果,歸功於 Astra 的內部版本。相關工作橫跨高維幾何、編碼理論和量子複雜度,其中一項證明更建立了非 sofic 群存在性的結果。
與其強調「算得幾快」,Astra 更著重「算得幾耐」:系統會協調多個代理,長時間圍繞同一條題目合作推進,可連續運作數小時甚至數天。
早前報道曾指,Astra 將與 Sol、Terra 和 Luna 等模型家族並列,被歸類為另一條產品線,目前仍未決定會否以 GPT‑6 或 GPT‑5.7 等名稱推出。Sam Altman 已在華盛頓向決策官員示範該系統,業界普遍預期,Astra 有機會成為首批納入擬議中的聯邦審批框架審視的模型家族之一。
延伸閱讀: AI 基建:發薪日貸款商押注 10 億美元,豪賭數據中心轉型
Claude Opus 5:定價與跑分
Anthropic 已於 7 月 24 日正式推出 Claude Opus 5,定價與 Opus 4.8 相同:每百萬輸入 tokens 5 美元、每百萬輸出 tokens 25 美元。根據第三方測試,它在 Artificial Analysis Intelligence Index 上拔得頭籌,取得 61 分,單次任務成本約為 Fable 5 的一半。
Opus 5 提供 100 萬 tokens 的上下文視窗,輸出上限為 128,000 tokens。在 ARC‑AGI‑3 測試中得分 30.2%,大約是現有次佳公開結果的三倍;在 Terminal‑Bench 2.1「全力模式」下,則取得 89.1% 成績。Anthropic 發言人接受訪問時建議企業用戶,在真正落地前,最好以一個範圍明確的短期任務加一個長周期任務,同時對比不同模型表現,再作採購決定。
市場與學界如何看 Astra?
Astra 目前既未有公開定價,也沒有官方基準測試表,更欠缺第三方實測數據,令潛在企業客戶需要在「已上市產品」與「研究階段聲稱」之間權衡。
曼徹斯特大學數學家 Thomas Bloom 在 X 上形容這十項結果是「大新聞」,並認為其重要性勝過 OpenAI 早前的一項證明。
不過,Bloom 亦強調,現階段談「模型取代數學家」仍言之過早——畢竟系統本身由人類構建,並以數學家累積的所有文獻作為訓練基礎。OpenAI 研究員 Noam Brown 則指出,這次運算並未攻破任何「千禧年懸賞難題」,團隊在每條題目上實際花費的算力資源亦不算特別龐大。
認知科學家 Gary Marcus 則在其專欄中評論,認同 Astra 的成果是真實且具突破性,但批評部分宣傳語調過度誇大,營造出「整個領域已被 AI 攻克」的錯覺。
是次宣布,緊接著同一長期推理模型家族於 5 月取得的一項成果——成功否證離散幾何領域已懸而未決 80 年的 Erdos 單位距離猜想。菲爾茲獎得主 Tim Gowers 當時表示,會毫不猶豫地建議將該篇論文投稿至《Annals of Mathematics》。






