OpenAI 8 月 1 日在一篇研究貼文中,正式確認下一代大型模型家族名為 Astra。該文披露,內部版本的 Astra 已經 解出 10 條長年未決的數學題目,時間點剛好落在 Anthropic 推出 Claude Opus 5 一周之後。
重點一覽
- OpenAI 8 月 1 日在研究貼文中首次公開「Astra」名稱,並披露其解決 10 條數學難題的成果。
- Astra 以多智能體長時間協作為核心,可在單一題目上運行數小時甚至數日,暫未公布推出時間。
- Claude Opus 5 已於 7 月 24 日上架,定價為每百萬輸入 token 5 美元、輸出 token 25 美元,並支援 100 萬 token 脈絡視窗。
OpenAI Astra:新模型家族細節
OpenAI 在一篇研究貼文中 宣佈 「Astra」為下一代主力模型家族名稱,並將 10 項數學及理論計算機科學成果歸功於 Astra 的內部版本。這些題目在學界已懸而未決 至少十年,範圍涵蓋高維幾何、編碼理論與量子複雜度,其中一項證明更建立起非 sofic 群存在性的結果。
Astra 的主打賣點不是「速度」,而是「耐力」:系統會協調多個代理(agents)圍繞同一條題目長時間運算與討論,動輒數小時, 甚至拉長至數天。
較早前的報道曾指,Astra 會與 Sol、Terra、Luna 等家族並列 歸類 為同系產品,目前仍未決定是否以 GPT-6 或 GPT-5.7 作為商用標籤,更未有正式發佈時間表。Sam Altman 已經在華盛頓向政策 制定者現場示範 Astra,而這個家族亦被視為美國政府計劃中的聯邦 AI 審批框架下,首批接受審查的模型之一。
延伸閱讀:AI 基建:發薪日貸款商孤注一擲 10 億美元,轉攻數據中心
Claude Opus 5:定價與評測表現
Anthropic 於 7 月 24 日 正式推出 Claude Opus 5,收費沿用 Opus 4.8 的水平:每百萬輸入 token 5 美元、每百萬輸出 token 25 美元。根據第三方評測,它在 Artificial Analysis Intelligence Index 取得 61 分的最高分,同時在每個任務成本上大約只需 Fable 5 的一半。
模型支援 100 萬 token 的上下文視窗,輸出上限為 128,000 token。在 ARC-AGI-3 測試中,Opus 5 取得 30.2% 的分數, 大約是已公開次佳結果的三倍;在 Terminal-Bench 2.1「最大努力」模式中則錄得 89.1% 的表現。Anthropic 發言人 在接受訪問時 建議 企業用戶在作出選擇前,應先用同一套具體測試:包括一個邊界清晰的短期任務,以及一個長期、多步驟的工作流程,分別跑不同供應商 模型再作比較。
市場與學界對 Astra 的反應
現階段,Astra 仍未有官方收費方案、公開評測數據或第三方測試結果。對潛在企業客戶而言,目前只能在「已上架的實際產品」 (如 Opus 5)與「具備突破性研究成果的未發佈模型」之間作權衡。
英國曼徹斯特大學數學家 Thomas Bloom 在 X 上表示,這 10 個結果是「大新聞」, 並認為其重要性高於 OpenAI 先前公布的一些證明。
不過,Bloom 亦反駁了「Astra 將取代數學家」的說法,強調模型本身是由人類建立與訓練,而且所用數據幾乎全部源自數學家 的既有工作。OpenAI 研究員 Noam Brown 則補充指,這次運算並沒有觸及「千禧年難題」級別的問題,而且團隊在每條題目上 投入的計算資源並不算高。
認知科學家 Gary Marcus 撰文指出,Astra 的成果是真實且重要, 但被過度包裝成「已經解決整個領域」的宣傳說法並不恰當。
是次宣佈,其實延續了同一長期推理模型家族在今年 5 月的一項突破:當時同系統成功否證離散幾何中已懸而未決 80 年的 「Erdos 單位距離猜想」。菲爾茲獎得主 Tim Gowers 當時表示,會毫不猶豫地推薦該篇論文投稿至《Annals of Mathematics》。





