OpenAI 表示,已經修補三項在過去一星期惹來大量用戶投訴、被指令 GPT-6 Astra「變蠢」的缺陷,並為 Codex 訂戶重設使用上限。
早前不少開發者指,新推出的 GPT-6 Astra 上線後表現每況愈下,與首日體驗有明顯落差。
要點整理:
- Astra 用戶整星期瘋狂貼出「前後對照測試」,指模型在未有公告下被悄悄削弱。
- OpenAI Codex 負責人點名三大成因,其中一項為影響約 4,000 至 5,000 名用戶的「情境管理實驗」。
- 上一代旗艦 GPT-5.6 Sol 早在 7 月已遭遇同樣「被削弱」指控。
OpenAI:已修復 Astra 質素缺陷
Codex 產品主管 Tibo Sottiaux 在周六發布的更新中表示,團隊已與用戶合作追蹤問題源頭,之後推出修復方案,並在當地時間午夜前完成全面重設用量上限,相關更新已在公告中披露。
他解釋,為舊版模型編寫的一些「技能」觸發得過於頻密,有時會阻礙 Astra 進行自我檢查,間接拉低最終輸出質素。
另外,一項可選用的「情境管理實驗」亦被點名是元兇之一。該實驗在部分情況下會令模型提早結束回覆,或錯誤回應過期訊息。OpenAI 指出,在約 4,000 至 5,000 名用戶受測後,已決定把這個實驗功能關閉。
再者,部分引擎設定錯誤,導致經它們分流的「尾段流量」(tail traffic)表現明顯劣化。公司其後把有問題的引擎移除,並進行多項較細微的修補。Sottiaux 在 X 上撰文稱,模型現在在追蹤用戶最新訊息方面已更為準確。
延伸閱讀: 以太幣遇上 2,800 美元供應牆 ETF 資金流入累計達 2.16 億美元
Astra 用戶:寫碼水準「退步」 有人改用舊版 Sol
整個星期內,X 平台上不斷湧現投訴貼文。開發者把同一組提示詞同時丟給「首日版 Astra」及「目前版 Astra」,各項設定保持完全一致,再比較結果輸出。
開發者 Pranjal Paliwal 早前曾公開大讚 Astra,後來再回頭細閱模型為他生成的程式碼後,直言這不叫進步,而是「回檔」。
開發工具 Opencode 創辦人 Dax Raad 則透露,在升級到 Astra 後,用量開支幾乎倍增,但實際得益不成正比,於是決定帶隊回到上一代 GPT-5.6 Sol。
在 OpenAI 社群論壇上,有用戶形容,現時 Astra 在同一類任務上的表現,已經「跌至與 Sol 差不多」,就連重試次數也相若。
然而亦有意見持相反看法。一名化名 Antikythera 的用戶則認為,Astra 一向偏向「懶惰」和愛用項目符號,只是大家最初被新鮮感「閃盲」,現在熱情退卻,才開始看清其真實水準。
算力與配額限制 為 GPT-6 Astra 籠罩陰影
自 GPT-6 Astra 在 9 月初面向更大範圍用戶開放以來,產能與配額問題便如影隨形。
多名用戶反映,OpenAI 已下調重度 ChatGPT 用戶在 Astra 上的使用上限,並暫停接受新的 200 美元 Pro 訂閱。Sottiaux 亦在 9 月 10 日親口確認相關安排。
Astra 的定價則維持不變:每 100 萬個輸入 token 收費 10 美元,每 100 萬個輸出 token 收費 50 美元,約為 Sol 發布時定價的 2.5 倍。
這已是短短兩個月內,OpenAI 第二款旗艦模型遭付費用戶指控「被暗削」。早在 7 月,部分用戶已抱怨 Sol 的最高推理模式「一夜變得膚淺」。當時 Sottiaux 否認有刻意削弱,但承認公司一直在嘗試不同的「推理努力」設定。
下一篇: 黃仁勳稱網安廠商將受惠於 AI 威脅恐慌

