OpenAI回應市場連日質疑,承認旗下新模型 GPT-6 Astra 在推出首周確實出現三項缺陷,導致不少用戶覺得「愈用愈笨」。公司現已完成修補,並為Codex訂戶重設使用配額。
重點整理
- Astra用戶整周在網上貼出對照測試,指模型自推出後被「偷偷削弱」。
- OpenAI Codex負責人點名三大成因,其中一項為影響約4,000至5,000名用戶的情境實驗。
- 上一代旗艦模型GPT-5.6 Sol早於7月亦被指「被削弱」。
OpenAI修補Astra質素問題
Codex產品總監Tibo Sottiaux在周六發表的最新更新中表示,團隊過去一周聯同用戶追蹤問題來源,之後在本地時間午夜前完成修復,並對所有Codex訂戶做一次全面用量重置。
他解釋,原本為舊模型撰寫的一些「技能」(skills)在Astra上觸發過於頻密,有時會令模型提早停止自我檢查、跳過本應進行的驗算步驟,直接拖低回應質素。
另外,一項可選擇參與的「情境管理」實驗亦被點名。該功能有機會令模型提早「收筆」或誤回覆舊訊息,推算約影響4,000至5,000名測試用戶,OpenAI其後已全面關閉此實驗。
Sottiaux指,部分負責處理尾段流量(tail traffic)的運算引擎配置錯誤,實測顯示會拉低相關請求的整體質素;公司已將這批引擎下線,並同步進行多項細部修補。他在X上表示,Astra現時在追蹤及回應用戶最後一則訊息方面「明顯更準確」。
延伸閱讀: 以太幣遇上2,800美元供應牆 ETF資金流入升至2.16億美元
開發者指Astra寫碼「退步」 寧回頭用Sol
在社群平台X上,一周來不斷有開發者貼出對照測試——以同一組提示詞,同一設定,分別喚起「首日版」Astra與現時版本,再比較二者輸出。
開發者Pranjal Paliwal早前曾大讚Astra,但其後回頭檢視模型為他撰寫的程式碼後,認為新版本比之前「退步」,屬明顯的回溯,而非改善。
建構開發工具Opencode的Dax Raad則表示,由於採用Astra後成本幾乎倍增,但實際體驗不如預期,最終決定帶隊回到上一代GPT-5.6 Sol,認為性價比更高。
在OpenAI官方論壇上,有用戶形容,現時Astra在相同任務下的表現大致與Sol拉平,連重試次數也差不多。不過,並非所有人都認同這種看法,一名化名為Antikythera的用戶則反駁稱,Astra自始就偏向「偷懶」、愛用項目符號,問題在於用戶不再被新鮮感所「眩惑」,感受自然變化。
算力與配額壓力籠罩GPT-6 Astra
自Astra於9月初全面開放以來,背後算力與容量壓力一直影響產品推展。
用戶回報指,OpenAI已對重度ChatGPT用戶下調Astra的使用上限,並暫停接受新的200美元Pro級訂閱。Sottiaux在9月10日接受訪問時證實相關安排。
定價方面,Astra現時維持每100萬個輸入token收費10美元、輸出token則為50美元,是Sol推出時定價的約2.5倍,成本壓力更大。
這已是OpenAI連續兩代旗艦模型,在兩個月內相繼遭付費用戶指控「被削弱」。在7月,部分用戶稱Sol的最高推理模式「一夜之間變得膚淺」。Sottiaux當時否認公司有刻意降級,卻同時承認曾在「推理強度」上做過不同實驗。
下篇值得留意: Nvidia黃仁勳:網絡安全廠商正借AI威脅恐慌受惠

