GPT-6 Astra 用戶稱 OpenAI 最新模型遭「弱化」
重點速覽
- •部分用戶反映 GPT-6 Astra 如今回應更快但輸出品質更低,開發者 Pankaj Kumar 懷疑 OpenAI 調降了模型的運算投入,惟公司尚未證實此調整。
- •Salio 與研究員 Md Ismail Sojal 表示,他們以相同設定在發佈日版本與當前版本上執行相同提示詞,兩人都回報當前模型結果更差。
- •Dax Raad 的 Opencode 團隊在支出翻倍後改回 GPT-5.6 Sol,認定 Astra 的缺點不值得其溢價定價。
- •包括 Antikythera 與 T3Chat 創辦人在內的批評者主張模型並未改變,是發佈週熱潮退去才了長期存在的不穩定性。
- •Astra 仍是 OpenAI 首個跨越該公司網路安全風險關鍵門檻的模型,定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元,為 Sol 發佈時定價的 2.5 倍。

用戶湧入 X 抱怨 OpenAI 的 GPT-6 Astra 在發佈僅一週後能力下降。部分用戶反映回應速度變快但結果變差,另一些人則主張該模型本就不穩定,只是最初的興奮掩蓋了其弱點。
一週前,GPT-6 Astra 還在遊戲引擎內逐街重建曼哈頓,其能力令用戶印象深刻。本週,部分相同的用戶開始張貼截圖,追問 OpenAI 模型到底出了什麼問題。
「Astra feels significantly dumber for me today,」化名開發者 synthwavedd 在 X 上寫道。「發生『發佈後腦葉切除了』只是時間問題。可惜。」
這種模式對人工智慧聊天機器人與代理程式的用戶而言並不陌生,他們有時會覺得心儀的模型在發佈後遭「nerfed」(弱化)——這是借自遊戲圈的用語,指開發者削弱原本過於強大的東西。對於感知到的性能下滑可能有合理的解釋,但針對 GPT-6 Astra 的類似投訴數量之多,促使用戶比較輸出結果、檢視模型是否有所改變這個問題對開發者具有實際影響,因為他們的產品建立在租用而非自營的模型之上,而專有系統不開放內部檢視,並排比較輸出結果是外部人士少數可用的驗證手段。
先前曾讚譽 Astra 的開發者 Pranjal Paliwal 表示,他後來檢視了模型寫出的程式碼,並改變了原本的評價。
「We don't have AGI,」Paliwal 寫道。「We have a regression。」
AGI(通用人工智慧)是業界對一種能執行幾乎任何人類認知任務的機器的稱呼。OpenAI 總裁在 Astra 發佈會上曾使用這個詞。一週後,Paliwal 卻用它來描述模型表面能力與其錯誤之間的落差。
其他投訴也呈現類似模式。開發者 Pankaj Kumar 列舉了回應變快、品質變低等症狀,並懷疑 OpenAI「reduced the juice value」。創辦人 Saba 也直接質問 OpenAI,為何她現在得把任務「dumb it down」才能完成。
「Juice value」並非官方技術術語。在此語境下,用戶以它簡稱模型在回答前投入的運算思考量,並暗指 OpenAI 可能在發佈示範結束後調降了這項投入。OpenAI 並未證實曾對 Astra 做出此類調整。
一些用戶嘗試了直接比較。Salio 與研究員 Md Ismail Sojal 表示,他們以相同設定,用完全相同的提示詞分別測試發佈日版 Astra 與當前版本。兩人都回報當前模型的結果更差。
「Today's GPT-6 Astra output looks worse。GPT-6 Astra at launch vs GPT-6 Astra today,」Sojal 寫道。該貼文指出比較使用了相同的提示詞與設定,且「[t]he difference is bigger than I expected」。
另有用戶表示已改回 Astra 的前代模型。打造程式編寫工具 Opencode 的 Dax Raad 表示,他的團隊已回歸 GPT-5.6 Sol,因為支出翻倍,而使用 Astra 的缺點不值得付出這個代價。ChatGPT 用戶 Mustafa Sahinli 的說法更直白:Astra 現在讓他感覺像是「發佈 1 週後」的 Claude Opus 4.6,暗諷 Anthropic 的模型在發佈後同樣遭遇的反彈。
並非所有人都認為 OpenAI 蓄意弱化了 Astra。化名用戶 Antikythera 提出最詳盡的反駁,主張時間線其實恰好相反。
「It is as dumb as it was on launch,」Antikythera 寫道。「The model is good, but the model has a lot of problems. It's lazy. Writes like a bullet-point-addict... people were overhyped on launch week, now they had time to test it and see its mistakes.」
按照這種解釋,Astra 並沒有變弱,用戶不再被早期的示範眩惑,開始注意到它一再出現的問題。
T3Chat 創辦人 Theo 持有類似看法。他表示 Astra 比 Claude Fable 更不穩定,有時能寫出傑出的程式碼,有時卻寫出極差的程式碼。
「GPT-6 Astra has done incredible things I never thought a model could do. It has also done some of the stupidest things I've ever seen a model do. Generally speaking, Fable 5.1 just does what I ask,」Theo 於 2026 年 9 月 8 日在 X 上寫道。他認為負面案例的增加,或許反映的是模型蜜月期的結束,而非其行為已證實改變。
這場爭論令人想起 OpenAI 前一代旗艦模型 GPT-5.6 Sol 的遭遇。今年七月,用戶指稱 Sol 最高階的推理模式突然變得淺薄。OpenAI 高層 Tibo Sottiaux 否認蓄意弱化該模型,但證實公司一直在實驗「reasoning effort」(推理投入)設定,該設定控制模型在給出答案前要「思考」多少步驟。
一則回覆總結了關於封閉式 AI 實驗室的老笑話:公司發佈一個模型,幾天後它就會「染上某種怪病,突然變笨」。另一人則一句話道出憤世嫉俗的理論:「它們大概被量化了,這樣才不會燒掉公司太多錢。」
量化是指縮減模型內部運算的精確度以降低成本,往往會犧牲若干準確度。OpenAI 從未證實曾蓄意對已發佈的模型進行量化。
OpenAI 尚未就 Astra 發表類似 Sol 事件的聲明。七月間,類似的 Sol 投訴潮曾促使公司高層公開回應;OpenAI 是否會以同樣方式回應 Astra 的投訴,仍是未知數。該模型仍是公司首個跨越其所謂網路安全風險關鍵門檻的模型。這項認定意味著 Astra 能在無人類指導下發現並串連利用先前未知的軟體漏洞,此能力僅限於透過 OpenAI Daybreak 計畫審核通過的防禦者使用。
無論 Astra 是否真的變弱,其標價仍為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元——是 Sol 發佈時定價的 2.5 倍,而至少已有一個團隊認定這筆溢價不值得支付。