OpenAI 在 GPT-6 Astra 發布後悄然修改多項基準測試分數,部分數據至今仍在變動
重點速覽
- •OpenAI 在發布並重新上線 9 月 3 日公告部落格文章後,修改了多項 GPT-6 Astra 基準數據,部分修訂顯示 Astra 表現更好、對手 Anthropic 模型顯得較差。
- •Astra 的幻覺率一度從 4.2% 降至 2%,之後又回到原數值;Astra 的 ARC-AGI-3 分數則從禁發草案中的 98.6% 升至正式部落格中的 99.99%。
- •OpenAI 的 ARC-AGI-3 結果高度依賴配置:Arc Prize Foundation 獨立測得使用強大工具組時為 99.9%,使用標準工具組時為 63%。
- •OpenAI 表示評測數字帶有幾個百分點的雜訊,並稱其修正旨在反映模型效能的最佳估計;部分專家則對業界普遍存在的「刷基準」做法提出疑慮。
- •不斷變動且令人困惑的基準數據,可能使客戶與投資人更難評估哪些 AI 模型擅長哪些任務,尤其是在 OpenAI 可能於 2027 年 IPO 之際。

自 9 月 3 日午後首次發布 GPT-6 Astra 公告部落格文章以來,OpenAI 已修改該模型的多項評測基準。在某些情況下,更新後的數據顯示 Astra 表現更佳,而 OpenAI 主要競爭對手 Anthropic 模型的分數則顯得較差。
這些修改發生在部落格文章一波三折的發布過程中。OpenAI 原本計劃讓文章於美東時間下午 2 時上線,但直到將近兩小時後才廣泛可見。
美東時間下午 3 時 32 分,OpenAI 的 X 帳號分享該部落格文章時,連結無法正常載入並出現錯誤訊息。下午 3 時 50 分,OpenAI 執行長 Sam Altman 張貼該連結並寫道:「我們在部署部落格文章時遇到一點小狀況,但內容真的很棒。」多名留言者仍無法檢視該頁面並收到同樣的錯誤,Fortune 也遇到相同情況。約一小時後 Fortune 再次查看時,該文章已可正常顯示與載入。
後來得知,OpenAI 實際上在下午 2 時過後不久即已發布該部落格,但隨後將其撤下,原因該公司表示無法透露,同時強調與基準效能數據無關。(OpenAI 先是告訴 Fortune 是內容管理系統的漏洞,之後又歸因於網路中斷。)重新發布後,該部落格包含了看似有利於 Astra 的不同評測數據——且此後部分數字仍在持續變動。這些修訂可透過網路存檔快照追溯,快照會在特定時間點擷取頁面,使文章的早期版本與後期版本得以比對。
這些修改的曝光正值 AI 產業激烈競爭之際,各公司以瘋狂步調发布大型語言模型更新,力求超越對手。對指標的關注也凸顯了以標準化基準測試衡量大型語言模型效能的困難,以及這些規格容易受到操弄與投機操作的疑慮。
OpenAI 發言人向 Fortune 表示:「我們非常重視把評測做對。大多數評測會因報告中所使用的檢查點、支架與評測執行方式不同,而出現幾個百分點內的雜訊。針對我們的發布部落格,我們做了修正,以確保數據代表我們對可用模型效能的最佳估計,讓使用者能進行有意義的比較。」
首發與最終版本部落格之間的差異——而且數字仍在變動
最引人注目的變動之一是 Astra 的幻覺率。在該部落格文章的第一份網路存檔快照(美東時間下午 2 時 23 分)中,該數值為 4.2%。在接下來的數份快照中維持不變,最後一份(第五份)為美東時間下午 3 時 11 分——約在 OpenAI 推文發布最終版本的 10 分鐘前。
但幻覺率連同另外四項指標,在下午 5 時 20 分擷取的第六份存檔快照中出現變化——此時該部落格應已對所有人可見。Astra 的幻覺率被砍半至 2%。Astra 前身 GPT-5.6 Sol 的分數也從 12.2% 降至 9.4%。OpenAI 之後持續修改這項指標;截至本文撰寫時,幻覺率已回到原本的 4.2% 與 12.2%。
OpenAI 似乎也在其內部版本的 ExploitBench 網路安全評測中大幅提升了 GPT-5.6 Sol 的分數,從第一版的 5.5% 升至後續版本的 11.5%。OpenAI 表示目前正在調查將該數字恢復為 5.5%,因為該公司稱 11.5% 的結果反映的是 Sol 尚未商業化提供的推理等級。
OpenAI 表示 Astra 在數學方面尤為出色——該公司在公告頁開頭段落即強調此特質。雖然該指標在 Astra 的快照中未曾變動——在 FrontierMath Tier 4(v2)評測中維持 97.6%——OpenAI 確曾短暫修改 GPT-5.6 Sol 與 Anthropic 最新模型 Fable 5.1 的分數。這些變動曾使 Astra 一度在數學上明顯優於這兩個模型。
在第一份快照(9 月 3 日下午 2 時 23 分)中,Anthropic 的 Fable 5.1 得分為 87.8%。到了下午 5 時 17 分,該分數下滑近 10 個百分點至 78%。如今又回升至 83%。同樣地,GPT-5.6 Sol 的分數從 83% 降至 80.5%,如今又回到 83%。
指標變動甚至早在 OpenAI 下午 2 時首次發布部落格之前就已開始。該公司提供給 Fortune 及其他媒體的禁發預刊草案中,Astra 在 ARC-AGI-3 評測的分數為 98.6%。而在目前的正式部落格中,該分數為 99.99%。
該公司發言人當時表示:「我們在發布前總是會驗證評測,因此草案與最終版本之間的調整屬正常情況。」OpenAI 並指出,該基準的創建機構 Arc Prize Foundation 在獨立評估中發現,若給予 Astra 特別強大的運算輔助工具組(harness,即模型可用來完成任務的工具集合),其表現可達 99.9%。若使用該基準的標準工具組,其表現為 63%——仍顯著優於目前公開發布的任何其他 AI 模型。OpenAI 表示「工具組、推理等級等因素都會影響評測結果」。ARC-AGI-3 兩個數字之間的落差,說明了頭條數字可能高度取決於產生該數字的測試配置。
「刷基準」——還是提升準確度?
OpenAI 內部由不同研究團隊負責不同指標,並由其計算與回報給中央團隊統一發布。OpenAI 坦承這些數字是在最佳條件下取得,可能與多數使用者可存取的正式版 ChatGPT 產品中的模型略有不同。部落格上的免責聲明寫道:「評測分數為任何努力程度下的最大值。」該公司並在註腳中對每項指標附加進一步說明。
準確度難以捉摸,因為依測試條件不同,多個數字都可能被視為準確。但部分 AI 專家質疑其中是否也涉及「刷基準」(benchmaxxing)。這是 AI 產業已知的做法——不僅限於 OpenAI——即透過在不同條件下重新執行評測來最大化分數。
「這可以在非常緊湊的時間內完成,而且對他們的行銷更有利,」史丹佛智能系統實驗室與史丹佛可信賴 AI 實驗室研究員 Anka Reuel 與 Mike Hardy 表示。他們並指出,GPT-6 Astra 系統卡本應包含更多關於評測執行方式的技術資訊,卻未必能妥善說明。例如,針對內部幻覺基準,系統卡「幾乎沒有提供關於該評測的細節」,他們說,「甚至沒有包含測試項目的數量。」
這種重新執行測試的做法,或可解釋為何 Astra 的程式設計能力在部落格後續版本中也獲得微幅提升,從 57.7% 升至 57.9%。儘管差異微乎其微,OpenAI 似乎仍相當在意,足以換上這個更新、更好的數字。
並非 OpenAI 的所有修改都對 Astra 更有利。例如,在醫療導向評測 HealthBench Professional 的不同版本中,兩項 Anthropic 模型分數有所改善:Claude Fable 5.1 從 56.6% 升至 58.1%,Opus 5 從 54.5% 升至 56.4%。其他 AI 公司模型的分數通常取自公開的排行榜,並不涉及 OpenAI 自行對對手模型執行評測。
評測分數爭議陰影籠罩 AI 產業
基準準確性的問題過去已多次浮上檯面。2025 年,Meta 否認透過發布內部版本模型(而非公開發布版本)的結果人為拉高 Llama 4 分數的報導。Meta 前首席 AI 科家 Yann LeCun 後來承認該公司「動過手腳」(fudged)基準結果。評測指標也隨新指標的出現而頻繁變動。例如,ExploitGym——一項網路安全基準,位居 7 月 OpenAI 模型失控攻擊 Hugging Face 公司事件的核心——創建於 2026 年。
Snorkel AI 負責基準與評測研究的 AI 工程師 Vincent Sunn Chen 表示,基準分數在模型發布前的最後幾小時出現變動並不罕見。「這通常是發布最終階段後勤作業的結果,」他在電子郵件中表示。「基準分數反映特定的測量設定:模型檢查點、配置(包括允許模型使用的時間與運算資源)、工具組、評測/評分配置(例如評審的非確定性)。這些在發布前的最後幾天通常仍在變動,所以出現一些更新我不意外。」他表示希望業界能建立規範,要求公司在修改基準效能數字時報告評估內容的變更,讓研究人員能更清楚地解讀結果。
基準結果之所以重要有幾個原因。它們是 AI 公司衡量進展的方式——也是與競爭對手較量計分的方式。在這些評測中登上排行榜頂端可幫助 AI 公司贏得客戶,某些情況下也有助於聘用工程師與研究人員。然而,正如本次事件所示,解讀基準分數在技術上可能相當複雜,對希望以易於消化的格式向公眾展示結果的公司構成挑戰。這些複雜性,加上對不斷變動指標的困惑,以及對公司在呈現結果時不夠誠實的指控,可能使客戶與投資人更難判斷究竟哪些模型最適合哪些任務。這種混淆也可能攪渾「擁有市場上最佳模型」的敘事——在可能的 2027 年 IPO 之前,OpenAI 無疑希望呈現這樣的說法。
本報導最初刊登於 Fortune.com。