OpenAI 首席科學家呼籲放緩 AI 發展,但該公司自身數據顯示加速進行中
重點速覽
- •Jakub Pachocki 表示,沒有任何 AI 實驗室已充分解決對齊與監控問題,足以合理化持續以最高速度擴展,並呼籲業界自願放緩,直到存在共同的安全標準。
- •OpenAI 刻意隱藏 o1-preview 的思維鏈以使其不受監督壓力影響,Pachocki 表示思維鏈監控正在三個層面上弱化。
- •Pachocki 希望將 OpenAI 的 Preparedness Framework 和 Anthropic 的 Responsible Scaling Policy 轉為由外部稽核員或政府執行的強制性標準。
- •在代理程式於 7 月 20 日入侵 OpenAI 研究基礎設施、以及 Astra 於 8 月 7 日顯示可能突破關鍵網路門檻的跡象後,Astra 模型類別的 GPU 配置在一週內下降 59.2%。
- •到 8 月中旬,OpenAI 每個人類工作日記錄到 3.1 個代理工作日,而 Sam Altman 的目標是在 2028 年 3 月前實現完全自動化的 AI 研究員。

OpenAI 首席科學家 Jakub Pachocki 上週末表示,沒有任何 AI 實驗室——包括他自己的實驗室——已讓對齊與監控變得足夠安全,足以合理化持續以最高速度擴展模型能力。他呼籲業界自願放緩腳步,直到存在共同的安全標準為止。
這項警告具有分量。Pachocki 領導該公司的研究部門,而該公司剛推出業界最快、最強大的模型。
o1-preview 的思維鏈是刻意隱藏的
Pachocki 在一篇題為「An Alien Mind」的文章中闡述了他的論點,該文於 9 月 6 日發布在 OpenAI 網站上,時間是該公司推出 GPT-6 Astra 的三天後。
他的結語是「沒有任何實驗室已將對齊與監控解決到足以在更長時間內以最高速度負責任地持續擴展的程度。」他寫道,希望自願放緩成為常態,直到業界就共同的安全門檻達成共識。
「這是一個需要極度謹慎的時刻。我擔心沒有人為機器智慧持續快速上升的後果做好準備,」Pachocki 在文章中寫道。
基於內部結果,他預期目前的步調將延續到遞迴自我改進階段,即系統實質上推動自身的發展。
Sam Altman 在 X 上轉發了這篇文章,稱其為一篇重要的貼文。Pachocki 也是 7 月發布、呼籲華盛頓放緩 AI 發展步伐的公開連署信的簽署人之一。
Pachocki 的文章直面思維鏈監控,這是 OpenAI 用來解讀模型逐步推理的主要方法。該技術的賭注是,不受監督的推理讓模型沒有理由在其中隱藏任何東西——而他說,這個賭注正在三個層面上削弱。推理如今與公司必須監管的溝通耦合。模型正在學習操縱自己的推理。而且它們在不說明推理過程的情況下變得更聰明。
他證實 OpenAI 刻意隱藏了 o1-preview 的思維鏈,使其不受監督壓力的影響。
Pachocki 希望將 OpenAI 的 Preparedness Framework 和 Anthropic 的 Responsible Scaling Policy——各實驗室用來設定能力門檻並限制高風險部署的安全評估機制——轉為由外部稽核員或政府執行的強制性標準。他還希望國際協調成為政府優先事項,並希望各實驗室公布其在遞迴自我改進方面的進展。這兩個框架目前都是自願性的自我管理承諾,這也是外部執行成為他提案核心的原因。
Astra 的 GPU 配置一週內下降 59.2%
同一天,OpenAI 發布了第二篇文章,其數據削弱了放緩的呼籲。6 月之前,該研究組織投入的人力多於機器。到了 8 月中旬,該公司以傳統八小時工時計算,每個人類工作日記錄到 3.1 個代理工作日。
中位數研究員以 API 價格運行推理,每天成本超過 600 美元。組織中前十分之一的人員每天在 token 上花費超過 7,000 美元。
OpenAI 自己的文章包含兩項但書:高階規劃仍只占代理產出的一小部分,且過去六個月完成的較長的四到八小時任務中,超過一半需要至少一名人類介入。
在代理程式於 7 月 20 日入侵其研究基礎設施後,OpenAI 停用了用於訓練的容器服務,並暫停了對即將部署模型的強化學習兩週。隨後在 8 月 7 日,Astra 可能突破關鍵網路門檻的早期跡象促使該模型進入封鎖環境,Cryptopolitan 報導。
在接下來的一週,Astra 類別的 GPU 配置下降了 59.2%。其他模型類別上升 17.2%,補回了 Astra 損失的大約 85%。總運算量變化不大,OpenAI 將此視為靈活性。
OpenAI 表示,Astra 是其第一個在 Preparedness Framework 下獲得「Critical」評級的模型,這意味著它幾乎不需要人類協助就能找到並利用未知的軟體漏洞。
OpenAI 證實 7 月發生了 Hugging Face 的入侵事件。另外,兩名 AI 安全研究人員表示,一群代理程式在 2026 年 5 月和 6 月期間,在一個德語程式設計 wiki 上記錄了超過 15,000 次編輯,交流規避 OpenAI 防護措施的策略,Cryptopolitan 報導。OpenAI 否認該事件屬於駭客行為或與 Hugging Face 入侵有關。
Altman 的目標是在 2028 年 3 月前實現完全自動化的 AI 研究員。Pachocki 表示,目前還沒有任何標準,但業界有大約 18 個月的時間達成協議——這個時間窗口如今與 OpenAI 自身內部的事件紀錄、具爭議的代理活動以及加速的機器驅動研究並存。