新聞股票Google Gemini 代理為五道未解數學難題找出新證明

Google Gemini 代理為五道未解數學難題找出新證明

作者: CryptoBriefing·

重點速覽

  • •AlphaProof Nexus 是 DeepMind 建構於 Gemini 3.1 Pro 的框架,運行多個獨立的證明子代理,透過反覆推理與修改,直到證明通過自動化機器驗證為止。
  • •該框架解決了 353 道先前未解埃爾德什難題中的 9 道,包括兩道已困擾數學界 56 年的難題,並證明了線上整數數列大全(OEIS)中 492 項猜想中的 44 項。
  • •每個解答的算成本僅數百美元,審閱 2026 年年中 arXiv 論文的領域專家確認了證明本身以及對原始猜想的忠實形式化。
  • •Aletheia 是建構於 Gemini Deep Think 的半自主研究助理,自 2025 年 12 月部署以來已評估約 700 道未解的埃爾德什難題,並為其中 13 道產出解答,其中 4 道為新穎的自主解答。
  • •Gemini Deep Think 在 2025 年國際數學奧林匹亞獲得 42 分中的 35 分,於標準時限內解出 6 題中的 5 題,達到金牌水準。
Google Gemini 代理為五道未解數學難題找出新證明

Google 以 Gemini 驅動的數學代理已為五道先前未解的數學難題產出證明,其做法是運用多個 AI 代理組成的團隊,其成果由嚴格的自動驗證器評分把關。

這種方法記錄最完整的實作,是 DeepMind 稱為 AlphaProof Nexus 的框架。它以 Gemini 3.1 Pro 為基礎,在多輪推理循環中運行多個獨立的證明子代理。這些代理不會只給出一個答案就結束;它們會反覆推理、修改並重試,直到證明通過自動驗證器或失敗為止。這種設計意味著能否被接受取決於機器可驗證的檢驗,而非模型對自身輸出的信心。

成果背後的數字

AlphaProof Nexus 解決了 353 道先前未解埃爾德什難題中的 9 道——這些是 20 世紀多產的匈牙利數學家保羅·埃爾德什所提出、並以懸賞現金獎金聞名的未解問題——其中兩道已困擾數學界 56 年。同一框架也證明了線上整數數列大全(OEIS)中收錄的 492 項猜想中的 44 項,OEIS 是數學家長期用以編錄整數模式的參考資料庫。這些成果的計算成本每題僅數百美元。

一篇詳述這項研究的 arXiv 論文於 202 年年中左右發表。領域專家審閱了研究成果,並確認了證明本身以及對原始猜想的忠實形式化。形式化是指將人類撰寫的數學問題轉譯為精確的機器可驗證語言,而不精確的轉譯可能導致證明了完全錯誤的命題。專家的把關至關重要:它回應了一個反覆出現的疑問——AI 產生的數學究竟是真正正確,還是僅具說服力。

Aletheia 與奧林匹亞戰績

另一個名為 Aletheia 的系統建構於 Gemini Deep Think 之上,作為半自主的研究助理運作。自 2025 年 12 月部署以來,Aletheia 已評估約 700 道未解的埃爾德什難題,並為其中 13 道找出或建立了解答,獲得專家審閱者的讚譽。這 13 道中有 4 道是新穎的自主解答。

Gemini Deep Think 也擁有競賽紀錄。在 2025 年國際數學奧林匹亞——這項年度競賽被普遍視為大學以下學生最艱難的數學競賽——它獲得 42 分中的 35 分,達到金牌水準,並在人類參賽者所面對的標準時限內解出 6 題中的 5 題。

為何代理式方法備受矚目

Pushmeet Kohli 與其他 DeepMind 研究人員強調,這種代理式方法可望延伸至純數學以外的領域。他們指出組合數學與量子光學等領域是潛在目標,這項研究也凸顯了在代數幾何中的應用。共同點在於,這些都是主張的成果能以客觀標準檢驗的領域——而這正是這種代理加驗證器架構已展現可衡量成果的條件。

對數學與 AI 的意義

研究結果顯示,將代理式推理與自動化驗證相結合,應用範圍可能遠超所研究的問題,不過研究也指出,目前的 AI 系統在新穎性評估上仍需人工監督,意即必須由人來確認某項成果是否真正具有新穎性。這種人機協作的要求也界定了後續觀察重點:該框架在 DeepMind 所點名的領域表現如何,以及專家審閱者是否持續認證其成果,將決定這股動能有多少能延續到更廣泛的研究實務中。