新闻股票谷歌Gemini智能体为五个未解数学难题找到新证明

谷歌Gemini智能体为五个未解数学难题找到新证明

作者: CryptoBriefing·

要点速览

  • •AlphaProof Nexus是DeepMind基于Gemini 3.1 Pro构建的框架,运行多个独立的证明子智能体,通过迭代推理与修改,直到证明通过自动化机器验证。
  • •该框架解决了353个此前未解的埃尔德什问题中的9个,其中包括两个困扰数学家56年的问题,并证明了整数序列在线百科全书(OEIS)收录的492个猜想中的44个。
  • •每个答案的计算成本仅为几百美元,审阅2026年年中arXiv论文的领域专家既确认了证明,也确认了对原始猜想的忠实形式化。
  • •Aletheia是基于Gemini Deep Think构建的半自主研究助手,自2025年12月部署以来已评估约700个未解的埃尔德什问题,并为其中的13个创建了答案,其中4个为全新的自主解决方案。
  • •Gemini Deep Think在2025年国际数学奥林匹克竞赛中获得42分中的35分,在标准时限内解决5道题中的6道,达到金牌水平。
谷歌Gemini智能体为五个未解数学难题找到新证明

谷歌基于Gemini的数学智能体已为五个此前未解的数学难题找到证明,其方法是由多个AI智能体组成团队,其工作由毫不留情的自动化检查器进行评判。

这一方法记录最完备的实现,是DeepMind称为AlphaProof Nexus的框架。它由Gemini 3.1 Pro驱动,在多轮推理循环中运行多个独立的证明子智能体。这些智能体不会给出一个答案就停下来;它们会推理、修改并在多轮中反复尝试,直到证明通过自动化检查器或失败为止。这种设计意味着接受与否取决于可被机器验证的结果,而不是模型对自身输出的自信。

数据背后的成果

AlphaProof Nexus解决了353个此前未解的埃尔德什问题中的9个——这些问题由20世纪多产、以在题目上附加现金奖励而闻名的匈牙利数学家保罗·埃尔德什提出——其中两个问题曾困扰数学家长达56年。同一框架还证明了收录于“整数序列在线百科全书”(即OEIS,一个数学家编目整数规律的长期参考资源)的492个猜想中的44个。这些成果的计算成本仅为每个问题几百美元。

一篇详细描述这项工作的arXiv论文于2026年年中左右发布。领域专家审阅了这些结果,既确认了证明本身,也确认了对原始猜想的忠实形式化。形式化是指将人类书写的数学问题翻译为精确的、可被机器检验的语言,而不精确的翻译可能意味着完全证明了错误的命题。专家的认可非常重要:它回应了一个反复出现的问题,即AI生成的数学成果是真正正确,还是仅仅具有说服力。

Aletheia与奥赛战绩

另一个独立系统Aletheia基于Gemini Deep Think构建,作为半自主研究助手运行。自2025年12月部署以来,Aletheia已评估了约700个未解的埃尔德什问题,并为其13个确定或创建了答案,获得专家评审的赞誉。这13个中有4个是全新的自主解决方案。

Gemini Deep Think在竞赛中也有出色记录。在2025年国际数学奥林匹克竞赛——这项年度赛事被广泛认为是大学前学生最高水平的数学竞赛——上,它获得了42分中的35分,达到金牌水平,并在人类选手面对的标准时限内解决了6道题中的5道。

智能体方法为何受到关注

Pushmeet Kohli和其他DeepMind研究人员强调,智能体方法有可能超越纯数学领域。他们将组合数学和量子光学等领域列为潜在目标,该研究还强调了在代数几何中的应用。其共同点在于,这些都是可以对所声称的结果依据客观标准进行检验的领域——而这种“智能体加验证器”架构正是在这样的条件下展现出了可衡量的产出。

对数学与AI的意义

研究结果表明,将基于智能体的推理与自动化验证相结合,其应用可能远超所研究的问题,不过研究也指出,当前的AI系统在新颖性评估方面仍需人工监督,即必须由人来确认一项成果是否真正新颖。这种人机协同的要求界定了接下来值得关注的方向:该框架在DeepMind点名的领域中的表现,以及专家评审是否继续认可其产出,将决定这一势头能在多大程度上融入更广泛的研究实践。