OpenAI 发布超过 370 个未解数学难题的 AI 生成解答,在数学界引发分歧
要点速览
- •OpenAI 发布了针对超过 370 个未解数学问题的 AI 生成完整或部分解答,使用的是一个未公开的内部模型,平均每个解答约需三个小时计算时间。
- •此次发布距 OpenAI 宣称解决纳维-斯托克斯方程仅数周,公司还报告了另外三个千禧年大奖难题的进展但未完全解决。
- •OpenAI 将解答发布在 GitHub 上,部分采纳了设于普林斯顿高等研究院的独立顾问小组的披露建议。
- •菲尔兹奖得主 Terence Tao 认为这次大规模发布标志着“数学 1.0”的终结,并呼吁进入一个更重视阐述、社群建设和新研究方向而非单纯解题的“数学 2.0”时代。
- •多伦多大学教授 Dan Litt 对结果表示欢迎,但提醒“AI 已经解决数学”的认知可能导致资助方撤回支持,或打消年轻数学家进入该领域的意愿。

OpenAI 于周二发布了针对超过 370 个未解数学问题的 AI 生成完整或部分解答,其中包括长期被视为该学科重大挑战的难题。结果数量之多令许多数学家震惊,而该公司生成和发布这些结果的方式也在学界引发分歧:一些研究者对此感到兴奋,认为数学家有了广阔的新探索领域;另一些人则认为,OpenAI 及其他 AI 公司解决数学问题的方式,等于对数学作为人文学科的一种冲击。
该公司表示,这些结果由一个未公开的内部 AI 模型完成,平均每个解答约需三个小时计算时间。这一庞大的解答库涵盖了数学家长期认为最重要的许多问题——其中一些问题人类几代人屡攻不下。
此次发布距 OpenAI 宣称用另一个未公开的内部模型解决纳维-斯托克斯方程仅数周。该方程描述流体运动,属于克雷数学研究所 2000 年设立的七个千禧年大奖难题之一,每个难题悬赏 100 万美元——这些奖金至今从未发出,因为该研究所要求声称的解答必须先公开发表并获得数学界广泛认可,方可颁发奖金。在最新一批结果中,OpenAI 表示在另外三个千禧年大奖难题上取得了进展,但尚未完全解决。
AI 公司一直将数学问题作为展示其模型能力的方式。AI 研究人员还表示,用困难数学问题训练模型,可能帮助它们学习可迁移到其他现实领域的能力——例如逻辑推理,或面对难题时的坚持。这也可能提升模型在物理或经济学等高度数学化领域的表现,尽管目前尚不清楚模型的数学能力究竟如何迁移到法律或商业战略等领域——这些领域涉及逻辑推理,却没有客观可验证的正确答案。
与此同时,在攻克极难数学问题时学到的某些特质——例如坚持——可能增加安全风险。在近期的“失控 AI”事件中,AI 智能体为在评估中取得结果不惜采取极端手段,包括未经授权和非法的行为。面对看似不可能的挑战,人类可能会选择放弃,而不是采取这类越界步骤。
多伦多大学数学教授 Dan Litt 告诉《财富》,他对 Open 的结果感到兴奋。“我的看法是,这对数学是件好事,”他说,并补充道 OpenAI 发布的若干解答涉及他感兴趣的问题,他渴望理解 OpenAI 模型找到的解法:“能对我和他人感兴趣的问题得到新解答,我认为非常棒。”
不过 Litt 也提醒,他担心这些结果可能对数学界产生影响——尤其是如果“AI 已经解决数学”这种认知导致资助机构撤回对数学研究的支持,或打消有前途的年轻数学家进入这一行业的意愿。“如果我们想从 AI 在这些问题上取得的进展中获得任何东西,社会就必须重申对人类数学专业能力的支持,”他说。
展示工作过程
当 OpenAI 发布其纳维-斯托克斯方程解答时,两位同样在用 AI 工具(包括 OpenAI 的)研究该问题的数学家指控该公司有意或无意地将其进行中的工作输入其 AI 模型,从而引导模型找到解答。OpenAI 否认了这一说法,表示并未将两人的工作输入模型,并称模型不可能从训练数据中获得其研究的任何线索,因为该数据的截止日期早于两位数学家开始使用 OpenAI 的 Codex AI 产品研究纳维-斯托克斯方程的日期。
针对最新结果,纽约大学的 Tristan Buckmaster——早前争议涉及的数学家之一——告诉《纽约时报》,目前仍不清楚使用 OpenAI 模型的数学家是否在无意中帮助引导了该公司的内部 AI 系统找到这些解答。“很可能有一批结果是他们拿走某人的工作,然后把它做完,”他对《纽约时报》说。鉴于同时发布的结果数量之多,他补充道:“我认为他们根本没有做应有的尽职调查”,以确保模型没有剽窃任何人的工作。
上个月,在纳维-斯托克斯解答引发数学家批评之后,OpenAI 表示正在组建一个关于数学与人工智能的独立顾问小组,设于新泽西州普林斯顿的高等研究院。上月底,该小组发布了一套关于发布 AI 生成数学证明的建议。建议包括:AI 生成的证明应按照传统数学研究论文的规范发布,以便人类数学家更容易审查和学习这些结果。小组还建议,对于每个解答,AI 公司应公开所用模型的名称、使用的提示词、模型的“思维链”(即其推理步骤的输出)、模型得出解答所需的时间,以及计算时间成本的近似值。小组表示,公司还应披露决定让 AI 尝试某个特定问题的原因;如果同时发布多个结果,则应发布一份报告,详细说明为何选择这些问题,以及模型还尝试但未能解决多少个难度相当的其他问题。
OpenAI 将最新数学解答发布在代码托管网站 GitHub 上,部分——但并非全部——采纳了顾问小组的建议。该小组在周二发布的一份声明中表示:“我们重申我们已发布的关于负责任发布的建议。”它称与 OpenAI 的讨论“富有建设性”,但也指出“最终由数学界来评估我们的建议在多大程度上得到了成功遵循,以及是否还有其他应当提出的建议”。
在周二发布的一篇博客文章中,Open 表示其“借鉴了”顾问小组关于如何发布这些解答的建议。“在未来的发布中,我们致力于通过引用、数学阐述和结果呈现进一步提升论文质量,以便更好地理解,”该公司说。它表示正在分享许多问题证明的形式化版本——即可以用专门的计算机软件(即近年来在数学研究中日益普及的证明助手)逐步验证的版本——并将在获得更多时继续分享。对于 10 个问题,它还发布了模型推理过程的摘要、计算资源消耗估算以及尝试问题数量的统计数据。
并非顾问小组成员的 Litt 告诉《财富》,他认可 OpenAI 发布解答方式的诸多方面。他说,将这些结果放在 GitHub 上便于其他数学家研究,并称赞该公司没有在面向非技术受众的博客或营销材料中过度吹嘘任何具体进展。他还表示,他认为 OpenAI 缺乏将所有结果以符合严格学术标准的研究论文形式发表的能力——这既因为 AI 模型撰写的数学阐述不够好,且难以引用前人数学工作,也因为 OpenAI 没有雇用足够多的、在足够多领域具备专长的数学家来理解其模型生成的全部证明。
虽然一些数学家抱怨 AI 生成的证明(如 OpenAI 的纳维-斯托克斯解答)难以读懂,使数学家难以在此基础上继续研究,Litt 表示他认为这种担忧“被夸大了”,并指出数学写作本来就常常晦涩难懂。“我认为要从这些 OpenAI 结果中提炼出理解,将涉及大量人力劳动,但这与数学家一直以来的劳动并没有太大不同,”他说。
OpenAI 表示,希望这些解答“能推动人类知识的前沿,促进数学的进一步发展”。该公司表示将资助一系列研讨会、会议和项目,帮助数学家理解其 AI 系统生成的结果。人类数学家能多快验证并消化如此规模的结果,以及未来的发布是否会采纳顾问小组的全部披露建议,仍是将决定这项工作成效的开放问题。
“数学 1.0”的终结
独立数学顾问小组在其关于此次发布的声明中表示:“数学研究的未来不能仅仅包括理解 AI 实验室产出的结果。数学家必须能够提出自己的问题、发展自己的方法,并探索那些未被选作 AI 系统能力示例的方向。公平获取强大的研究工具和充足计算资源对这种自由至关重要。”
加州大学洛杉矶分校数学教授、菲尔兹奖得主 Terence Tao 被认为是在世最伟大的数学家之一,他对 AI 公司攻克数学问题的方式越来越持批评态度。他提出,正是得出解答的过程——而非解答本身——推动了数学理解,而 AI 公司如此迅速地解决如此多有趣的问题,正在打消学生成为数学家的意愿,剥夺这一领域的未来。
周二,Tao 在去中心化社交网络 Mastodon 上的发帖中重申了这些批评。“问题正由 AI 提示词操作者自主解决,他们一旦最初的目标被‘解决’,就对这一更广泛的领域本身失去兴趣,而且对 AI 输出的理解不足以回答关于结果的问题、做报告或以其他方式与学界其他成员交流他写道。“与传统突破相比,从这些结果中产生的研讨会、工作坊、合作或其他活动要少得多;因此很少有人加入围绕这一领域的社群;而且有前景的开放方向如今因担心自己的研究被‘抢发’而被扣留,不向公众公开。”
Tao 表示,OpenAI 大规模发布数学解答标志着“数学 1.0”的终结——在那个时代,为未解猜想和问题寻找解答,即便这些解答起初难以被理解,是这一领域的引擎。他说,如今必须进入一个“数学 2.0”时代,这个时代“需要弱化单纯解题的角色,更全面地衡量数学进步——例如提升阐述的作用,也包括社群建设和开辟新的研究方向。”
Litt 表示,他同意 Tao 关于这一领域必须改变的观点。他说,OpenAI 发布如此庞大的解答集,将有助于让整个领域“达成共识,明白我们需要在重新思考方面稍微激进一点”,例如它奖励何种贡献以及如何培养博士生。虽然 Tao 对这一转变总体上显得感伤,Litt 却表示他对此“乐观”。
“我的一位合作者告诉我:‘我感觉自己爬了一辈子,现在终于能飞了,’”Litt 谈到 AI 作为解决数学问题的工具问世时说。“我们现在能做的事情令人难以置信。”他说,他预计 AI 将使人类数学家能够进行远超以往更多的“开放式探索”:“我们应该期待数学家在未来会更加高产。”
本文最初发表于 Fortune.com