自学成才的临床医生借助16小时AI会话,解决应用数学领域悬置二十余年的开放难题
要点速览
- •Crouzeix猜想于2004年提出,涉及将矩阵谱范数与多项式在其数值域上取值联系起来的一个界。
- •Jin在接受地质学与医学训练之后,通过自学掌握了数学专业知识。
- •该证明来自GPT-5.6 Sol在ChatGPT工作模式下长达16小时的自主会话,其间使用了相互竞争的子代理和内部对抗性测试。
- •2026年7月27日发布的预印本包含完整提示词、历版草稿、Lean形式化验证和公理审计。
- •该证明已由Alex Townsend、Anne Greenbaum和Michel Crouzeix审阅,八天后Emiel Lorist和Felix Schwenninger发布了独立证明。

北京协和医院(Peking Union Medical College Hospital)博士后研究员兼神经外科住院医师Shanmu Jin证明了Crouzeix猜想——矩阵分析领域一个悬置二十余年的问题。这一决定性论证并非出自数学系,而是来自GPT-5.6 Sol在ChatGPT工作模式下长达16小时的自主运行,由Jin本人精心设计的提示词引导完成。
通往经典问题的非常规之路
Jin走向这一猜想的历程绝非直线。他本科攻读地质学,随后取得医学学位,并通过自学构建起自己的数学知识体系——最初的动力来自经颅超声研究。
Crouzeix猜想由法国数值分析学家Michel Crouzeix于2004年提出,探讨矩阵谱范数与多项式在其数值域上最大值之间的关系。数值域是复平面上的一个紧凸集(又称值域),相比特征值本身,它能刻画矩阵更多的行为特征。该猜想断言常数2足以使这一界成立,且已知2是可能成立的最小常数;Crouzeix的原始论文证明了一个有限常数11.08,而已发表的最优界——2017年Crouzeix与Palencia得出的1 + √2(约2.414)——仍高于目标值。该猜想的解决在矩阵函数分析、GMRES等迭代求解器(这类求解器是科学计算与工程模拟中大型稀疏线性方程组的标准主力)以及有理Krylov方法中都有直接应用。
自主会话内部
Jin没有以交互方式向模型逐步提问,而是借鉴OpenAI此前为另一项数学成果——Cycle Double Cover猜想(圈双覆盖猜想)——开发的提示词架构,开展了一次长时间的自主会话。该设置切断了模型的互联网访问,并部署了多个相互竞争的子代理,分别负责独立开发和压力测试不同的证明策略;设置中明确要求避免过早收敛,并规定只能通过具体反例来证伪候选论证。模型被指示持续运行,直到完整证明通过内部对抗性审查。
由此形成的预印本于2026年7月27日发布,包含完整提示词、历版草稿手稿、Lean形式化验证——即利用包括陶哲轩(Terence Tao)在内的数学家曾用于认证复杂论证的同类证明助手技术,将证明转化为机器可检验的形式——以及一份公理审计。
同行确认与“如今谁在做数学”之问
该证明已由康奈尔大学数学家Alex Townsend、数值分析学家Anne Greenbaum以及猜想提出者Michel Crouzeix本人审阅并确认。正式同行评审仍在进行中。
在最初预印本发布八天后,数学家Emiel Lorist与Felix Schwenninger发布了一份独立的五页证明,采用不同方法,将经典双层位势理论与关于2-膨胀的扰动引理相结合。Jin对这一并行结果表示欢迎,认为它是对自己工作的补充。
这一事件揭示了数学研究中一个难以忽视的结构性转变。当一个自2004年以来悬而未决的问题被一位自学成才的临床医生用消费级AI工具解决时,产出新成果的门槛大幅下降——而验证这些成果所需的专业能力则相应变得更加集中、更具价值。该结果也延续了AI系统进军数学领域已有迹可循的脉络:此前,Google DeepMind的AlphaProof与AlphaGeometry 2已在2024年国际数学奥林匹克竞赛中达到银牌水平。
对AI领域而言,这一案例具体展示了前沿语言模型在获得结构良好的自主任务与充足计算时间后所能取得的成果。数学界是否具备吸纳可能随之而来的大量成果的基础设施,仍是一个悬而未决的问题。