科技
您当前的位置: 首页 > 科技

OpenAI公布700多篇AI数学研究稿件引争议:数学家担忧的不是输赢,而是如何继续研究

时间:2026-10-11 11:30:22
更多
  


OpenAI展示AI数学能力,700多篇研究稿件引发争议

人工智能正在从辅助写作、编程和信息检索,逐步进入更具专业门槛的科学研究领域。数学作为强调严密推理和逻辑验证的学科,也成为检验AI科研能力的重要场景。

2026年10月6日,OpenAI一次性公布700多篇AI生成的数学研究稿件,展示模型在数学问题探索和证明方面取得的进展,并表示将提供资金支持后续研究。

这次发布很快引起数学界关注。部分研究者认可其中一些成果的技术价值,认为AI可能帮助人类探索过去难以处理的问题;但也有数学家对发布方式提出批评:当大量稿件集中出现,而证明解释、同行交流和后续研究支持尚不充分时,学界该如何有效评估并利用这些成果?

意大利博洛尼亚大学数学系副教授恩里科·法蒂根蒂表示,自己平时也会借助AI查阅文献、探索思路和辅助教学,但这并不意味着研究者应当无条件接手整理难以阅读的AI生成论文。

菲尔兹奖得主、加州大学洛杉矶分校数学教授陶哲轩也关注到部分证明中值得进一步探索的思路。他提出的核心问题之一是:成果公开之后,研究者能否找到相关人员讨论方法、澄清疑问,并带领学生继续推进研究?

争议由此超出了模型能力本身,延伸至科研成果应当如何发布、验证和共享。

从数学难题测试到大规模成果发布

OpenAI近年来持续将数学和理论计算机科学作为评估模型推理能力的重要领域。

据报道,今年6月,OpenAI首席执行官萨姆·奥尔特曼与公司首席科学家雅各布·帕霍茨基曾将“自动化AI研究员”列为公司的发展目标之一,并谈及未来AI系统与人类研究人员共同开展研究的可能性。

8月1日,OpenAI公布了数学与理论计算机科学领域的十项进展,涉及群论、几何等方向,并称内部模型解决或实质推进了一些长期开放的问题。

随后,公司进一步开展针对千禧年难题的测试。根据OpenAI披露的信息,团队最初听说有人解决了两个千禧年难题,结合内部模型能力的提升,决定扩大测试范围,将更多未解难题纳入探索。

测试过程中,团队把大量计算资源集中于纳维–斯托克斯方程相关问题。OpenAI称,参与任务的小组约有1万个并发智能体,从首批智能体启动到得出结果约用了88小时,之后又花费17小时完成Lean形式化及验证工作。

不过,后续沟通显示,最初听到的相关消息涉及的是其他研究者在有外力欧拉方程方面取得的成果,并非OpenAI原先理解的纳维–斯托克斯问题解法。

9月8日,OpenAI公开了相关证明及其形式化版本,并表示发布成果并非为了申领千禧年大奖,而是希望向外界展示模型能力的进步,以及未来模型可能具备的科研潜力。

10月6日,公司又公布数百篇数学研究稿件。这一系列动作显示,OpenAI正试图通过更具挑战性的科学问题,评估和推动模型的推理与研究能力。

数学家为何不满:有结果,还需要可理解、可验证

数学研究并不是简单地给出一个答案。一个有价值的证明,除了需要在逻辑上成立,还应当清楚说明问题、使用的前提、关键推理步骤,以及它与已有研究之间的联系。

当AI在短时间内生成大量研究稿件时,研究者面对的任务也随之发生变化:他们不仅需要判断结果是否正确,还可能需要逐篇检查论证、寻找隐藏的错误、补充文献引用,并将难以理解的推理整理成适合同行交流的形式。

如果这些工作没有得到充分处理,成果数量的增加未必能直接转化为研究效率的提升。

这也是数学家批评此次发布方式的重要原因之一。他们关注的并非AI是否应该参与数学研究,而是如何让AI生成的成果真正进入学术共同体,成为其他人能够理解、检验和继续发展的知识。

陶哲轩等研究者希望获得更好的研究工具,也希望前沿模型能够向更多独立研究者开放,让学界共同参与评估。对于数学家而言,一份证明的意义不仅在于解决了什么问题,也在于它能否揭示新的方法,并为后续研究打开方向。

形式化证明能否解决质量问题?

在AI数学研究中,Lean等形式化证明工具受到越来越多关注。这类工具能够将数学命题及其证明转化为计算机可以检查的形式,从而验证形式系统中的逻辑推导是否符合规则。

对于AI生成的数学成果,形式化验证有助于提高检查的严谨性,也能降低部分推理错误被忽略的风险。

但形式化证明通过检查,并不意味着随附的自然语言论文一定准确、完整或易于理解。

首先,需要确认计算机检查的命题与论文声称解决的问题完全一致。其次,论文中的前提、定义和结论必须准确对应形式化内容。即使底层证明没有逻辑错误,文字解释仍可能存在跳步、歧义或关键背景缺失等问题。

OpenAI在10月7日公布的修订记录也体现了这一挑战。相关记录显示,一篇代数几何稿件中的符号错误导致关键论证失效,另有两篇依赖该构造的稿件受到影响,三篇稿件因此一并撤回。此外,公司还修改了14篇稿件,涉及修补证明、修正命题和澄清前提等问题。

这些情况说明,大规模生成研究成果之后,质量控制和持续修订同样不可缺少。

对于如何改善发布流程,数学家提出了多种建议,包括区分已经完成形式化验证与尚未完成验证的稿件,补充相关文献引用,按照学术论文的规范重新组织证明,并清楚说明问题背景、结论和适用条件。

AI生成成果的价值,最终仍需要通过严谨核验和同行交流来建立。

AI会取代数学家吗?年轻研究者面临现实焦虑

比起抽象讨论AI能做多少数学题,一些年轻研究者更关心自己的职业前景。

据报道,数学家马特·贝克曾提到,一名自己指导过的博士生向他询问:如果AI能够解决越来越多的数学问题,未来是否还会有足够的空间留给人类数学家?年轻研究者又该通过什么方式证明自己的研究能力?

这种担忧有其现实背景。传统学术评价往往重视论文数量、研究成果和独立解决问题的能力。如果AI能够在较短时间内生成大量看似有研究价值的证明,那么博士生和青年学者选择研究课题、安排长期研究计划,以及展示个人贡献的方式,都可能受到影响。

不过,将数学家的批评简单归结为担心失去工作,并不能解释全部争议。

一些研究者已经在日常工作中使用AI,也认可部分AI数学成果的价值。他们提出的问题更多涉及科研生态:谁来验证这些成果?谁负责解释关键方法?AI生成的研究如何引用已有工作?后续研究的贡献又该如何获得认可?

AI可能改变数学家的工作内容,但不意味着数学研究的所有环节都可以被简单替代。提出值得研究的问题、辨别结果的意义、建立概念联系、解释方法并推动知识传播,仍然是科研过程中需要认真对待的工作。

未来人类数学家的角色或许会发生变化,但这种变化究竟会带来哪些机会与压力,仍取决于技术发展、学术制度以及科研机构如何调整评价标准。

学术评价体系需要适应AI科研时代

当AI开始参与成果生成,传统学术评价方式也需要重新审视。

如果评价体系只关注论文数量和发表速度,就可能进一步强化追求产出的压力,却忽视证明质量、研究方法的可复用性,以及研究者对知识体系的长期贡献。

数学研究者提出,解释和简化证明、复核AI生成结果、梳理已有文献、将新方法推广到其他问题,同样应当成为可以被认可的学术工作。

这些任务不仅能帮助发现错误,也能让复杂的研究成果更容易被其他学者掌握。对于博士生和青年研究者而言,参与成果核验、推动方法传播和开展跨领域合作,也可能成为新的研究机会。

相关讨论还涉及招聘、科研资助和期刊制度。德国慕尼黑大学博士后M. Levent Doğan此前就曾指出,如果学术界真正重视理解与研究质量,就需要将这种理念落实到人才评价、经费分配和论文发表实践中。

与此同时,AI研发机构也需要承担相应责任。大规模发布研究稿件时,除了展示模型能力,还应尽可能提供完整的修订记录、清晰的证明说明、必要的文献引用,以及能够回应同行疑问的沟通渠道。

OpenAI已经公开了相关稿件的GitHub仓库和部分模型推理摘要,并表示将支持研讨会、会议和专项研究。不过,资金如何分配、研究者如何参与,以及后续成果由谁组织和推进,仍需要进一步明确。

从展示模型能力走向推动科学进步

AI在数学领域取得的进展,为科学研究带来了新的可能性。模型可以帮助研究者探索复杂问题、提出候选思路,并借助形式化工具检查部分证明。这些能力如果得到合理运用,有望拓展人类探索数学问题的范围。

但科研并不止于产生答案。只有当结果经得起检查、论证能够被理解、研究者可以继续推进,并且相关贡献得到合理认可时,AI生成的成果才能更充分地融入科学研究。

OpenAI此次发布引发的讨论,实际上提出了一个更广泛的问题:当AI越来越擅长生成研究成果时,科研机构应当如何在技术进步、质量控制与人才培养之间建立新的平衡?

对于数学家来说,真正值得关注的不只是AI能否完成一道难题,而是这些成果能否帮助更多人理解问题、发现方法,并在已有知识的基础上继续前进。

AI科研能力的提升是一项技术进展,而如何让这种进展转化为可持续的科学贡献,则需要研发机构、学术共同体和科研制度共同探索。

更多