- +1
解6道世界未解数学难题+撰写6篇顶刊论文,Google:数学领域AI已具备科研能力!
AI在数学科研领域又迎来了新突破。
今年初,Google旗下 DeepMind发布了6篇数学相关的研究论文,其中1篇完全由AI独立编写,另外5篇是以AI为主导完成。
同时,他们基于推理模式Gemini Deep Think打造的Aletheia数学研究智能体在FirstProof挑战赛中解出了6道世界级未解数学难题,在SOTA基准上创下91.9%的历史新高。
这一操作说明AI已经不是只会刷奥数题的工具了,它已经开始像数学家一样,做原创性的科研工作了。
一、这次的突破和之前的AI解题有啥不一样?
AI解题其实很多人都了解,之前甚至还拿过IMO金牌,但这次的突破跟之前差别很大,之前的AI是只会做题,而现在的Aletheia是一名研究者。
就像咱们应付考试刷题一样,之前AI做数学题本质上也是题海战术,在题库里刷题找规律,但提不出来新的解题方法,更解决不了还没人能解开过的难题。
Aletheia可以像数学家一样自主发现问题、推导证明、撰写规范的学术论文。
解开的题目不是已有标准答案的已知题目,而是未公开、没标准答案的难题。
包括FirstProof挑战赛里的题目,FirstProof挑战赛是由哈佛、斯坦福等名校的知名数学家出题,共提供10道题,全是数学界公认的难题
在这儿之前没有任何AI能解决,Aletheia解出了6道,其中5道获得专家全票通过。
二、6篇论文,到底解决了什么问题?
6篇论文覆盖代数、拓扑、组合数学等多个核心分支,重点讲解两个最有代表性的论文
第一篇论文名为《Eigenweights for arithmetic Hirzebruch Proportionality》,也是这几篇中最受受重视的一篇,完全由AI撰写。
该篇论文属于算术几何领域,AI自主计算出了该领域中特征权重的结构常数,解决了困扰该领域多年的一个难题。
整篇论文完全没有人工干预,从选题、推导到撰写,全是Aletheia独立完成,3位匿名数学家评审后一致认为,论文逻辑严谨、方法新颖,达到了顶级期刊的发表水平。
第二篇,是聚焦FirstProof 挑战赛成果的论文,也是6篇中最有突破性的一篇。论文详细记录了 Aletheia 在 FirstProof 挑战赛中的完整表现,且明确标注了Aletheia 全程零人工干预,自主解出了10道题中的6道,其中难度最高的第7题本是公开未解决的问题。
直到挑战赛官方发布标准答案时才由人类团队首次证明,而且Aletheia也独立给出了完全正确的证明过程,这个成果也得到了该领域专家的确认。
三、技术层面来看,AI是如何实现的?
首先是Gemini 3 Deep Think的慢思考能力。
普通大模型思考问题,就像人类的快速联想,容易出错、逻辑链短。Deep Think的思考模式更像人类的深度推理,能进行20-50步的长程推理,还能回退、分叉、验证,就像我们做数学题时,会一步步推导,错了就回头重新来,而不是凭感觉猜答案。
第二个是Aletheia的生成-验证-修正闭环。
分三步进行核心工作,第一步是生成解题思路和证明过程,第二步是检查逻辑漏洞、验证对错,第三步是修正错误、优化思路。而且,它还会主动承认自己解不出来的问题,避免无意义的浪费,这也是之前的AI做不到的。
第三个是工具集成和成本控制。
Aletheia深度集成了Google搜索和网页浏览功能,能精准检索文献,避免引用不存在的论文,同时,DeepMind实现了成本的大幅下降,单次复杂数学推理的成本从2025年的2000-3000美元,降到了13.62美元,这也是它能大规模应用于科研的关键。
四、关键数据
在基准测试表现方面,Aletheia在IMO-ProofBench(奥数级证明题)上准确率达到91.9%,刷新历史纪录
之前的SOTA成绩是78.3%;在DeepMath(博士级数学题)上准确率76.5%,远超之前的58.2%;
在成本方面,单任务推理成本13.62美元,比OpenAI等同类模型降低280-420倍;
同时,与人类数学家的协作效率方面,是单独人类的7.3倍,是单独AI的1.8倍;
部分图集






创作:Omni实验室
哇,你竟然看到了最后,如果文章对您有帮助,欢迎点赞哦~
本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。





- 报料热线: 021-962866
- 报料邮箱: news@thepaper.cn
互联网新闻信息服务许可证:31120170006
增值电信业务经营许可证:沪B2-2017116
© 2014-2026 上海东方报业有限公司




