AI如何终结数学英雄时代?从天才个人到世界脑协作
数学圈一直有一种让人着迷的叙事某个天才坐在书桌前凭厚厚一叠手稿和几次灵光一现就改写了整个学科。高斯、欧拉、伽罗瓦、拉马努金再到后来的怀尔斯都在为“数学英雄时代”贡献注脚。而这个时代正在被 AI 打断。标题那句话翻译过来是从个体天才到世界脑AI 如何终结数学的英雄时代。我先给出结论——它确实正在终结但终结的不是“个人贡献”而是“一个人只靠私人推导扛下完整验证”的模式。这个转变不是抽象概念也不是某一篇论文或某一个模型带来的短期热度。它会影响数学研究者每天怎么查文献、怎么验证证明、怎么和同事协作也会影响一个学生该重点训练什么能力。下面按理解、落地、边界、建议的顺序拆开讲。1. 数学的“英雄时代”到底是一种什么结构1.1 英雄叙事的三根支柱先定义清楚。这里说的“英雄时代”不是指古代某段历史时期而是一种科研生产模式。它有三个明显特征。第一洞察的个人化。核心突破被理解成一个人的灵光一现高斯突然想通二次互反律怎么证伽罗瓦在决斗前夜留下群论思想。叙事强调的是“那个瞬间只属于那个人”。第二证明的私人化。在很长一段时间里一个证明是否成立主要依赖作者本人的推导审读以及之后少数几位评审专家确认。哪怕是二十世纪也经常出现“作者认为证完了”几年之后才被发现漏洞的情况。第三认可的英雄化。菲尔兹奖、阿贝尔奖、终身教职、首创优先权全部围绕个人署名展开。谁先完成谁获得光环。这套模式在过去几百年确实有效。它激励过很多年轻人也说明数学有一部分确实高度依赖个人认知。但它的代价同样明显验证周期长、可复现性差、知识传承依赖师徒口耳相传、跨领域协作成本极高。1.2 个体天才模式在今天的三个真实瓶颈第一个瓶颈是文献总量。一个普通方向的核心论文已经多到一个人读不完更别说跨几个子领域。同一个概念在不同体系里有不同叫法只靠脑内检索越来越不现实。第二个瓶颈是证明复杂度。经典证明的“最长链条”一直在增长。到今天很多高水平结果的中间步骤已经不是靠纸笔能逐一检查的。人审一份几百页的手稿效率和可靠性都不够。第三个瓶颈是错误率。近几年经常出现一种现象预印本挂出去读者花很长时间才发现某个关键步骤不成立。这不是研究者不努力而是“一个人靠直觉走完所有步骤”的模式到极限了。所以我的判断很直接AI 不是来抢数学家饭碗而是来补一个已经包不住火的漏洞。目前最缺的是验证和检索不是洞察。1.3 为什么“英雄”这个词会制造误判把数学史写成天才列传会让人误以为数学进步全靠超凡头脑。但实际操作中绝大多数突破是慢慢磨出来的先有错误尝试再有粗糙证明别人补上细节最后看起来才像“一个人的杰作”。AI 进来之后这种“事后英雄化”会越来越明显。如果证明过程变成人机协作共同推进首创权和作者身份都会模糊。一个证明最终成立可能依赖几个数学家、两三个 AI 工具、一个形式化验证框架再加一个公开问题库。这时再问“谁是英雄”本身还是在用旧模型提问。2. AI 进入数学后变化先从工作流开始2.1 从一个人死磕到人机闭环我不太喜欢用“AI 带来革命”这种大词。更准确的说法是数学研究的日常工作流正在被重新拆分。一个典型的研究流程大致可以分成八段提出问题搜索已有结果和类似方法产生猜想构造例子或反例展开证明检查证明的每一步把结果写成可发表形式让同行验证。没有 AI 时这八步几乎全靠一个人或一个小团队。现在每一段都可以有工具介入大模型做文献总结和类比迁移符号计算软件做例子检验证明助理把关键步骤形式化反例搜索工具检验猜测是否成立。我一般会先问自己一个问题哪个环节最消耗时间哪个环节最容易出错就先把那个环节交给工具。不是为了用 AI 而用是为了把时间重新放到自己真正擅长的事情上。2.2 机器实际能做的四件事归拢下来AI 在数学里能扎实做四件事而不是“会解题”。第一搜索。海量文献、定理库、公式库、既有证明模块人类很难记住所有已知结果大模型和结构化数据库可以。第二验证。形式化证明系统能检查每一步推理是否符合逻辑规则。关键点不在“AI 有没有数学直觉”而在“推理链能不能被机器机械地确认”。第三补全。给定一个不完整的证明框架AI 可以尝试补出中间步骤或者指出缺了哪个条件。它更像一个熟悉文献的助手而不是替你拍板的人。第四联想。把 A 领域的方法迁移到 B 领域的问题上。大模型擅长这种“看起来不太靠谱但偶尔非常有效”的跨域类比。我见过不少人把这几件事混成一件“直接告诉我答案”的需求。这个预期很危险。工具能做的四件事没有一件能替代“证明是否成立”的最终判断。2.3 一个更接近“世界脑”的协作模型“世界脑”听起来很玄但把它工程化就很好理解将来一个数学研究的最小单位不再是一个人或者一个小团队而是人、大模型、证明助理、语义检索系统、共享问题库共同组成的网络。分工可以这么画人类负责提出问题和定义目标大模型负责把模糊想法变成可尝试方向生成例子符号计算和数值实验负责低成本证伪证明助理负责把关键命题形式化成机器可验证形式社区和自动审查工具负责扩散和纠错。如果这个模型成立个人的“天才”依然有意义但意义变了。意义不在“一个人扛下整个证明”而在“一个人能把正确的问题放进协作网络并且判断网络给出的答案是否可信”。这也解释了为什么现在很多方向都把数学能力当成一个核心指标来测。表面是在测“AI 会不会做题”实际上是在测“机器能不能进入数学的协作网络承担其中一部分推理任务”。竞赛题有标准答案真实数学没有所以后者比前者有价值得多。3. 用 AI 做数学研究具体怎么落地3.1 第一类用法把大模型当“可对话的文献助手”没有 AI 之前遇到陌生问题要先翻综述再找原始论文再自己推导一遍。有大模型后我会先把问题用结构化方式写清楚让它给出一份“可能相关方向的列表”。举一个实际提示词模板不是唯一标准答案我在研究定义在 n 维球面上的某个最优化问题目标函数是……约束是……已知结论是……。我怀疑某个正则性条件可能不必要。请先给出这个猜测可能成立的三个理由再给出它可能失败的三个反例方向最后列出文献里有没有类似已知结果。这里有三个经验。第一问题描述越结构化回答越可用。不要写“帮我看看这个问题怎么解”要把输入、约束、已知结论、怀疑方向都写出来。第二让 AI 同时给“支持”和“反对”两个方向。否则它容易顺着你的原话输出“你说得对”。我会明确要求它列出失败条件和反例方向。第三对输出做二次检索。AI 给出的论文标题、作者、公式有可能是编造的。正式写作里引用任何 AI 提供的文献都必须回到数据库确认。3.2 第二类用法用证明助理把推理变成可审计的工程如果要处理的是关键推论而不是探索性想法我建议尽早接触证明助理。简单解释证明助理不是“帮你自动证明”而是“让你把证明写进一台机器能检查的格式”。类似写代码时编译器检查语法和类型只不过检查对象从程序变成了推理链。常见选择有 Lean、Coq、Isabelle 这一系学术界已经相当成熟。用它们做形式化验证有一个直接好处机器只认规则不认权威。你说某个步骤“显然成立”机器会追问展开成哪些步骤用哪条定理条件满足了吗不要一开始就想把整个证明都形式化那是一个大工程。更稳妥的做法是挑证明里最薄弱、最容易被评审质疑的三个步骤先把它们严格检查一遍。局部形式化的性价比很高。举个例子一个长证明里经常出现“经过简单计算可得”这种跳步。它在读者眼里可能没问题但也许恰好就是漏洞所在。把这类跳步丢给证明助理它要么能构造出完整推导要么直接告诉你缺了条件。这两种结果都比一句“没问题”有价值。注意证明助理有学习曲线。第一次上手可能会花几天适应它的写法这不代表工具不好用只说明你还没习惯把“理解一个命题”翻译成“机器可检查的构造”。3.3 第三类用法用反例搜索和数值实验做早期证伪数学研究里有大量时间其实花在验证“我猜的这个结果到底对不对”。AI 不一定要直接给你严格证明但可以帮你非常快地找到反例或者让反例很难存在。具体操作是把要验证的命题转成可计算的例子生成器。用随机点、边界点、极端参数、手算小例子跑一遍。如果反例出现你省下的是几个月。我一般先跑一组“极端情况”变量取 0、取无穷大、取退化情形、取对称情形、取近似边界。很多看起来漂亮的命题在这组测试里会碎掉。这一步用代码跑不借助大模型也可以。大模型的价值在于它能生成补充测试用例和直觉提示帮你发现没考虑到的那类退化情形。反例搜索找到的问题是有效产出不是失败。它证明了这条路线不通省下的时间非常宝贵。真正的失败是明明能快速检验却把直觉当成结论。3.4 一个推荐的验证链路把上面几类用法串起来我推荐下面这条链路适合从零开始尝试 AI 辅助研究的个人或小团队。人类用自然语言写出问题背景、已知条件和想要的结论类型。大模型给出三到五个可能方向并列出每个方向成立的理由和失败风险。用符号计算或数值实验对候选方向做低成本例子测试。对表现最好的方向人类尝试写出证明框架。把证明中的关键步骤交给证明助理检查。人工复核从第一性原理出发重新理解每一步为什么成立。这套链路看起来慢实际很快。因为它优先证伪再深挖而不是先花半年写证明再发现反例。4. 为什么说“英雄”没有消失只是换了位置4.1 AI 时代最稀缺的能力变成了提问如果机器擅长搜索、验证、补全和联想那剩下的核心能力是什么是提出一个值得解决的问题。“值得解决”包含几个维度这个问题是否清晰是否在现有方法射程之内解决了它会不会打开一串新问题能否被其他人快速识别重要性AI 会给你建议但最终判断还是人的责任。因为数学的价值判断不是纯形式化的它涉及对领域未来发展的理解。机器没有这个义务也不该背这个责任。4.2 个人仍然可以做出关键突破但不是孤立完成“英雄”不会消失消失的是“孤立英雄”。个人仍然可以提出关键想法但这个想法必须进入世界脑的协作循环才能真正变成定理。这一点和软件工程很像。一个人能写出一个关键算法但再让他负责整个系统的测试、部署、维护和扩展既不现实也不必要。数学正在经历同样的工程化过程。所以我对年轻研究者的建议是不要害怕依赖工具但依赖工具的同时要保持对“为什么这么写、这个证明为什么成立”的完整理解。工具可以帮你完成草稿不能帮你形成你对这个定理本身的判断。4.3 世界脑不是去个人化而是把创造和验证分开很多人担心世界脑来了是不是以后数学不需要个人思考了我的理解正好相反。世界脑是把创造和验证剥离开。创造仍然依赖个人验证则不断机械化。过去一个人要同时是创造者和验证者验证环节严重依赖个人注意力容易被忽略。现在验证可以外包给机器和社区创造者才有精力做更困难的事。换句简单的话以前的数学英雄是“一个人扛下所有步骤”以后的数学英雄是“能在协作网络中快速找到自己的不可替代位置并且推动整个网络产出可信结果”。5. 这些坑必须提前认清5.1 AI 的数学错误可能比人类的错误更难发现大模型的数学输出偶尔非常流畅但会一本正经地给出错误推导。更麻烦的是它用自信的措辞掩盖错误细节人类审稿人看到长篇推导容易产生“写这么细应该没问题”的心态。这是最危险的。可靠对策只有一个关键结论必须经过可执行的形式化验证或者至少经过多轮独立检查。任何“直觉上对”都只能作为启发不能作为最终结论。5.2 “看起来合理”不等于“被证明”这里要区分两种输出。一种是探索性输出“这个方向可能有戏初期实验很漂亮。”另一种是结论性输出“这个定理成立证明如下。”AI 很擅长把第一种包装成第二种。使用的时候我建议在提示词里明确要求它区分这两者在自己的笔记里也分开记录探索笔记和正式证明绝不能放在同一个信任级别里。5.3 不要用 AI 生成的内容冒充自己的原创贡献AI 辅助写作和 AI 生成结果在学术规范里是两回事。把 AI 的证明草稿、文献总结、思路联想直接当作自己的原创成果既不符合研究伦理也容易在后续被揭露。更合理的做法是在方法、致谢、附录说明里明确写哪些步骤用了哪些工具哪些部分是人工完成。研究社区越来越看重透明性。这一点我觉得比任何具体技术都重要。5.4 工具边界大模型、证明助理、符号计算各干各的不建议把大模型当万能数学工具。数学工作流里至少有三类工具各有边界用表列一下工具类型典型代表最适合的工作不适合的工作大语言模型各类通用 AI 助手文献联想、思路生成、反例猜想、跨域类比提供可依赖的严格证明最终版本证明助理Lean、Coq、Isabelle形式化验证、推理链检查、库化管理自动提出所有原创构想符号计算与数值计算各类数学计算软件大规模计算、代数化简、数值实验处理无法形式化的开放问题它们不是替代关系而是流水线关系。先用大模型做方向探索用符号计算做例子验证