OpenAI宣布"解决十大数学难题"之后,菲尔兹奖得主Tim Gowers用一篇长文冷静拆解:LLM真正擅长的是构造反例,而不是人类引以为傲的严格证明。
事件回顾
几天前,OpenAI宣布在数学和理论计算机科学领域解决了十个重大问题,其中包括两个分量极重的成果:首次构造出"non-sofic群"(群论中最重要的未解决问题之一),以及证明了多色Ramsey数(含3的情形)超指数增长。前者被Gowers形容为"群论最重要的开放问题之一",后者是他"本以为此生看不到被解决"的难题。
消息一出,AI圈一片沸腾。但就在热潮之上,菲尔兹奖得主、剑桥大学教授Tim Gowers在个人博客写了一篇冷静的长文,标题直白:《What sort of maths are LLMs good at?》(LLM擅长哪类数学?)。这篇发布于8月12日的文章迅速登上Hacker News热榜,收获242分、137条评论。
Gowers开篇就泼了盆冷水:这些成果"极其令人印象深刻,但LLM仍未在所有数学方面超越人类"。他的理由是——如果LLM真的全面碾压人类,凭借其速度优势,应该早就有"洪水般的结果"涌现。但现实并非如此。于是核心问题浮出水面:LLM到底擅长解决哪类问题?
核心洞察:反例 vs 证明
Gowers的答案直指要害:LLM尤其擅长找"反例"(counterexamples),而不是构造"证明"(proofs)。
他注意到一个显著的规律:LLM解决的最著名问题,几乎全都是靠"反例"而非"证明"完成的。non-sofic群是反例,Ramsey数超指数增长是反例,Jacobian猜想是反例,单位距离猜想也是反例。这与人类数学家的黄金成果——往往是精妙的定理证明——形成了鲜明对比。
但Gowers紧接着提出了一个更深刻的问题:什么叫"找到反例"?这并不像听起来那么简单。他以Vinogradov三素数定理为例:这个定理表面陈述是"每个足够大的正整数都能写成三个素数之和",它的否定形式会变成"存在某个正整数不能被写成三个素数之和"——从形式上看,Vinogradov像是在"找一个反例",但没有人会把这条经典成果称为反例,它显然是定理。
关键在于量词结构。很多深刻的结果在形式化表达时,会交替出现两个、三个甚至更多的量词("对任意……存在……")。Gowers指出,真正决定问题性质的,是"第一个有趣的量词"是什么。LLM擅长处理的,恰恰是那种"搜索空间巨大、但验证一个候选反例很容易"的问题——而这类问题在AI眼里,本质上是高效的搜索与快速校验,而非人类意义上的"证明深度"。
为什么重要
对AI创业者而言,这篇分析的价值远超数学圈。它本质上回答了一个更普适的问题:LLM的能力边界在哪里,以及为什么。
如果Gowers的判断成立——LLM强在"构造+验证"(找到一个反例、跑通一个测试、fuzz出一段崩溃输入),弱在"结构化深度证明"(从公理出发构建严密的逻辑链条)——那么它对AI产品设计有直接的指导意义:
第一,LLM在"验证型任务"上最可靠。代码调试、安全测试、数据清洗、边界情况枚举,这些都是"搜索空间大、但验证成本低"的任务,正是LLM的主场。把这类任务交给AI,出错率最低。
第二,LLM在"深度生成型创新"上仍需人类兜底。数学证明、架构设计、长期战略推演,这些需要"从第一性原理出发构建严密链条"的工作,AI目前还容易在中间环节悄悄出错,且难以自察。
第三,能力边界会快速移动。Gowers特意强调,他是"在OpenAI宣布成果后几天"写下此文,因为他深知这些判断很快会过时。这对创业者的含义是:不要基于今天的边界做长期押注,而要设计"边界敏感"的产品——AI能做的部分逐步放大,人的角色逐步后移。
社区反应
这篇长文在HN上引发了137条评论的激烈讨论,焦点集中在两个层面:一是"反例vs证明"的划分是否成立,有人认为这不过是对"LLM擅长模式匹配"的另一种表述;二是更具争议的——如果LLM能高效地"搜索+验证",那么"证明"这个人类数学家引以为傲的智力活动,是否正在被重新定义。这类讨论本身,恰恰印证了Gowers文章的价值:它逼着人们直面一个事实——我们正在重新理解"智能"在不同任务上的分布。
对AI创业者的影响
-
用"验证型任务优先"的原则设计AI产品。先从AI最可靠的部分切入(检测、校验、枚举、对比),再逐步扩展到生成与决策,而不是一上来就让AI做主推理。
-
建立"人机边界会移动"的架构。把系统设计成可插拔的:同一个任务,今天由人审核、明天由AI+人、后天由AI独立完成。避免把某个能力边界写死在产品里。
-
警惕AI的"隐形中间错误"。Gowers的分析暗示,LLM在长链条推理中容易在中间环节出错且不自知。凡是需要"多步严格推理"的场景,都要设置中间校验点,而不是只看最终输出。
行动建议
- 读一遍Gowers原文,哪怕跳过数学细节,也要理解"反例vs证明""量词结构"这两个概念,它们是理解LLM能力边界的钥匙。
- 审视自己产品的核心任务,把它拆成"验证型"和"生成型"两类,优先把验证型任务交给AI。
- 对多步推理场景,主动加中间校验(让AI自己复述逻辑、交叉验证、分步确认),而不是信任端到端输出。
