"这不是AI能不能做数学的问题——这是人类数学家还有没有存在价值的问题。" HN评论区一位数学家写道。OpenAI用不到2000美元的token成本,解出了10个困扰数学界数十年甚至半个世纪的难题。
发生了什么
8月1日,OpenAI发布了一篇题为《Ten advances in mathematics and theoretical computer science》的博文,宣布其最新模型成功攻克了10个重大数学和理论计算机科学难题。
这10个突破包括:
- 非索菲克群的显式构造(non-sofic groups)——某位PhD导师追了25年的问题,曾被认为可能是菲尔兹奖级别的成果
- 埃尔德什单位距离猜想(Erdős unit-distance conjecture)
- 多个长期悬而未决的埃尔德什问题和OEIS猜想
所有证明都经过了 Lean(形式化证明助手)的形式化验证。OpenAI声称,生成这10个突破的token总成本不到2000美元。
更扎心的是,OpenAI明确表示:"声称AI生成的证明是人类作者,会歪曲系统的贡献和真实人类智力劳动的本质。"
翻译:这证明是AI做的,我们不抢功。
HN上293 points、192条评论,但这个数字远不能反映真实热度——据多位用户指出,这篇帖子被大量flag压制了排名,否则本应排在榜首。
为什么这件事极其重要
1. 成本低到恐怖
$2000是什么概念?一个美国数学PhD学生一个月的奖学金都不止这个数。而AI只用了这个成本,完成了可能需要顶尖数学家团队数年甚至数十年才能攻克的难题。
一位HN用户做了一个残忍的对比:如果你给10-20个数学家一年时间和100万美元预算,能产出同样的成果吗?答案是几乎不可能。
当然,$2000这个数字有很多争议。有人指出这只是最终成功的那一次运行的token成本,不包括无数失败尝试、不包括prompt工程师的工资、不包括训练模型的前期投入。OpenAI的营销话术需要打折听,但即便如此——即使真实成本是$2000的10倍、100倍,仍然远远低于传统数学研究的成本。
2. "只是工具"的讨论彻底崩塌
评论区展开了一场关于"AI到底是工具还是作者"的激烈辩论。
有人说:"AI就是工具,就像3D打印机。功劳属于按下打印键的人。"
有人反驳:"如果你用计算器算出56789×23456,你会说是计算器算的,还是你算的?"
更有意思的是,OpenAI公布了prompt原文——prompt确实不长,但包含了大量专业数学领域的引导。一位评论者说:"一个稍微聪明点的高中生就能写出这些prompt。显然,做重活的是LLM,不是写prompt的人。"
3. 数学会不会步国际象棋的后尘?
这是评论区出现最多次的类比,也是最被激烈反驳的类比。
反方认为:国际象棋是观赏性运动,数学家是靠解题吃饭的。两者的经济逻辑完全不同。AI解决数学问题,直接威胁的是数学家的职业价值。
正方认为:就像国际象棋选手仍然在比赛、在教学中找到价值一样,数学家的角色会从"解题者"变成"问题发现者"和"结果解释者"。
一个犀利的评论:"过去的职业成就定义正在被摧毁。比尔·盖茨大学时写的数学论文——那种东西已经一去不复返了。那些曾经定义职业生涯的成就,现在和AI产出无法区分,而且越来越和计算资源绑定而非个人才华。"
对AI创业者的启示
启示1:研究能力是下一个AI军备竞赛的战场
OpenAI和Anthropic(之前的SWE-bench)都在用"AI攻克学术难题"来展示模型能力。这不仅仅是PR——这是在告诉世界:我们的模型不仅是聊天机器人,是真正能做研究的智能体。
对创业者来说,这意味着:如果你做的AI产品能在某个垂直领域(法律、医学、金融分析)展现出"研究级"的能力,你就有了不可替代的竞争壁垒。
启示2:形式化验证(Lean/Coq)正在成为AI证明的标配
OpenAI把所有证明都用Lean形式化验证了。这解决了AI生成内容最被诟病的问题——不可信。未来任何一个声称"AI解决了X问题"的产品,如果不能提供形式化验证,都不值得认真对待。
启示3:Prompt工程仍然极其重要
公布出来的prompt包含了大量领域专业知识引导。这说明即使在GPT-5级别,"好的prompt"和"随便问"之间的差距仍然是天壤之别。Prompt工程师不必担心失业——至少短期内。
启示4:心理冲击大于技术冲击
最有意思的是评论区一位用户的观察:"奇怪的是,最引人注目的不是AI解决了10个数学问题,而是这篇帖子居然没排在HN榜首。"
我们正在经历"AI疲劳"——人们已经不再对AI的惊人能力感到惊讶。这对AI创业者既是好消息(市场接受度提高)也是坏消息(用户阈值越来越高,要做出让人wow的产品越来越难)。
实操建议
-
关注Lean/Coq生态:如果你在做AI+垂直领域的产品(法律合同审核、医疗诊断辅助),形式化验证可能是你的差异化武器
-
重新思考"研究能力"的定位:你的AI产品能不能做research?能不能生成可验证的结论?这正在成为区分"玩具"和"工具"的分水岭
-
不要买OpenAI的营销账:$2000是精心包装的数字。真实做研究级AI应用,成本远高于此。但趋势是对的——成本在快速下降
-
为"AI疲劳"设计产品:用户阈值越来越高,简单的"AI生成"已经不够了。关注可验证性、透明度和人机协作体验
AI创业 #OpenAI #数学 #AI研究 #Lean证明 #一人公司
数据来源:OpenAI官方博文、Hacker News讨论(293 points, 192 comments)、开源社区验证
撰写时间:2026-08-02
