AI风向

【AI风向】GPT-5.6 Sol攻克30年数学难题:2.5小时证明,Lean验证通过,专业提示工程时代到来

UC Berkeley教授用GPT-5.6 Sol + 10页专业提示词,2.5小时攻克凸优化领域30年未解问题,并用Lean形式化验证证明正确——这是继CDC猜想后GPT-5.6的又一数学里程碑。

事件回顾

7月18日,UC Berkeley IEOR教学教授Phillip Kerger在Medium发表文章,详细记录了他使用OpenAI GPT-5.6 Sol模型,在单次2.5小时会话中攻克了一个自1996年以来无人能解的凸优化理论难题

问题本身是凸优化领域的"Oracle复杂度下限"问题:对于一个d维凸函数的最小化问题,如果算法只能通过函数值评估来获取信息(不能使用梯度),最少需要多少次评估才能保证找到最优解?Protasov在1996年给出了一个需要约d²次评估的算法(上界),但30年来最佳下界只有约d——这个d到d²的差距一直无人能填补。

Kerger教授在过去一年间反复尝试用GPT-5.4和5.5攻克此问题均告失败。今年ICCOPT会议上,甚至有同行直言"我们完全不知道如何解决"。但在GPT-5.6 Sol发布后,他用一份10页的专业数学提示词(设计思路与OpenAI此前在循环双覆盖猜想证明中的提示词类似),一次提交,2.5小时后Sol 5.6直接输出了完整证明。

更关键的是:Kerger教授没有止步于"看起来合理",他将证明用Lean(形式化证明验证语言)完整验证并全部通过。论文、Lean验证代码、完整的10页提示词以及初始对话记录均已开源在GitHub上。

三个突破性信号

信号一:从"能写代码"到"能做数学证明"的能力跃迁

GPT-5.6能攻克专业数学开放问题,意味着AI的能力边界已经超越了编程、分析等"应用层"任务,进入了人类智力活动的最高殿堂——数学研究。这对AI创业者的叙事意义巨大:融资PPT里写"AI能解决数学难题"比"AI能写代码"更有冲击力。

信号二:10页提示词——专业提示工程将成为核心竞争力

Kerger教授的文章中最值得关注的一句话是:"现在我好奇的是——还有多少研究者手头的问题,其实只差一个合适的提示词?"这10页提示词不是简单的"写代码",而是高层次数学背景和研究方向的引导。提示工程正在从"写句子"进化成"写研究论文"。这对创业者意味着:面向垂直科研领域的高阶提示工程服务/模板,将成为可定价的高价值知识产品。

信号三:Lean验证——AI研究的"安全带"成为新基建

Kerger教授特别强调:"AI模型非常擅长制造看起来合理的论证……我们正在进入一个时代,Lean形式化验证变得无比重要。"通过Lean验证,证明从"看起来对"变成了"计算上保证对"。这揭示了一个创业机会:AI输出的验证/审计服务,尤其是面向数学、金融、法律等对准确性有刚性需求的行业。

我们能学到什么

1. 模型能力×提示质量才是真正的乘数

GPT-5.6不是第一个尝试解决该问题的模型(作者试过5.4和5.5均失败),但Sol版本的推理能力+10页专业提示=成功。对AI创业者来说,这验证了一个关键公式:业务价值 = 最新模型能力 × 垂直领域提示工程深度

2. "验证层"是AI商业化的关键拼图

从OpenAI的CDC证明到这次的凸优化突破,Lean验证都在最终环节扮演了"可信度背书"的角色。在AI输出日趋"看起来合理"的今天,提供独立验证服务的产品/平台是明确的蓝海方向。

3. 专业提示工程模板——被低估的知识产品

一份经过实战验证的10页数学提示词(含完整对话记录)开源在GitHub上。这暗示了一个可能性:面向科研人员、工程师、分析师的专业提示工程模板库,可以作为付费知识产品($99-999/套)。与通用的"GPT使用技巧"不同,这是有真实学术论文背书的可验证产品。

行动建议

  1. 关注你的行业是否"一个提示词距离解":像Kerger教授那样思考——你所在的领域有哪些悬而未决的问题?GPT-5.6 Sol是否已经足够强大到加速解决?
  2. 建立"验证层"意识:无论是代码审计、数据验证还是输出质量检查,在AI输出越来越"丝滑"的时代,"可信度"本身就是一种稀缺价值。
  3. 尝试构建专业提示工程模板:结合你的垂直领域知识,做一套经过验证的高阶提示词模板,这将是从"用AI"到"卖AI能力"的关键一步。

AI创业 #GPT56 #LLM #数学证明 #提示工程 #Lean #凸优化 #一人公司