8月13日,OpenAI与Cerebras联合发布"Ultrafast Mode":GPT-5.6 Sol推理速度飙到每秒750个token,跑完人类知识终极考试只用了11小时11分,比对手快近7倍。大模型的竞争焦点,正从"谁更聪明"转向"谁更快"。
▲ 图1
事件回顾:一场关于"速度"的联合发布
8月13日,OpenAI与芯片公司Cerebras罕见地同台发布了一个新服务——"Ultrafast Mode"(极速模式)。这不是一个新模型,而是GPT-5.6 Sol的一个新推理服务层级,首批落地在OpenAI API,由Cerebras的晶圆级芯片提供算力。
核心数字很刺眼:每秒750个输出token。作为对比,根据第三方评测机构Artificial Analysis的公开数据,GPT-5.6 Sol在极速模式下比Anthropic的Claude Fable 5快11倍,比Opus 4.8的Fast模式快5倍。OpenAI官方社媒的口径更激进,直接打出了"最高14倍速度"的标语。
更有说服力的是实测。Cerebras把GPT-5.6 Sol极速版拉去跑Humanity's Last Exam(人类最后的考试)——一个包含2500道题、通常只有博士才能答对的超难基准。结果:极速版用11小时11分钟答完全部题目,而Claude Fable 5需要78小时27分钟,也就是连续算3天多。准确率相当,但时间差了近7倍。
另一个基准GDP-Val(衡量高价值知识工作)上,极速版实现了5.6倍的端到端加速,且没有任何质量损失。
值得注意的是,这是OpenAI首次让外部芯片公司的硬件去承载其前沿模型的API推理。过去OpenAI的算力几乎全部来自自家与微软的合作,如今引入Cerebras,既说明顶级模型对推理算力的需求已经大到需要多方供货,也意味着芯片领域的竞争格局正在松动——英伟达不再是唯一的答案。
为什么重要:速度正在成为新的护城河
过去两年,大模型行业的竞争叙事几乎都围绕"智商"展开——参数规模、评测分数、推理能力。但这次发布传递了一个明确信号:当头部模型的智商差距开始收敛,推理速度就变成了新的竞争维度。
原因很朴素:很多真实场景里,"够聪明但太慢"等于"不可用"。法律简报、金融建模、工程报告这些OpenAI点名的高价值任务,客户要的不是模型的极限智商,而是在可控时间内交付可用结果。
更关键的是Agent场景。当AI Agent要处理多步骤任务——查资料、写代码、跑测试、改bug——每一步的延迟都会累加。750token/s意味着Agent的"思考—行动"循环可以快到一个新量级。OpenAI研究员Jeffrey Wang的原话是:"以前我可能要等几分钟才能完成一个任务,现在它在我还没来得及切换注意力之前就完成了。"
对于AI创业者来说,这个信号尤其值得重视。你的产品如果依赖大模型API,模型速度的每一次跃升都会直接改变你的成本结构和用户体验上限。一个过去因为太慢而做不了的功能,可能在速度提升后变得可行;一个过去需要排队等结果的产品,可能因此变成实时交互。
背后的硬核:晶圆级芯片的"反GPU"路线
这次发布真正值得注意的,是Cerebras的底层架构。绝大多数AI芯片(包括英伟达GPU)走的是"小芯片+外部内存"路线,推理大模型时,模型权重要在片上缓存和片外存储之间反复搬运,内存带宽成了瓶颈。
Cerebras走了一条截然相反的路:它把整块晶圆做成一颗芯片,塞进44GB的片上SRAM。权重直接常驻片上,token在晶圆间流水线式地穿过模型各层,几乎消除了数据搬运。这套架构的推理速度能随模型规模平滑扩展,意味着未来更大模型上,速度优势可能进一步拉大。
换句话说,这不是一次简单的"优化",而是一场关于AI算力范式的分叉。对创业者而言,它提醒我们:未来选模型,可能要同时看"智商"和"速度"两个坐标。
▲ 图2
社区反应:高热度与关键疑问
这则消息在Hacker News上迅速登顶,收获259分、96条评论,是当天AI话题中热度最高的一批。从发布内容和行业背景看,两个焦点值得注意:一是"11小时跑完HLE"究竟意味着什么——速度是否真的不损失质量;二是晶圆级芯片能否真正撼动以英伟达GPU为主的算力生态。
需要冷静看待的是,目前Ultrafast Mode仍是"限量预览",只对少数客户开放,容量有限。750token/s能不能稳定供给大规模生产流量、定价如何、是否所有任务都适合极速模式,都还没有公开答案。但方向已经清晰:推理速度,正在从"锦上添花"变成"核心竞争力"。
对AI创业者的影响
- 选型要多一个维度。评估模型不再只看排行榜分数,还要看每秒吞吐和端到端延迟。同样一个Agent,跑在750token/s和跑在慢10倍的模型上,产品体验天差地别。
- 实时场景的窗口打开了。安全应急响应、线上故障根因定位、实时客服、高频交易辅助——这些"秒级响应"决定成败的场景,过去因为推理太慢只能靠人,现在开始具备AI接管的条件。
- 成本账要重算。速度提上去,单位时间能处理的任务量就上去,单任务成本可能反而下降。但极速模式大概率是溢价服务,创业者要算清"速度溢价"是否值得为你的场景买单。
行动建议
- 先观望,再试水。如果你有API额度,等极速模式开放更多容量后,拿一个真实的Agent工作流做A/B测试:标准模式对极速模式,测延迟、测成本、测用户留存,用数据决定是否切换。
- 把"速度"写进你的选型清单。下次评估模型时,除了跑分,加一条:让模型跑一个10步的Agent任务,记录总耗时。这个数字比任何排行榜都更贴近你的真实业务。
- 关注芯片层的分叉。英伟达之外,Cerebras、Groq、AMD都在抢推理速度这条赛道。上游的变化最终会传导到你的API账单和产品体验上,值得持续跟踪。
本文由AI辅助创作,经人工审核编辑发布
更多一人公司案例与工具,微信搜索「AI创业内参」关注我们