AI风向

【AI风向】GPT-5级智能+15倍速度:扩散架构LLM来了,自回归时代要终结了?

Celeris-1 用扩散模型替代逐token生成,推理速度达1664 tokens/秒,延迟仅157毫秒——同时保持接近GPT-5的智能水平。这不是优化,是范式的改变。

事件回顾

7月27日,一家名为 Celeris 的 AI 研究实验室结束了隐身模式,发布了其首款大语言模型 Celeris-1。这款模型的特别之处不在于它又刷了什么 benchmark 榜单,而在于它的底层架构——它不是自回归模型

自 GPT 诞生以来,所有主流大语言模型都遵循同一个范式:逐 token 预测下一个词(autoregressive)。这是十年来大模型推理的"唯一正确解"。

Celeris-1 打破了这个范式。它采用扩散架构(diffusion architecture):模型不是依次生成每个 token,而是先给出一个粗糙的完整输出,然后通过多次迭代逐步"精炼"它,最终得到一个高质量回答。

这个改变带来的性能提升是惊人的:

指标Celeris-1GPT-5GPT-5-mini
p50响应延迟157ms~2,700ms~2,400ms
推理吞吐1,664 tokens/s~110 tokens/s~150 tokens/s
智能水平接近GPT-5基准略低

简单说:智能差不多,速度快了15-17倍

Celeris 是谁?

Celeris 的创始团队来头不小:

  • CEO Tom Hamer:前 AWS 工程师,剑桥大学机器学习硕士,曾联合创立 AI 搜索公司 Marqo
  • CTO Jesse Clark:前 Amazon Robotics 机器学习负责人,Stitch Fix 首席 ML 科学家,斯坦福和 UCL 研究背景

两人都是第二次创业——Marqo 是做 AI 搜索的,这意味着他们对"AI 产品落地"有实战经验,不是从象牙塔出来第一次做公司。

投资方包括 Lightspeed Venture PartnersBlackbird VenturesJanuary Capital,都是顶级 VC。具体融资金额未披露,但能同时拿下这三家,说明资本对这个方向非常看好。

为什么扩散架构是大事?

自回归模型的根本问题是串行依赖:第 N 个 token 必须等前 N-1 个 token 都生成完才能开始。这意味着:

  1. 延迟是线性的:长回答 = 长等待。生成1000个 token,最快也要好几秒
  2. GPU 利用率低:每次只计算一个 token,大量并行算力闲置
  3. 实时场景受限:语音助手、实时翻译、游戏 NPC——这些需要亚秒级响应的场景,自回归模型天然吃力

扩散模型的思路完全不同:它并行精炼整个输出。第一批噪声 token 快速生成(毫秒级),然后通过多轮迭代逐步提升质量。这意味着:

  • 短回答几乎瞬时返回(几十毫秒)
  • 长回答不需要线性等待
  • GPU 利用率大幅提升

Celeris 团队把"延迟"定义为基础研究问题而非工程优化问题——这是一个很精准的判断。过去两年行业一直在工程层面优化推理速度(量化、投机解码、KV缓存),但这些都是在自回归框架内"打补丁"。Celeris 直接从架构层面解决问题。

对 AI 创业者意味着什么?

1. Agent 循环加速

当前 AI Agent 的最大瓶颈之一就是推理延迟。一个典型的 Agent 工作流需要多次调用 LLM(理解任务→规划步骤→执行工具→分析结果→调整计划),每次调用都要等2-3秒。如果每次调用降到150毫秒,Agent 的"思考速度"将接近人类,多步推理的体验会有质的飞跃。

2. 实时交互成为可能

语音 AI 助手、实时翻译、游戏 AI、直播互动——这些场景对延迟极其敏感。你不可能跟一个说完话要等3秒才回复的语音助手自然对话。157ms 的延迟意味着"说完就回",体验接近真人。

3. 成本结构重塑

更高吞吐量 = 同等算力下能服务更多请求。对于按 token 计费的 API 服务,这意味着可以大幅降价。Celeris-1 已提供 OpenAI 兼容 API,开发者只需改 base URL 和 key 就能迁移。

4. 竞争格局生变

如果扩散架构被验证可行且可规模化,它将对 OpenAI、Anthropic 等自回归路线的玩家构成架构层面的挑战。Celeris 不是在做"又一个 GPT 竞品",而是在定义"下一个范式"。

对比:自回归 vs 扩散,到底差在哪?

用一句话概括两种范式的本质区别:

  • 自回归:一个画家一笔一笔画,每一笔都看着前面画了什么再决定下一笔。画得精准,但一幅画要画很久。
  • 扩散:先快速铺一个完整草图(可能粗糙),然后一遍遍整体打磨。每轮迭代都让整幅画更精细,而不是只改一笔。

这个类比解释了为什么扩散模型天然更适合"快答"场景。当你只需要一个简短回复时,扩散模型可以在极少的迭代次数内给出可用答案;自回归模型却必须一个 token 一个 token 地走完全程。

更关键的是,扩散架构让推理计算从串行瓶颈变成了并行友好。自回归模型的每一步都依赖于上一步的输出,GPU 的大量计算单元其实是闲置的——你一次只能算一个 token。扩散模型在同一轮迭代里可以同时精炼所有 token,GPU 利用率远高于自回归。

这也是为什么 Celeris 敢说自己的目标是"最大化单位时间内的有用智能产出"——这不是一句口号,是架构决定的。

冷思考:别急着 all-in

当然,扩散 LLM 不是没有挑战:

  • 上下文窗口仅 8,192 tokens:远低于 GPT-5 和 Claude 的 200K+。长文档处理场景暂时覆盖不了
  • 生态尚在早期:只有一家公司、一款模型、一个 API。微调、function calling、多模态等能力待验证
  • benchmark 数据来自 Celeris 自己:第三方独立评测尚未大规模进行
  • "接近 GPT-5"的具体定义:在哪些任务上接近?哪些任务上有差距?需要更多实测数据

行动建议

  1. 立即注册试用:Celeris-1 API 已开放,花 10 分钟把现有项目的一个 API 调用切过去,看看实际效果和延迟
  2. 关注实时场景:如果你的产品涉及语音、实时交互、Agent 多步推理,Celeris-1 可能是一个降维打击级别的方案
  3. 观望但不轻视:扩散 LLM 尚在早期,但架构创新往往比参数堆叠更持久。密切关注 Celeris 后续迭代和竞品跟进

这不是又一个"新模型刷榜"的新闻。这是一次对十年来 AI 推理范式的正面挑战。如果扩散架构这条路走通了,我们回头看 2026 年 7 月,可能会把它标记为"后自回归时代"的起点。


#AI创业 #Celeris #扩散模型 #LLM架构 #推理加速 #一人公司

本文由AI辅助创作,经人工审核编辑发布

更多一人公司案例与工具,微信搜索「AI创业内参」关注我们