Celeris-1 用扩散模型替代逐token生成,推理速度达1664 tokens/秒,延迟仅157毫秒——同时保持接近GPT-5的智能水平。这不是优化,是范式的改变。
事件回顾
7月27日,一家名为 Celeris 的 AI 研究实验室结束了隐身模式,发布了其首款大语言模型 Celeris-1。这款模型的特别之处不在于它又刷了什么 benchmark 榜单,而在于它的底层架构——它不是自回归模型。
自 GPT 诞生以来,所有主流大语言模型都遵循同一个范式:逐 token 预测下一个词(autoregressive)。这是十年来大模型推理的"唯一正确解"。
Celeris-1 打破了这个范式。它采用扩散架构(diffusion architecture):模型不是依次生成每个 token,而是先给出一个粗糙的完整输出,然后通过多次迭代逐步"精炼"它,最终得到一个高质量回答。
这个改变带来的性能提升是惊人的:
| 指标 | Celeris-1 | GPT-5 | GPT-5-mini |
|---|---|---|---|
| p50响应延迟 | 157ms | ~2,700ms | ~2,400ms |
| 推理吞吐 | 1,664 tokens/s | ~110 tokens/s | ~150 tokens/s |
| 智能水平 | 接近GPT-5 | 基准 | 略低 |
简单说:智能差不多,速度快了15-17倍。
Celeris 是谁?
Celeris 的创始团队来头不小:
- CEO Tom Hamer:前 AWS 工程师,剑桥大学机器学习硕士,曾联合创立 AI 搜索公司 Marqo
- CTO Jesse Clark:前 Amazon Robotics 机器学习负责人,Stitch Fix 首席 ML 科学家,斯坦福和 UCL 研究背景
两人都是第二次创业——Marqo 是做 AI 搜索的,这意味着他们对"AI 产品落地"有实战经验,不是从象牙塔出来第一次做公司。
投资方包括 Lightspeed Venture Partners、Blackbird Ventures 和 January Capital,都是顶级 VC。具体融资金额未披露,但能同时拿下这三家,说明资本对这个方向非常看好。
为什么扩散架构是大事?
自回归模型的根本问题是串行依赖:第 N 个 token 必须等前 N-1 个 token 都生成完才能开始。这意味着:
- 延迟是线性的:长回答 = 长等待。生成1000个 token,最快也要好几秒
- GPU 利用率低:每次只计算一个 token,大量并行算力闲置
- 实时场景受限:语音助手、实时翻译、游戏 NPC——这些需要亚秒级响应的场景,自回归模型天然吃力
扩散模型的思路完全不同:它并行精炼整个输出。第一批噪声 token 快速生成(毫秒级),然后通过多轮迭代逐步提升质量。这意味着:
- 短回答几乎瞬时返回(几十毫秒)
- 长回答不需要线性等待
- GPU 利用率大幅提升
Celeris 团队把"延迟"定义为基础研究问题而非工程优化问题——这是一个很精准的判断。过去两年行业一直在工程层面优化推理速度(量化、投机解码、KV缓存),但这些都是在自回归框架内"打补丁"。Celeris 直接从架构层面解决问题。
对 AI 创业者意味着什么?
1. Agent 循环加速
当前 AI Agent 的最大瓶颈之一就是推理延迟。一个典型的 Agent 工作流需要多次调用 LLM(理解任务→规划步骤→执行工具→分析结果→调整计划),每次调用都要等2-3秒。如果每次调用降到150毫秒,Agent 的"思考速度"将接近人类,多步推理的体验会有质的飞跃。
2. 实时交互成为可能
语音 AI 助手、实时翻译、游戏 AI、直播互动——这些场景对延迟极其敏感。你不可能跟一个说完话要等3秒才回复的语音助手自然对话。157ms 的延迟意味着"说完就回",体验接近真人。
3. 成本结构重塑
更高吞吐量 = 同等算力下能服务更多请求。对于按 token 计费的 API 服务,这意味着可以大幅降价。Celeris-1 已提供 OpenAI 兼容 API,开发者只需改 base URL 和 key 就能迁移。
4. 竞争格局生变
如果扩散架构被验证可行且可规模化,它将对 OpenAI、Anthropic 等自回归路线的玩家构成架构层面的挑战。Celeris 不是在做"又一个 GPT 竞品",而是在定义"下一个范式"。
对比:自回归 vs 扩散,到底差在哪?
用一句话概括两种范式的本质区别:
- 自回归:一个画家一笔一笔画,每一笔都看着前面画了什么再决定下一笔。画得精准,但一幅画要画很久。
- 扩散:先快速铺一个完整草图(可能粗糙),然后一遍遍整体打磨。每轮迭代都让整幅画更精细,而不是只改一笔。
这个类比解释了为什么扩散模型天然更适合"快答"场景。当你只需要一个简短回复时,扩散模型可以在极少的迭代次数内给出可用答案;自回归模型却必须一个 token 一个 token 地走完全程。
更关键的是,扩散架构让推理计算从串行瓶颈变成了并行友好。自回归模型的每一步都依赖于上一步的输出,GPU 的大量计算单元其实是闲置的——你一次只能算一个 token。扩散模型在同一轮迭代里可以同时精炼所有 token,GPU 利用率远高于自回归。
这也是为什么 Celeris 敢说自己的目标是"最大化单位时间内的有用智能产出"——这不是一句口号,是架构决定的。
冷思考:别急着 all-in
当然,扩散 LLM 不是没有挑战:
- 上下文窗口仅 8,192 tokens:远低于 GPT-5 和 Claude 的 200K+。长文档处理场景暂时覆盖不了
- 生态尚在早期:只有一家公司、一款模型、一个 API。微调、function calling、多模态等能力待验证
- benchmark 数据来自 Celeris 自己:第三方独立评测尚未大规模进行
- "接近 GPT-5"的具体定义:在哪些任务上接近?哪些任务上有差距?需要更多实测数据
行动建议
- 立即注册试用:Celeris-1 API 已开放,花 10 分钟把现有项目的一个 API 调用切过去,看看实际效果和延迟
- 关注实时场景:如果你的产品涉及语音、实时交互、Agent 多步推理,Celeris-1 可能是一个降维打击级别的方案
- 观望但不轻视:扩散 LLM 尚在早期,但架构创新往往比参数堆叠更持久。密切关注 Celeris 后续迭代和竞品跟进
这不是又一个"新模型刷榜"的新闻。这是一次对十年来 AI 推理范式的正面挑战。如果扩散架构这条路走通了,我们回头看 2026 年 7 月,可能会把它标记为"后自回归时代"的起点。
#AI创业 #Celeris #扩散模型 #LLM架构 #推理加速 #一人公司
本文由AI辅助创作,经人工审核编辑发布
更多一人公司案例与工具,微信搜索「AI创业内参」关注我们


