首个完全亚二次稀疏注意力架构的大模型亮相,12M token上下文窗口可一次性吞下整个Python 3.13标准库加半年React PR——如果SubQ验证可行,AI Agent的能力上限将被重写。
事件回顾
2026年6月20-21日,一家名为 Subquadratic AI (SubQ) 的公司在Hacker News上引发了多线程热议(84pts + 45pts + 20pts + 19pts)。核心消息是:他们发布了首个完全亚二次稀疏注意力架构(fully sub-quadratic sparse-attention architecture)的大模型,支持12M token上下文窗口。
这是什么概念?
- 当前主流大模型的上下文窗口为128K-200K(GPT-4o、Claude Opus 4)
- Google Gemini 1.5 Pro 支持2M token,但使用的是传统Transformer架构
- SubQ的12M token是其6倍——可以一次性处理整个Python 3.13标准库(约5.1M tokens) 加上六个月的所有React PR(约7.5M tokens) 仍有剩余
更关键的是,SubQ声称在1M token上下文下比FlashAttention-2更快。如果这个声称经得起验证,那将是对Transformer「O(n²)注意力复杂度」这个根本瓶颈的突破。
SubQ目前不公开模型权重,提供两条产品路径:
1. Developer API(全上下文API) — 开发者直接调用12M token的推理能力
2. Coding Agent Layer — 可接入Claude Code、Codex、Cursor等主流Agent工具
当前仅在 waitlist 阶段,需要申请早期访问权限。与LayerLens合作进行第三方评估中。
为什么重要
对于AI创业者来说,SubQ的出现至少意味着三点:
第一,Agent的上下文天花板被打破了。 当前AI Agent工作的最大限制之一就是上下文窗口——Agent只能"记住"最近几万到十几万token的内容。一旦超过这个限制,信息就开始丢失,Agent的行为变得不可预测。12M token意味着Agent可以:一次性理解整个代码库 → 阅读完整的技术文档 → 分析整本教材 → 综合多份行业报告再做决策。一人公司的Agent从"短期记忆助手"升级为"长期战略顾问"。
第二,亚二次注意力可能改变模型竞争格局。 如果SubQ的架构验证有效,"更大的模型=更高的推理成本"这个等式将被打破。Sub-quadratic注意力意味着:模型越大、上下文越长,相对效率优势越明显。开源社区和创业公司可能不再需要追赶Transformer的Scaling Law,而是转向新的架构范式。
第三,Agent工具链的"上下文管理"中间件可能被边缘化。 当前围绕上下文优化有一整套工具链:RAG系统、上下文压缩、分块检索、滑动窗口等。如果模型本身就能处理12M token上下文,这些中间件的价值将受到冲击。但也意味着新的机会——围绕12M上下文设计的Agent工作流、可视化分析工具、长文档协同编辑工具。
我们能学到什么
1. 架构创新的窗口从未关闭。 当所有人都在谈论"Scaling Law见顶"时,SubQ用完全不同的注意力机制打开了新的大门。对于AI创业者来说,这不是"巨头垄断"的信号,反而是"仍有创新空间"的证明。
2. 基础设施层的投资逻辑在变化。 如果亚二次注意力成为主流,推理芯片、推理框架、模型部署方案都会随之重塑。关注Infra层的创业机会:更高效的推理引擎、新的KV缓存策略、长上下文优化的服务架构。
3. 谨慎看待早期技术。 SubQ目前仅有waitlist和自述声明,没有公开权重,也没有第三方评测结果。历史经验告诉我们,从架构突破到产品成熟之间有巨大的鸿沟。跟踪关注LayerLens的评测结果,在第三方验证出来之前保持适度怀疑。
行动建议
- 加入SubQ waitlist — 尽早获得API访问权限,亲身体验12M token上下文的实际能力
- 关注LayerLens评测 — 这是当前最可信的第三方验证来源,结果出来后第一时间评估
- 重新思考Agent架构 — 如果你的Agent工作流严重依赖RAG或上下文分块,考虑12M上下文窗口下如何简化架构
- 跟踪开源社区反应 — SubQ不开源,但社区可能会复现或批评其架构,保持信息敏感
