593分登顶Hacker News、236条热议——阿里通义千问发布Qwen3.7-Max,直接定位"Agent编程专用模型"。但社区质疑其基准测试只对比旧版模型,性能有待独立验证。
事件回顾
5月20日,阿里通义千问团队发布Qwen3.7-Max,在官方博客中明确标注定位为"The Agent Frontier"(Agent前沿)。这不是一次常规的模型升级——Qwen团队正在打一场双线战争:Qwen3.6-35B-A3B主打本地轻量部署,而Qwen3.7-Max剑指云端Agent编程场景。
消息在Hacker News迅速获得593分、236条评论,成为当日排名第八的热门话题。
关键规格:Qwen3.7-Max对标云端大模型场景,参数规模预计在122B和397B级别,Agent编程能力是核心卖点。社区对开放权重版本尤为期待——如果Qwen3.7-Max像Qwen2.5一样开放权重,将对Meta Llama和Mistral形成直接竞争。
但质疑声同样响亮
HN社区的讨论并非一边倒的赞美。一个核心批评反复出现:Qwen3.7-Max的基准测试报告仍在对比旧版模型(Opus 4.6),而非最新的Sonnet 4.6+或Gemini 3.5 Flash。在AI模型竞争以"周"为单位加速的2026年,这种"挑对手"的做法削弱了可信度。
一位高赞评论一针见血:"如果Qwen真想证明自己是Agent编程的最佳模型,为什么不和Claude Sonnet 4.6+直接对比?"
为什么这对AI创业者重要
1. Agent编程正在独立成为模型赛道
Qwen将"Agent Frontier"作为型号名称,说明Agent专用模型正在从通用大模型中分化出来。这与DeepSeek V4 Pro(LiveCodeBench 96.4%)、Claude Sonnet 4.6+(编程Agent标杆)形成三角竞争格局。创业者选择模型时,不再只看"哪个模型更强",而是"哪个模型在Agent场景下性价比最高"。
2. 境内API渠道的性价比优势
对于有境内部署需求的创业者,Qwen3.7-Max通过阿里云API的价格可能远低于Claude或GPT。但"便宜"的前提是性能达到可比水平——这正是基准争议需要回答的问题。建议创业者拿到API后,用自己的Agent工作流做独立A/B测试,而非依赖官方基准。
3. 开放权重 vs 闭源API的抉择
Qwen3.7-Max如果延续Qwen2.5的开放策略,将对开源生态产生重大影响。一个397B参数的开放权重Agent模型,配合Hermes Agent或OpenClaw的本地部署能力,可能催生一批完全不依赖闭源API的Agent工作流。这对"一人公司"创业者尤为重要——零API成本意味着商业模型可以更早实现盈亏平衡。
行动建议
- 申请Qwen3.7-Max API测试:用自己的Agent工作流做真实场景对比,不要信官方基准
- 关注开放权重发布时间线:如果开源,立刻评估本地部署成本
- 保持模型多样性:Claude Code + DeepSeek V4 Pro + Qwen3.7-Max 三线并行,让Agent框架自动路由到性价比最优的模型
