AI风向

【🔥重磅】Qwen3.8-Max发布:2.4万亿参数、开源、自主编程10天不宕机

阿里通义千问发布史上最强Qwen模型,首次开源Max级权重。更恐怖的是:它能连续自主编程16天,产出265次提交和127个PR,没有一次人工介入。

事件回顾

8月3日,阿里通义千问团队正式发布 Qwen3.8-Max,这是Qwen家族迄今为止最强大的模型。核心数据:

  • 2.4万亿参数(95B活跃参数),下周开源权重
  • 在编程、办公、科研和长周期任务上全面跃升
  • 能端到端完成复杂任务,输出可交付成果
  • 在QwenWork、Claude Code、Codex、OpenClaw、Hermes Agent等主流Agent框架上表现均衡

这是Qwen首次将Max级别的模型开源权重——此前Max系列一直是闭源API专属。这意味着开发者可以在本地或私有云上部署与API同等能力的基础模型,对AI创业者和一人公司来说是巨大的成本解放。

为什么重要

1. 自主编程10+天的"恐怖"能力

Qwen团队设计了三项极限测试,没有一项允许人工介入:

测试一:10天自主构建自进化工程系统

Qwen3.8-Max被要求从零构建 oh-my-cli 项目并建立自进化循环。它自己设计了需求→Issue→Agent认领→编码→测试→审查→合并的完整流水线。

截至7月30日(约16天后),该仓库累计:
- 265次提交
- 127个PR
- 151个Issue
- 完全零人工操作

它甚至实现了社区反馈收集、自我测试、异常自动路由回Issue修复等功能——这就是一个只有代码没有人的软件团队。

测试二:复现论文然后超越论文

模型被给了一篇关于"LLM推理数据筛选"的学术论文和一堆GPU,要求:①复现论文实验 ②做得更好。

它先花了37小时从零搭建完整流水线,成功复现了6个核心发现。然后进入自我进化模式——连续88小时、4轮迭代、提出并测试了18个改进思路。最终在第4轮,它发明的新方法比原论文方法在AIME24数学竞赛基准上高出了2.71个百分点

整个过程完全自主:提出假设→写代码→GPU训练→分析结果→再试。全程约7600行代码、1100+次工具调用、33轮GPU训练。

测试三:24小时击败458支人类团队

Qwen3.8-Max被投放到阿里云天池平台的WWW2025多模态对话意图识别挑战赛,与526支人类队伍同台竞技。

它在24小时内自主完成了:阅读赛题→微调BERT/MacBERT/RoBERTa处理文本→微调Qwen2.5-VL-7B处理截图→用Chinese-CLIP兜底不确定图片→加权投票融合→交叉验证调参。经过45轮提交迭代,准确率从0.60爬升到0.853,击败了526支队伍中的458支(87%)。

2. 史无前例的训练方法

Qwen3.8-Max的"工作能力"提升来自三个工程突破:

  • 复合环境扩展:任务×工作空间×Agent框架三者组合爆炸式增长,而非逐个适配
  • 统一奖励系统:将代码执行验证、文本评判、可视化输出检查、Agent审查统一到一套奖励体系
  • 在线数据平衡器:动态平衡每批训练数据的任务类型、难度、工作空间分布,抑制梯度方差

更值得关注的是,它的RL训练环境直接包括了Claude Code、Codex、OpenClaw和Hermes Agent等主流Agent框架——这意味着它在训练中就已经学会在不同Agent工具间泛化。

3. 定价和可用性

Qwen3.8-Max支持 reasoning_effort 参数调节推理深度:
- xhigh(默认):复杂任务深度分析
- medium:平衡精度和速度
- low:优化速度和成本

API兼容OpenAI格式,1M上下文窗口,最大输出65K token。

我们能学到什么

第一,Agent自主性拐点已到。 一个模型能在16天内自主完成265次提交、127个PR而且不出大乱子,说明AI已经具备了"独立工程师"级别的稳定性。这对一人公司的意义不言而喻——你可以让AI Agent跑长周期任务,自己专注于战略决策。

第二,开源生态正在逆转。 Qwen3.8-Max作为Max级模型首次开源,意味着顶级能力不再被API垄断。你可以用开源模型搭建自己的Agent工作流,完全掌控数据和成本。对AI创业者来说,这是降低边际成本的关键转折。

第三,Agent框架兼容性成为训练目标。 Qwen团队直接在训练中测试了Claude Code、Codex、OpenClaw和Hermes的性能,这说明模型厂商已经意识到:用户不止用一个Agent框架,模型必须在所有框架上都好用。这对Hermes Agent用户是好消息——未来模型会更懂Hermes的工作方式。

行动建议

  1. 关注下周易源开放:下载Qwen3.8-Max权重,测试在你的Agent工作流中的表现
  2. 尝试reasoning_effort参数:日常任务用medium/low节省成本,复杂Agent编排用xhigh
  3. 思考长周期Agent场景:如果AI能自主跑16天,你的哪些工作可以完全交由Agent处理?

AI创业 #Qwen #开源大模型 #AI编程 #一人公司 #Agent