阿里 Qwen3.8 发布,国产大模型从"会写代码"跨入"会交付项目"
8 月 3 日上午,阿里巴巴正式发布 Qwen3.8-Max。Preview 版早在 7 月 19 日上线,比 Kimi K3 晚两天,期间以"日更"模式迭代两周,部分开发者戏称"裸奔式发布"——限时一折换大规模用户反馈 [4][7]。正式版在 Preview 基础上经过多轮打磨。
| 规格项 | Qwen3.8-Max |
|---|---|
| 总参数量 | 2.4 万亿(2.4T) |
| 单次激活参数 | 95B(MoE 稀疏架构) |
| 上下文窗口 | 1M tokens |
| 多模态 | 原生视觉理解(非外挂 OCR) |
| 开源计划 | 下周开源 Max 权重 + Qwen3.8-27B |
| API 价格(国内) | 输入 ¥12/百万,输出 ¥36/百万,缓存 ¥1.5 |
第一,2.4T 总参数但只激活 95B。稀疏度接近 1:25,推理时只有约 4% 的参数在干活。这意味着模型的"体重"是超重量级,但"代谢"是中量级。这就是为什么输出价能做到 ¥36/百万——稠密 2.4T 这个价格跑不出来。
第二,Max 级首次开源。过去千问的规矩是"开源中杯、闭源大杯"。这次阿里把最大杯也放出来了。对金融、政务等需要私有化部署的客户,这句话比任何跑分都有分量。
oh-my-cli 仓库公开可审计。任务起点是一个空文件夹,终点是一个可用的自进化智能体框架。中间 16 天,模型自己做了这些事:
这套机制里,模型本身只占一半。另一半是外围工程——任务状态机、自动领取、CI 闭环、异常重入。但能把这两半捏在一起连续跑 16 天不崩,说明模型的长程一致性(long-horizon coherence)已经跨过了门槛。
这个门槛是什么?写一个函数,模型只需维持几百 token 的上下文。写一个能跑 16 天的项目,模型要在成千上万次交互中记住架构决策、不推翻昨天的设计、不在第 200 次提交时把第 10 次的接口改崩。过去两年,绝大多数"AI 自主编程"在第四五天开始自我矛盾。
阿里还公布了其他几组长周期任务数据:科研复现连续运行约 125 小时、芯片设计经历约 500 轮交互、电商经营模拟 365 天周期取得 4.16 倍回报。这些任务的共同点不是难度,而是时间——都不是"一问一答",而是"派个活,过几天来收"。
阿里这次公开的 Benchmark 表异常完整——连输的项目都列出来了。值得尊重。
| 评测 | Qwen3.8-Max | 对比 | 含义 |
|---|---|---|---|
| PaperBench(科研复现) | 93.0 | Fable 5: 88.8 | 长程任务执行力 |
| IFBench(指令遵循) | 82.8 | Fable 5: 63.5 | 工程可用性地基,差距近 20 分 |
| OSWorld-Verified(电脑操作) | 86.1 | 主流模型首位 | GUI Agent,落地价值高 |
| Arena Frontend Code | — | 仅差 Claude Opus 5 High 1 分 | 匿名 PK 榜,人为刷分难度大 |
| 评测 | Qwen3.8-Max | 对比 | 含义 |
|---|---|---|---|
| SWE-bench Pro | 67.7 | Fable 5: 80.0 | 仓库级精准修复,差距 12.3 分 |
| Terminal-Bench 2.1 | 86.6 | GPT-5.6 Sol: 88.8 | 终端驱动 Agent 作业 |
| TextArena 综合 | 第五名 | Anthropic 系列仍居前 | 匿名 PK 综合排名 |
SWE-bench Pro 这行输得很诚实,而且恰恰是对大多数开发者最重要的一行——考的是"给我修 Issue#134",不是从零建项目,而是插进已有代码库做外科手术。
赢和输放在一起看,Qwen3.8-Max 的能力画像很清晰:
擅长 从零开始、长周期、目标开放的任务——给方向,自己搭框架、自己验证、自己迭代。
相对弱 插进已有大型代码库做精准修复——这是 Fable 5 的强项。
定价直白:国际价格是 Claude Opus 5 的 40%(输入)和 24%(输出)。国内 ¥12/¥36 比 DeepSeek V4-Flash(¥1/¥2)贵一个数量级,但也贵得有理——多模态、1M 上下文、Max 级智能。
关键细节:隐式缓存命中 ¥1.5/百万。对 Agent 应用——系统提示词长、工具定义多、多轮反复调用——缓存命中率往往 60%+,真实账单可能比标价低不少。
同日开启公测的「千问办公」整合了 QoderWork、MuleRun、悟空三款产品,核心设计是"组织级 Skill":资深员工完成多轮交互流程后,把全过程沉淀为可复用 Skill,新人一键调用。解决了企业上 AI 的最大阻力——经验无法沉淀、质量无法统一。
阿里的商业逻辑:最强模型当矛,办公入口当盾,把 Token 消耗绑进企业日常工作流。参考:阿里云 AI 相关产品收入连续 11 个季度三位数增长,占外部云收入 30%;AI MaaS 业务 ARR 突破 100 亿元,目标年底 300 亿元 [1]。
7 月 31 日—8 月 3 日,四天之内:
四家国产厂商,三天之内把"参数、开源、Agent、价格"四张牌全打了一遍。
趋势判断:2024-2025 年,大模型比的是"参数和跑分"。
2026 年,比的是"能不能自己把活干完"。
DeepSeek V4-Flash 证明参数不变、纯靠后训练把 Agent 能力拉高 7.5 倍 [2]。MiniMax H3 证明开源能在视频编辑上登顶。Qwen3.8-Max 证明模型可以连续工作 16 天交付一个真实项目。三件事指向同一个方向——模型正在从"回答问题的工具"变成"承接任务的角色"。
"由于美国的芯片限制或普遍的怀疑,许多投资者继续低估中国的 AI 模型。实际上,差距可能要小得多,而且正在迅速缩小。"
— Vey-Sern Ling,瑞士 UBP 董事总经理 [3]
1. Benchmark 数字来自阿里自己的运行。截至 8 月 3 日无独立第三方复测。oh-my-cli 仓库公开可审计,但科研复现和竞赛成绩在阿里自家平台。下周权重开源后第三方跑出的数字才是真正的验收点。
2. 跑分领先 ≠ 日常体感领先。PaperBench 93.0、IFBench 82.8 对应特定基准。真实工作中的模糊指令、脏数据、多轮纠偏,任何榜单测不出来。Fable 5 在某些主观体验维度上依然被很多重度用户认为更"懂人话"。
3. "开源"和"用得起的开源"是两回事。2.4T 参数对绝大多数团队门槛太高。真正的落地选项是下周的 27B 版本。历史经验:小尺寸版本通常只能继承旗舰 60-75% 的综合能力。
4. Preview 争议不可回避。Preview 版被部分开发者称为"裸奔式发布"——有参数没数据、有口号没证据 [7]。部分用户反馈后劲不足、稳定性还差口气。阿里用"日更+限时一折"策略换反馈做最后打磨,此策略是否适用于旗舰级模型,业界仍有争议。
5. 团队变动不容忽视。Qwen 系列前技术负责人林俊旸已于今年 3 月离开阿里。Qwen3.8 是林俊旸离职 140 天后重回开源路线的第一款旗舰 [7]。此次 Max 开源,某种程度上也是在对外部疑虑做出回应。
2026 年 8 月这个时点,Qwen3.8-Max 给出了国产旗舰模型迄今最具说服力的长程自主交付证据。
不是"又快又强",是"能跑 16 天不崩"。这个区别,比任何跑分都重要。