8 月 3 日,Qwen3.8-Max 正式发布:总参数 2.4 万亿(激活 95B),是 Qwen 家族迄今最强模型,也是史上第一个会开源权重的 Max 级模型——下周在 Hugging Face 和 ModelScope 放出。
官方编程实测:AI 独立运行 16 天,在 GitHub 留下 265 次提交、127 个 PR、151 个 issue;论文复现后还能自我进化,AIME24 再涨 2.7 分;天池比赛 24 小时击败 458 支人类队伍。
先记住三个数:2.4T 参数 / 265 次自主提交 / 权重下周开源。

〇、为什么这条消息值得程序员停下来看
过去一年,AI 编程的竞争基本是闭源军备竞赛:GPT-5.6-Sol、Claude Opus 4.8、Fable 5 各领风骚,开源阵营的 Max 级模型一直缺席。
Qwen3.8-Max 打破的不是某个跑分纪录,而是 Qwen 自家的惯例:「旗舰 Max 级模型 = 闭源」。权重下周开源,意味着社区可以自己部署、自己评测、自己微调——跑分表上的数字会第一次接受所有人的检验。
对普通程序员,这件事的直接影响更实际:千问平台已经能通过 API 调用,且兼容 OpenAI 和 Anthropic 协议——你现有的 Claude Code、Codex 配置,改两行环境变量就能切到 Qwen3.8-Max。多一个选择,就多一分议价权。
一、发布硬信息:一张表看懂
| 项目 | 内容 |
|---|---|
| 总参数 | 2.4 万亿(激活参数 95B) |
| 架构基础 | Qwen 3.5,参数规模扩展 |
| 权重开源 | 首次开源 Max 级权重,下周 HF + ModelScope |
| API 上线 | 已上线,千问平台可调用 |
| 支持协议 | OpenAI 兼容(chat/responses)+ Anthropic 兼容 |
| 推理档位 | reasoning_effort:xhigh / medium / low |
| 主打能力 | 编程、办公、科研、长程任务、多模态智能体 |
一句话:模型已经能用,权重马上能自己跑。在 2.4T 这个量级,开源阵营第一次同时给你这两样。
二、编程实测:三个「全程没人管」的案例
官方没有晒单条跑分,而是让模型独立做完了三个开放任务——每个都要求它自己写代码、自己跑代码,全程零人工帮助。
案例一:十天级自动编程,跑出一个活项目
模型被要求从零创建 oh-my-cli 项目,并自己搭建一套「自进化 harness」:用户反馈、社区实践、自测结果全部纳入工程循环,需求被规范化为 issue,由 agent 自动领取、执行、测试、合 PR。
- 任务状态机:
ready → leased → active,异常自动回退修复再验证 - 自测闭环:Build、Unit Test、E2E、Desktop Lifecycle 全跑
- 截至 2026-07-30,完全自主运行约 16 天后:265 次 commits、127 个 PR、151 个 issues
全程 trace 公开在 GitHub:qwen-code-dev-bot/oh-my-cli。你可以去翻它每天的提交记录,看它怎么自己发现问题、自己改。
案例二:复现一篇论文,然后超越它
模型只拿到一篇论文《Unified Data Selection for LLM Reasoning》和一批 GPU——没有起始代码、没有现成流水线。数据处理脚本、训练代码、评测程序全部从零写。
- 连续工作约 125 小时,写下约 7,600 行代码,执行 1,100+ 步操作,跑了 33 轮 GPU 训练
- 前 37 小时搭完流水线,完整复现论文六项主要结论(数据选择方法在 AIME24 上比随机挑选高 +7.7%)
- 之后进入自我进化循环:提出假设 → 写代码 → 上 GPU → 分析 → 再试,四轮探索、18 种改进想法,最终在 AIME24 上再提升 2.7 分
注意这个细节:它是在「复现成功」之后选择继续的。 没有人在旁边说「再做点」,是模型自己把「完成」定义成了「超越」。
案例三:24 小时,击败 458 支人类队伍
WWW2025 多模态对话意图识别挑战赛,阿里云天池平台,526 支人类队伍同场。
- 限时 24 小时,模型自己读规则、自己搭方案
- 文本侧微调集成 BERT / MacBERT / RoBERTa,截图侧微调 Qwen2.5-VL-7B,用 Chinese-CLIP 兜底
- 融合成加权投票系统,交叉验证校准权重
- 45 次提交,准确率从 0.60 爬到 0.853,击败 458 支队伍(全场 87%)
三个案例合起来是一件事:Qwen3.8-Max 不是「写代码的模型」,是「能自己把项目做完的模型」。

三、跑分:赢在哪里,输在哪里
官方放出了完整基准表(Qwen 自家评测框架,部分用 Claude Code 跑)。挑重点看:
| 基准 | Qwen3.8-Max | 最强对手 | 结论 |
|---|---|---|---|
| PaperBench | 93.0 | GPT-5.6 Sol 90.5 | 胜(全场第一) |
| AndroidBench | 75.1 | Fable 5 84.5 | 输 |
| Terminal Bench 2.1 | 86.6 | GPT-5.6 Sol 88.8 | 略输 |
| SWE-bench Pro | 67.7 | Fable 5 80.0 | 输(差距明显) |
| DeepSWE 1.1 | 56.6 | GPT-5.6 Sol 73.0 | 输(差距明显) |
| OSWorld-Verified | 86.1 | Fable 5 85.0 | 胜(全场第一) |
| CoWorkBench | 74.8 | Fable 5 75.9 | 基本持平 |
| JobBench | 53.4 | Fable 5 57.4 | 略输 |
| IFBench | 82.8 | GPT-5.6 Sol 72.7 | 胜(全场第一) |
| HiPhO | 90.0 | GPT-5.6 Sol 86.8 | 胜 |
| MLVU | 90.8 | GPT-5.6 Sol 87.6 | 胜 |
| VideoMME | 90.4 | GPT-5.6 Sol 89.5 | 胜 |
诚实结论:
- 长程科研、多模态理解、办公 agent 类,Qwen3.8-Max 确实站到了第一梯队,部分基准第一。
- 经典软件工程基准仍落后:SWE-bench Pro 67.7 对 Fable 5 的 80.0,DeepSWE 56.6 对 73.0——「改真实仓库的 bug」这类任务还不是它的强项。
- 评测框架是 Qwen 自家搭的(Terminal Bench 用 Claude Code 跑),存在主场因素。
闭源时代的跑分表是广告,开源之后的跑分才是考试。 下周权重放出,社区自己部署评测,才是真正见真章的时候。
四、办公与长程:模型开始「上班」了
官方还展示了几个真实工作流案例(均为官方演示,可视为能力上限展示):
- 企业合规律师:数百份文档,单次通读标出 1,284 条相关条款,一小时内完成——同等工作量传统上要法务助理团队做约一周
- 量化研究:从 6 类因子出发拆出 50 个研究方向,调度约 330 个子智能体,完成约 6,000 次回测,入选因子超额夏普 0.64–1.48
- 芯片设计:GCD/RSA 密码加速器,500 轮交互、71 次评估,网表门数从 8,298 优化到 678;物理版图面积 106×106µm² 缩到 46×46µm²(-81%),时序从 -4.46ns 违例做到 500MHz 闭合
- 电商经营模拟(365 天):¥100,000 起步,年末总现金 ¥416,252(4.16 倍回报),比第二名 GLM 5.2 高 38%,比上一代 Qwen3.7-Max 高 152%
这些数字说明一件事:模型的「长程自主性」已经不是演示,而是可复现的工程能力。 但它仍然是上限展示——生产环境能不能稳定复现,要等开源后社区验证。
五、程序员现在就能用:两分钟接入
模型已经在千问平台(platform.qianwenai.com)上线,兼容 OpenAI 和 Anthropic 协议。
接入 Claude Code
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=你的千问APIKey
claude
接入 Codex(Responses 协议)
在 ~/.codex/config.toml 里配置 provider,~/.codex/model-catalog.local.json 注册模型(官方文档有完整 JSON),然后:
export OPENAI_API_KEY=你的千问APIKey
codex

推理档位
API 支持 reasoning_effort:xhigh(默认,深度分析)、medium(平衡)、low(省 token 快响应)。想省成本就先从 medium 试起。
一句话提醒:价格按千问平台计费,接入前自己看下价目表,别被「免费」两个字带节奏。
六、总结:三个行动建议
- 想尝鲜:今天就注册千问平台,用
qwen3.8-max跑一个你自己的任务,别信任何人的评测,包括这篇。 - 想省钱:等下周权重开源,本地或自建推理跑 SWE-bench 类任务对比,再决定主力模型换不换。
- 想判断趋势:盯三个数字——开源后一周内的社区评测数、GitHub star、以及各大厂商对「开源 Max 级」的跟进速度。
AI 编程的牌桌上,开源阵营第一次拿到了和闭源同级别的牌。这把牌打得好不好,下周开源见分晓。
🎯 觉得这篇有用?
- 关注「梦兽编程」,AI 编程工具实测、效率方法,只发能落地的东西
- 想看哪个模型的深度评测,评论区告诉我,我来跑
参考来源:

