8 月 3 日,Qwen3.8-Max 正式发布:总参数 2.4 万亿(激活 95B),是 Qwen 家族迄今最强模型,也是史上第一个会开源权重的 Max 级模型——下周在 Hugging Face 和 ModelScope 放出。

官方编程实测:AI 独立运行 16 天,在 GitHub 留下 265 次提交、127 个 PR、151 个 issue;论文复现后还能自我进化,AIME24 再涨 2.7 分;天池比赛 24 小时击败 458 支人类队伍。

先记住三个数:2.4T 参数 / 265 次自主提交 / 权重下周开源

quote-card


〇、为什么这条消息值得程序员停下来看

过去一年,AI 编程的竞争基本是闭源军备竞赛:GPT-5.6-Sol、Claude Opus 4.8、Fable 5 各领风骚,开源阵营的 Max 级模型一直缺席。

Qwen3.8-Max 打破的不是某个跑分纪录,而是 Qwen 自家的惯例:「旗舰 Max 级模型 = 闭源」。权重下周开源,意味着社区可以自己部署、自己评测、自己微调——跑分表上的数字会第一次接受所有人的检验。

对普通程序员,这件事的直接影响更实际:千问平台已经能通过 API 调用,且兼容 OpenAI 和 Anthropic 协议——你现有的 Claude Code、Codex 配置,改两行环境变量就能切到 Qwen3.8-Max。多一个选择,就多一分议价权。

一、发布硬信息:一张表看懂

项目内容
总参数2.4 万亿(激活参数 95B)
架构基础Qwen 3.5,参数规模扩展
权重开源首次开源 Max 级权重,下周 HF + ModelScope
API 上线已上线,千问平台可调用
支持协议OpenAI 兼容(chat/responses)+ Anthropic 兼容
推理档位reasoning_effort:xhigh / medium / low
主打能力编程、办公、科研、长程任务、多模态智能体

一句话:模型已经能用,权重马上能自己跑。在 2.4T 这个量级,开源阵营第一次同时给你这两样。

二、编程实测:三个「全程没人管」的案例

官方没有晒单条跑分,而是让模型独立做完了三个开放任务——每个都要求它自己写代码、自己跑代码,全程零人工帮助

案例一:十天级自动编程,跑出一个活项目

模型被要求从零创建 oh-my-cli 项目,并自己搭建一套「自进化 harness」:用户反馈、社区实践、自测结果全部纳入工程循环,需求被规范化为 issue,由 agent 自动领取、执行、测试、合 PR。

  • 任务状态机:ready → leased → active,异常自动回退修复再验证
  • 自测闭环:Build、Unit Test、E2E、Desktop Lifecycle 全跑
  • 截至 2026-07-30,完全自主运行约 16 天后:265 次 commits、127 个 PR、151 个 issues

全程 trace 公开在 GitHub:qwen-code-dev-bot/oh-my-cli。你可以去翻它每天的提交记录,看它怎么自己发现问题、自己改。

案例二:复现一篇论文,然后超越它

模型只拿到一篇论文《Unified Data Selection for LLM Reasoning》和一批 GPU——没有起始代码、没有现成流水线。数据处理脚本、训练代码、评测程序全部从零写。

  • 连续工作约 125 小时,写下约 7,600 行代码,执行 1,100+ 步操作,跑了 33 轮 GPU 训练
  • 前 37 小时搭完流水线,完整复现论文六项主要结论(数据选择方法在 AIME24 上比随机挑选高 +7.7%)
  • 之后进入自我进化循环:提出假设 → 写代码 → 上 GPU → 分析 → 再试,四轮探索、18 种改进想法,最终在 AIME24 上再提升 2.7 分

注意这个细节:它是在「复现成功」之后选择继续的。 没有人在旁边说「再做点」,是模型自己把「完成」定义成了「超越」。

案例三:24 小时,击败 458 支人类队伍

WWW2025 多模态对话意图识别挑战赛,阿里云天池平台,526 支人类队伍同场。

  • 限时 24 小时,模型自己读规则、自己搭方案
  • 文本侧微调集成 BERT / MacBERT / RoBERTa,截图侧微调 Qwen2.5-VL-7B,用 Chinese-CLIP 兜底
  • 融合成加权投票系统,交叉验证校准权重
  • 45 次提交,准确率从 0.60 爬到 0.853,击败 458 支队伍(全场 87%)

三个案例合起来是一件事:Qwen3.8-Max 不是「写代码的模型」,是「能自己把项目做完的模型」。

AI 独立完成三个开放编程任务

三、跑分:赢在哪里,输在哪里

官方放出了完整基准表(Qwen 自家评测框架,部分用 Claude Code 跑)。挑重点看:

基准Qwen3.8-Max最强对手结论
PaperBench93.0GPT-5.6 Sol 90.5胜(全场第一)
AndroidBench75.1Fable 5 84.5
Terminal Bench 2.186.6GPT-5.6 Sol 88.8略输
SWE-bench Pro67.7Fable 5 80.0输(差距明显)
DeepSWE 1.156.6GPT-5.6 Sol 73.0输(差距明显)
OSWorld-Verified86.1Fable 5 85.0胜(全场第一)
CoWorkBench74.8Fable 5 75.9基本持平
JobBench53.4Fable 5 57.4略输
IFBench82.8GPT-5.6 Sol 72.7胜(全场第一)
HiPhO90.0GPT-5.6 Sol 86.8
MLVU90.8GPT-5.6 Sol 87.6
VideoMME90.4GPT-5.6 Sol 89.5

诚实结论:

  1. 长程科研、多模态理解、办公 agent 类,Qwen3.8-Max 确实站到了第一梯队,部分基准第一。
  2. 经典软件工程基准仍落后:SWE-bench Pro 67.7 对 Fable 5 的 80.0,DeepSWE 56.6 对 73.0——「改真实仓库的 bug」这类任务还不是它的强项。
  3. 评测框架是 Qwen 自家搭的(Terminal Bench 用 Claude Code 跑),存在主场因素。

闭源时代的跑分表是广告,开源之后的跑分才是考试。 下周权重放出,社区自己部署评测,才是真正见真章的时候。

四、办公与长程:模型开始「上班」了

官方还展示了几个真实工作流案例(均为官方演示,可视为能力上限展示):

  • 企业合规律师:数百份文档,单次通读标出 1,284 条相关条款,一小时内完成——同等工作量传统上要法务助理团队做约一周
  • 量化研究:从 6 类因子出发拆出 50 个研究方向,调度约 330 个子智能体,完成约 6,000 次回测,入选因子超额夏普 0.64–1.48
  • 芯片设计:GCD/RSA 密码加速器,500 轮交互、71 次评估,网表门数从 8,298 优化到 678;物理版图面积 106×106µm² 缩到 46×46µm²(-81%),时序从 -4.46ns 违例做到 500MHz 闭合
  • 电商经营模拟(365 天):¥100,000 起步,年末总现金 ¥416,252(4.16 倍回报),比第二名 GLM 5.2 高 38%,比上一代 Qwen3.7-Max 高 152%

这些数字说明一件事:模型的「长程自主性」已经不是演示,而是可复现的工程能力。 但它仍然是上限展示——生产环境能不能稳定复现,要等开源后社区验证。

五、程序员现在就能用:两分钟接入

模型已经在千问平台(platform.qianwenai.com)上线,兼容 OpenAI 和 Anthropic 协议。

接入 Claude Code

export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=你的千问APIKey
claude

接入 Codex(Responses 协议)

~/.codex/config.toml 里配置 provider,~/.codex/model-catalog.local.json 注册模型(官方文档有完整 JSON),然后:

export OPENAI_API_KEY=你的千问APIKey
codex

给现有工具换个更强模型

推理档位

API 支持 reasoning_effortxhigh(默认,深度分析)、medium(平衡)、low(省 token 快响应)。想省成本就先从 medium 试起。

一句话提醒:价格按千问平台计费,接入前自己看下价目表,别被「免费」两个字带节奏。

六、总结:三个行动建议

  1. 想尝鲜:今天就注册千问平台,用 qwen3.8-max 跑一个你自己的任务,别信任何人的评测,包括这篇。
  2. 想省钱:等下周权重开源,本地或自建推理跑 SWE-bench 类任务对比,再决定主力模型换不换。
  3. 想判断趋势:盯三个数字——开源后一周内的社区评测数、GitHub star、以及各大厂商对「开源 Max 级」的跟进速度。

AI 编程的牌桌上,开源阵营第一次拿到了和闭源同级别的牌。这把牌打得好不好,下周开源见分晓。


🎯 觉得这篇有用?

  • 关注「梦兽编程」,AI 编程工具实测、效率方法,只发能落地的东西
  • 想看哪个模型的深度评测,评论区告诉我,我来跑


参考来源: