2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max 并同步上线 Agent 产品「千问办公」。模型总参数 2.4 万亿、激活 950 亿、上下文 100 万 token,在 Arena 文本竞技场前 8 名中是唯一非 Anthropic 模型(第 5 名,1496 分,标注为初步结果)。本文面向评估旗舰 API 与 Agent 迁移的开发者与技术负责人,严格梳理发布时间线、核心跑分、与 Kimi K3 及 DeepSeek V4 的横向对照,并拆解「开源」标签与跑分可信度争议。
SECTION 01 Qwen3.8-Max 选型痛点:透明度缺口与「开源」标签超前
8 月 3 日 GA 前后,开发者社区最常见的误判与顾虑包括:
- 把官网「Open-Source」标签当权重已上线:截至发稿,Hugging Face 与 ModelScope 尚无对应仓库,仅承诺「下周」开源 Qwen3.8-Max 与精简版 Qwen3.8-27B;
- 把阿里自测跑分当独立验证结论:PaperBench、OSWorld-Verified、SWE-bench Pro 等数据均来自阿里自建框架,Artificial Analysis 等平台尚未复现正式版;
- 忽视预览版阶段的透明度批评:7 月 19 日预览版未公布激活参数、禁止自动化生产调用,多家评测机构建议勿直接迁移生产;
- 误读 Arena 初步排名:1496 分标注为 Preliminary,前 4 名与第 6–8 名均为 Anthropic 模型,样本与方法论仍可能变化;
- 低估 Agent 落地对底层算力环境的要求:长程自主任务(16 天编码、500+ 步芯片设计)对 CI 与 macOS 流水线稳定性提出更高要求,虚拟化环境易出现隐性损耗。
阿里港股发布当日上涨约 7%、美股约 4.5%——资本市场将其解读为阿里重掌 AI 叙事主动权,而非普通迭代。
SECTION 02 Qwen3.8-Max 发布时间线与核心参数一览
- 7 月 16 日:月之暗面发布 Kimi K3(2.8 万亿参数,896 专家激活 16 个),主打独立评测与透明技术报告;
- 7 月 19 日:Qwen3.8-Max 预览版上线 Token Plan / Qoder / QoderWork,定价为正式价 10%,未公布激活参数与跑分;
- 7 月 27 日:Kimi K3 按承诺开源权重至 Hugging Face,同步开源 MoonEP、FlashKDA 等基础设施;
- 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,九项智能体/代码基准超 V4-Pro 预览版,参数规模未增;
- 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线;
- 预计 8 月 10 日前后:官方口径「下周」开源 Qwen3.8-Max 与 Qwen3.8-27B 权重,具体日期与许可证条款尚未公布。
| 项目 | 参数 |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(每百万 token) | 输入 $2、输出 $6;隐式缓存命中 $0.25;显式缓存写入 $2.5、读取 $0.17 |
| 国内定价(官方口径) | 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元 |
| Arena 文本竞技场(8 月 1 日快照) | 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型 |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
SECTION 03 MoE 架构拆解与旗舰模型横向对比
Qwen3.8-Max 延续 Qwen3.5 路线:稀疏 MoE 将总参数推至 2.4 万亿,激活控制在 950 亿,推理成本更接近千亿级模型而非全量 2.4T。API 定价 $2/$6 明显低于 Claude Opus 5($5/$25)与 Claude Fable 5($10/$50),本质是用架构效率换价格竞争力。
模型提供 reasoning_effort 三档(low / medium / xhigh,默认 xhigh),可通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调节速度与深度。API 同时兼容 OpenAI 与 Anthropic 协议,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。
| 模型 | 总/激活参数 | 定价(输入/输出) | 权重开源 | 独立第三方评测 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 亿 | $2 / $6 | 未开源(承诺中) | 暂无正式复现 |
| Kimi K3 | 2.8T / 约 500 亿 | $3 / $15 | 已开源(7 月 27 日) | Artificial Analysis 约 57.11 分 |
| DeepSeek V4-Flash | 与 V4-Pro 同规模 | 未完整公开 | 已开源 | 九项 Agent/代码基准超 V4-Pro |
| Claude Fable 5 | 未公开 | $10 / $50 | 闭源 | Arena 文本第 1 名 |
| 独立盲测(269 文件架构任务) | Kimi K3 83 分 vs Qwen3.8-Max 预览 80 分 | — | — | 同档位、互有胜负 |
阿里自测跑分(须标注来源):PaperBench 93.0(+28.2)、OSWorld-Verified 86.1、SWE-bench Pro 67.7(落后 Fable 5 的 80.0)、HLE 43.6(旗舰中偏低,Fable 5 为 53.3)。对比表脚注曾暗示「Fable 5 结果可能涉及 fallback」,但阿里自身测试方法论亦未完全公开至可第三方复现程度。
SECTION 04 「开源」标签争议与 6 步 API 接入清单
本次发布最值得警惕的不是峰值跑分,而是信息披露的时间差:官网 GA 当天已标注 Open-Source,但权重、许可证与确切日期均未公布;所有跑分来自阿里自建框架(含 QwenSWEBench、RecreationBench 等内部基准);预览阶段禁止生产自动化调用且缺少 model card。
- 核对开源状态:在 Hugging Face / ModelScope 搜索
Qwen3.8-Max,确认仓库、许可证与权重是否已实际上线,勿仅凭官网标签迁移; - 选择接入协议:按现有工具链选择 OpenAI 兼容或 Anthropic 兼容端点,评估千问办公 Agent 与纯 API 调用的分工;
- 配置 reasoning 档位:对延迟敏感任务设
low或medium,复杂 Agent 任务默认xhigh并监控 token 成本; - 启用缓存策略:利用隐式/显式缓存定价(命中 $0.25、读取 $0.17)降低长上下文 Agent 的实际账单;
- 业务场景 A/B 测试:在自有工作负载上与 Kimi K3、DeepSeek V4 做盲审对比,勿仅依赖厂商自报跑分;
- 规划 Agent 基础设施:长程任务需稳定 CI 与 macOS 编译环境,评估物理 Mac 节点与虚拟化方案的总拥有成本。
# Anthropic 兼容接口示例(reasoning.effort)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic/v1"
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000},
messages=[{"role": "user", "content": "Summarize MoE active params for Qwen3.8-Max."}]
)
print(response.content[0].text)
SECTION 05 可引用技术数据、行业背景与选型结论
- 2.4T 总参数 / 950 亿激活:GA 阶段才首次披露激活量,预览版阶段完全未公开,是 7 月透明度批评焦点之一;
- API $2/$6(每百万 token):低于 Claude Opus 5 与 Fable 5,国内口径输入 12 元、输出 36 元、缓存命中 1.5 元;
- Arena 文本第 5(1496,Preliminary):前 8 名中唯一非 Anthropic 模型,视觉竞技场第 2;
- 长程案例:阿里披露 16 天无人工介入编码、500+ 步芯片设计优化;部分过程见 GitHub
qwen-code-dev-bot/oh-my-cli,非完整第三方审计; - 消费端落地:千问已支撑国行 Apple Intelligence 生成式能力(压缩后本地运行),详见 苹果 AI 中国版与千问合作专题。
2026 年万亿参数模型进入「扩产年」,但 DeepSeek V4-Flash 已证明不靠堆参数也能提升 Agent 能力;阿里此次罕见承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「开放权重」格局。同期 OpenAI、Anthropic 披露 Agent 越狱事件,白宫 8 月 4 日召集巨头商讨自愿性网络安全测试——中美 AI 叙事在同一周形成鲜明对照。
以下链接为官方与第三方来源,发版后请以最新页面为准:
GitHub:qwen-code-dev-bot/oh-my-cli(长程编码案例部分记录)
TechCrunch:Apple Intelligence 中国版采用阿里巴巴 Qwen
若团队基于 Qwen3.8-Max 构建 Agent 流水线,虚拟化 Mac 在 Xcode 编译、Metal 加速与 iOS CI 场景存在性能损耗与兼容性风险。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。更多国产模型选型背景可参考 OpenRouter 7 月排行榜分析。
SECTION 07 常见问题 FAQ
Qwen3.8-Max 现在能直接用吗?开源了没有?
API 已可通过阿里云 QwenCloud 调用,兼容 OpenAI 与 Anthropic 两种协议。权重尚未开源:官网虽标注 Open-Source,Hugging Face / ModelScope 仓库与许可证预计「下周」(约 8 月 10 日前后)公布,请以官方公告为准。
Qwen3.8-Max 和 Kimi K3 到底谁更强?
尚无双方都认可的统一评测。唯一可比的独立盲测(269 文件架构任务)显示 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,属同档位互有胜负。Kimi K3 优势是已开源且有 Artificial Analysis 数据;Qwen3.8-Max 优势是更低 API 价与更全面多模态。
2.4 万亿参数是不是普通开发者用不起?
2.4 万亿是 MoE 总参数,实际激活 950 亿,API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心级硬件;更现实的选择是等待同期开源的精简版 Qwen3.8-27B。
阿里公布的跑分能信吗?
可作参考,不能当定论。数据来自阿里自建框架与部分自定义基准,Artificial Analysis 等平台尚未复现正式版,Arena 排名亦标注 Preliminary。建议关注后续独立复测或在自有业务场景做 A/B 测试。
对普通用户有什么实际影响?
除开发者获得更便宜的旗舰 API 外,国行 iPhone 的 Apple Intelligence 生成式能力已基于压缩后的千问模型本地运行,普通用户将在系统层面间接使用千问系列能力。