首页 / 博客 / Qwen3.8-Max
ENGINEERING_BLOG · 2026.08.04

阿里 Qwen3.8-Max 发布:
2.4 万亿参数冲进 Arena 全球前五

2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max 并同步上线 Agent 产品「千问办公」。模型总参数 2.4 万亿、激活 950 亿、上下文 100 万 token,在 Arena 文本竞技场前 8 名中是唯一非 Anthropic 模型(第 5 名,1496 分,标注为初步结果)。本文面向评估旗舰 API 与 Agent 迁移的开发者与技术负责人,严格梳理发布时间线、核心跑分、与 Kimi K3DeepSeek V4 的横向对照,并拆解「开源」标签与跑分可信度争议。

SECTION 01 Qwen3.8-Max 选型痛点:透明度缺口与「开源」标签超前

8 月 3 日 GA 前后,开发者社区最常见的误判与顾虑包括:

  • 把官网「Open-Source」标签当权重已上线:截至发稿,Hugging Face 与 ModelScope 尚无对应仓库,仅承诺「下周」开源 Qwen3.8-Max 与精简版 Qwen3.8-27B;
  • 把阿里自测跑分当独立验证结论:PaperBench、OSWorld-Verified、SWE-bench Pro 等数据均来自阿里自建框架,Artificial Analysis 等平台尚未复现正式版;
  • 忽视预览版阶段的透明度批评:7 月 19 日预览版未公布激活参数、禁止自动化生产调用,多家评测机构建议勿直接迁移生产;
  • 误读 Arena 初步排名:1496 分标注为 Preliminary,前 4 名与第 6–8 名均为 Anthropic 模型,样本与方法论仍可能变化;
  • 低估 Agent 落地对底层算力环境的要求:长程自主任务(16 天编码、500+ 步芯片设计)对 CI 与 macOS 流水线稳定性提出更高要求,虚拟化环境易出现隐性损耗。

阿里港股发布当日上涨约 7%、美股约 4.5%——资本市场将其解读为阿里重掌 AI 叙事主动权,而非普通迭代。

SECTION 02 Qwen3.8-Max 发布时间线与核心参数一览

  • 7 月 16 日:月之暗面发布 Kimi K3(2.8 万亿参数,896 专家激活 16 个),主打独立评测与透明技术报告;
  • 7 月 19 日:Qwen3.8-Max 预览版上线 Token Plan / Qoder / QoderWork,定价为正式价 10%,未公布激活参数与跑分;
  • 7 月 27 日:Kimi K3 按承诺开源权重至 Hugging Face,同步开源 MoonEP、FlashKDA 等基础设施;
  • 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,九项智能体/代码基准超 V4-Pro 预览版,参数规模未增;
  • 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线;
  • 预计 8 月 10 日前后:官方口径「下周」开源 Qwen3.8-Max 与 Qwen3.8-27B 权重,具体日期与许可证条款尚未公布。
Qwen3.8-Max 核心参数(GA 版)
项目 参数
发布日期 2026 年 8 月 3 日(GA)
总参数 / 激活参数 2.4 万亿 / 950 亿
架构 基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口 100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态 文本 / 图像 / 视频
API 定价(每百万 token) 输入 $2、输出 $6;隐式缓存命中 $0.25;显式缓存写入 $2.5、读取 $0.17
国内定价(官方口径) 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场(8 月 1 日快照) 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型
Arena 视觉竞技场 第 2 名,仅次于 Claude Fable 5
权重开源状态 承诺「下周」,截至发稿未上线

SECTION 03 MoE 架构拆解与旗舰模型横向对比

Qwen3.8-Max 延续 Qwen3.5 路线:稀疏 MoE 将总参数推至 2.4 万亿,激活控制在 950 亿,推理成本更接近千亿级模型而非全量 2.4T。API 定价 $2/$6 明显低于 Claude Opus 5($5/$25)与 Claude Fable 5($10/$50),本质是用架构效率换价格竞争力

模型提供 reasoning_effort 三档(low / medium / xhigh,默认 xhigh),可通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调节速度与深度。API 同时兼容 OpenAI 与 Anthropic 协议,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。

Qwen3.8-Max 与竞品对照
模型 总/激活参数 定价(输入/输出) 权重开源 独立第三方评测
Qwen3.8-Max 2.4T / 950 亿 $2 / $6 未开源(承诺中) 暂无正式复现
Kimi K3 2.8T / 约 500 亿 $3 / $15 已开源(7 月 27 日) Artificial Analysis 约 57.11 分
DeepSeek V4-Flash 与 V4-Pro 同规模 未完整公开 已开源 九项 Agent/代码基准超 V4-Pro
Claude Fable 5 未公开 $10 / $50 闭源 Arena 文本第 1 名
独立盲测(269 文件架构任务) Kimi K3 83 分 vs Qwen3.8-Max 预览 80 分 同档位、互有胜负

阿里自测跑分(须标注来源):PaperBench 93.0(+28.2)、OSWorld-Verified 86.1、SWE-bench Pro 67.7(落后 Fable 5 的 80.0)、HLE 43.6(旗舰中偏低,Fable 5 为 53.3)。对比表脚注曾暗示「Fable 5 结果可能涉及 fallback」,但阿里自身测试方法论亦未完全公开至可第三方复现程度。

SECTION 04 「开源」标签争议与 6 步 API 接入清单

本次发布最值得警惕的不是峰值跑分,而是信息披露的时间差:官网 GA 当天已标注 Open-Source,但权重、许可证与确切日期均未公布;所有跑分来自阿里自建框架(含 QwenSWEBench、RecreationBench 等内部基准);预览阶段禁止生产自动化调用且缺少 model card。

  1. 核对开源状态:在 Hugging Face / ModelScope 搜索 Qwen3.8-Max,确认仓库、许可证与权重是否已实际上线,勿仅凭官网标签迁移;
  2. 选择接入协议:按现有工具链选择 OpenAI 兼容或 Anthropic 兼容端点,评估千问办公 Agent 与纯 API 调用的分工;
  3. 配置 reasoning 档位:对延迟敏感任务设 lowmedium,复杂 Agent 任务默认 xhigh 并监控 token 成本;
  4. 启用缓存策略:利用隐式/显式缓存定价(命中 $0.25、读取 $0.17)降低长上下文 Agent 的实际账单;
  5. 业务场景 A/B 测试:在自有工作负载上与 Kimi K3、DeepSeek V4 做盲审对比,勿仅依赖厂商自报跑分;
  6. 规划 Agent 基础设施:长程任务需稳定 CI 与 macOS 编译环境,评估物理 Mac 节点与虚拟化方案的总拥有成本。
qwen3-8-max-api.py
# Anthropic 兼容接口示例(reasoning.effort)
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic/v1"
)

response = client.messages.create(
    model="qwen3.8-max",
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 8000},
    messages=[{"role": "user", "content": "Summarize MoE active params for Qwen3.8-Max."}]
)
print(response.content[0].text)

SECTION 05 可引用技术数据、行业背景与选型结论

  • 2.4T 总参数 / 950 亿激活:GA 阶段才首次披露激活量,预览版阶段完全未公开,是 7 月透明度批评焦点之一;
  • API $2/$6(每百万 token):低于 Claude Opus 5 与 Fable 5,国内口径输入 12 元、输出 36 元、缓存命中 1.5 元;
  • Arena 文本第 5(1496,Preliminary):前 8 名中唯一非 Anthropic 模型,视觉竞技场第 2;
  • 长程案例:阿里披露 16 天无人工介入编码、500+ 步芯片设计优化;部分过程见 GitHub qwen-code-dev-bot/oh-my-cli,非完整第三方审计;
  • 消费端落地:千问已支撑国行 Apple Intelligence 生成式能力(压缩后本地运行),详见 苹果 AI 中国版与千问合作专题。

2026 年万亿参数模型进入「扩产年」,但 DeepSeek V4-Flash 已证明不靠堆参数也能提升 Agent 能力;阿里此次罕见承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「开放权重」格局。同期 OpenAI、Anthropic 披露 Agent 越狱事件,白宫 8 月 4 日召集巨头商讨自愿性网络安全测试——中美 AI 叙事在同一周形成鲜明对照。

以下链接为官方与第三方来源,发版后请以最新页面为准:

Arena.ai:文本与视觉竞技场公开排行榜

GitHub:qwen-code-dev-bot/oh-my-cli(长程编码案例部分记录)

TechCrunch:Apple Intelligence 中国版采用阿里巴巴 Qwen

若团队基于 Qwen3.8-Max 构建 Agent 流水线,虚拟化 Mac 在 Xcode 编译、Metal 加速与 iOS CI 场景存在性能损耗与兼容性风险。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。更多国产模型选型背景可参考 OpenRouter 7 月排行榜分析

SECTION 07 常见问题 FAQ

Qwen3.8-Max 现在能直接用吗?开源了没有?

API 已可通过阿里云 QwenCloud 调用,兼容 OpenAI 与 Anthropic 两种协议。权重尚未开源:官网虽标注 Open-Source,Hugging Face / ModelScope 仓库与许可证预计「下周」(约 8 月 10 日前后)公布,请以官方公告为准。

Qwen3.8-Max 和 Kimi K3 到底谁更强?

尚无双方都认可的统一评测。唯一可比的独立盲测(269 文件架构任务)显示 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,属同档位互有胜负。Kimi K3 优势是已开源且有 Artificial Analysis 数据;Qwen3.8-Max 优势是更低 API 价与更全面多模态。

2.4 万亿参数是不是普通开发者用不起?

2.4 万亿是 MoE 总参数,实际激活 950 亿,API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心级硬件;更现实的选择是等待同期开源的精简版 Qwen3.8-27B。

阿里公布的跑分能信吗?

可作参考,不能当定论。数据来自阿里自建框架与部分自定义基准,Artificial Analysis 等平台尚未复现正式版,Arena 排名亦标注 Preliminary。建议关注后续独立复测或在自有业务场景做 A/B 测试。

对普通用户有什么实际影响?

除开发者获得更便宜的旗舰 API 外,国行 iPhone 的 Apple Intelligence 生成式能力已基于压缩后的千问模型本地运行,普通用户将在系统层面间接使用千问系列能力。