2026 年 8 月 3 日,阿里巴巴正式將旗艦大模型 Qwen3.8-Max 推進 GA,並同步上線 Agent 產品「千問辦公」。模型總參數 2.4 兆、激活 950 億、上下文 100 萬 token,在 Arena 文本競技場前 8 名中是唯一非 Anthropic 模型(第 5 名、1496 分,標註為初步結果)。本文面向評估旗艦 API 與 Agent 遷移的開發者與技術決策者,系統梳理發佈時間線、核心跑分、與 Kimi K3 及 DeepSeek V4 的橫向對照,並拆解「開源」標籤與跑分可信度爭議。
SECTION 01 Qwen3.8-Max 選型痛點:資訊透明度缺口與「開源」標籤超前
8 月 3 日 GA 前後,開發者社群最常見的誤判與顧慮包括:
- 把官網「Open-Source」標籤當權重已上線:截至發稿,Hugging Face 與 ModelScope 尚無對應儲存庫,僅承諾「下週」開源 Qwen3.8-Max 與精簡版 Qwen3.8-27B;
- 把阿里自測跑分當獨立驗證結論:PaperBench、OSWorld-Verified、SWE-bench Pro 等數據均來自阿里自建框架,Artificial Analysis 等平台尚未複現正式版;
- 忽視預覽版階段的透明度批評:7 月 19 日預覽版未公布激活參數、禁止自動化生產呼叫,多家評測機構建議勿直接遷移生產;
- 誤讀 Arena 初步排名:1496 分標註為 Preliminary,前 4 名與第 6–8 名均為 Anthropic 模型,樣本與方法論仍可能變動;
- 低估 Agent 落地對底層算力環境的要求:長程自主任務(16 天編碼、500+ 步晶片設計)對 CI 與 macOS 流水線穩定性提出更高要求,虛擬化環境易出現隱性損耗。
阿里港股發佈當日上漲約 7%、美股約 4.5%——資本市場將其解讀為阿里重掌 AI 敘事主導權,而非普通迭代。
SECTION 02 Qwen3.8-Max 發佈時間線與核心參數一覽
- 7 月 16 日:月之暗面發佈 Kimi K3(2.8 兆參數,896 專家激活 16 個),主打獨立評測與透明技術報告;
- 7 月 19 日:Qwen3.8-Max 預覽版上線 Token Plan / Qoder / QoderWork,定價為正式價 10%,未公布激活參數與跑分;
- 7 月 27 日:Kimi K3 按承諾開源權重至 Hugging Face,同步開源 MoonEP、FlashKDA 等基礎設施;
- 7 月 31 日:DeepSeek 發佈 V4-Flash 正式版,九項智能體/程式碼基準超 V4-Pro 預覽版,參數規模未增;
- 8 月 3 日:Qwen3.8-Max 正式 GA,發佈完整跑分表,「千問辦公」同步上線;
- 預計 8 月 10 日前後:官方口徑「下週」開源 Qwen3.8-Max 與 Qwen3.8-27B 權重,具體日期與授權條款尚未公布。
| 項目 | 參數 |
|---|---|
| 發佈日期 | 2026 年 8 月 3 日(GA) |
| 總參數/激活參數 | 2.4 兆/950 億 |
| 架構 | 基於 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬) |
| 輸入模態 | 文字/圖像/影片 |
| API 定價(每百萬 token) | 輸入 $2、輸出 $6;隱式快取命中 $0.25;顯式快取寫入 $2.5、讀取 $0.17 |
| 大陸定價(官方口徑) | 輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元 |
| Arena 文本競技場(8 月 1 日快照) | 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型 |
| Arena 視覺競技場 | 第 2 名,僅次於 Claude Fable 5 |
| 權重開源狀態 | 承諾「下週」,截至發稿未上線 |
SECTION 03 MoE 架構拆解與旗艦模型橫向對比
Qwen3.8-Max 延續 Qwen3.5 路線:稀疏 MoE 將總參數推至 2.4 兆,激活控制在 950 億,推理成本更接近千億級模型而非全量 2.4T。API 定價 $2/$6 明顯低於 Claude Opus 5($5/$25)與 Claude Fable 5($10/$50),本質是用架構效率換價格競爭力。
模型提供 reasoning_effort 三檔(low/medium/xhigh,預設 xhigh),可透過 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 調節速度與深度。API 同時相容 OpenAI 與 Anthropic 協定,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。
| 模型 | 總/激活參數 | 定價(輸入/輸出) | 權重開源 | 獨立第三方評測 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T/950 億 | $2/$6 | 未開源(承諾中) | 暫無正式複現 |
| Kimi K3 | 2.8T/約 500 億 | $3/$15 | 已開源(7 月 27 日) | Artificial Analysis 約 57.11 分 |
| DeepSeek V4-Flash | 與 V4-Pro 同規模 | 未完整公開 | 已開源 | 九項 Agent/程式碼基準超 V4-Pro |
| Claude Fable 5 | 未公開 | $10/$50 | 閉源 | Arena 文本第 1 名 |
| 獨立盲測(269 檔案架構任務) | Kimi K3 83 分 vs Qwen3.8-Max 預覽 80 分 | — | — | 同檔位、互有勝負 |
阿里自測跑分(須標註來源):PaperBench 93.0(+28.2)、OSWorld-Verified 86.1、SWE-bench Pro 67.7(落後 Fable 5 的 80.0)、HLE 43.6(旗艦中偏低,Fable 5 為 53.3)。對照表腳註曾暗示「Fable 5 結果可能涉及 fallback」,但阿里自身測試方法論亦未完全公開至可第三方複現程度。
SECTION 04 「開源」標籤爭議與 6 步 API 接入清單
本次發佈最值得警惕的不是峰值跑分,而是資訊披露的時間差:官網 GA 當天已標註 Open-Source,但權重、授權條款與確切日期均未公布;所有跑分來自阿里自建框架(含 QwenSWEBench、RecreationBench 等內部基準);預覽階段禁止生產自動化呼叫且缺少 model card。
- 核對開源狀態:在 Hugging Face/ModelScope 搜尋
Qwen3.8-Max,確認儲存庫、授權條款與權重是否已實際上線,勿僅憑官網標籤遷移; - 選擇接入協定:按現有工具鏈選擇 OpenAI 相容或 Anthropic 相容端點,評估千問辦公 Agent 與純 API 呼叫的分工;
- 設定 reasoning 檔位:對延遲敏感任務設
low或medium,複雜 Agent 任務預設xhigh並監控 token 成本; - 啟用快取策略:利用隱式/顯式快取定價(命中 $0.25、讀取 $0.17)降低長上下文 Agent 的實際帳單;
- 業務場景 A/B 測試:在自有工作負載上與 Kimi K3、DeepSeek V4 做盲審對比,勿僅依賴廠商自報跑分;
- 規劃 Agent 基礎設施:長程任務需穩定 CI 與 macOS 編譯環境,評估實體 Mac 節點與虛擬化方案的總擁有成本。
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic/v1"
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000},
messages=[{"role": "user", "content": "Summarize MoE active params for Qwen3.8-Max."}]
)
print(response.content[0].text)
SECTION 05 可引用技術資料、產業背景與選型結論
- 2.4T 總參數/950 億激活:GA 階段才首次披露激活量,預覽版階段完全未公開,是 7 月透明度批評焦點之一;
- API $2/$6(每百萬 token):低於 Claude Opus 5 與 Fable 5,大陸口徑輸入 12 元、輸出 36 元、快取命中 1.5 元;
- Arena 文本第 5(1496,Preliminary):前 8 名中唯一非 Anthropic 模型,視覺競技場第 2;
- 長程案例:阿里披露 16 天無人工介入編碼、500+ 步晶片設計最佳化;部分過程見 GitHub
qwen-code-dev-bot/oh-my-cli,非完整第三方稽核; - 消費端落地:千問已支撐國行 Apple Intelligence 生成式能力(壓縮後本機執行),詳見 蘋果 AI 中國版與千問合作專題。
2026 年兆級參數模型進入「擴產年」,但 DeepSeek V4-Flash 已證明不靠堆參數也能提升 Agent 能力;阿里此次罕見承諾開源 Max 級權重,與 Kimi K3、DeepSeek 構成國產頭部「開放權重」格局。同期 OpenAI、Anthropic 披露 Agent 越獄事件,白宮 8 月 4 日召集巨頭商討自願性網路安全測試——中美 AI 敘事在同一週形成鮮明對照。
以下連結為官方與第三方來源,發版後請以最新頁面為準:
GitHub:qwen-code-dev-bot/oh-my-cli(長程編碼案例部分記錄)
TechCrunch:Apple Intelligence 中國版採用阿里巴巴 Qwen
若團隊基於 Qwen3.8-Max 建構 Agent 流水線,虛擬化 Mac 在 Xcode 編譯、Metal 加速與 iOS CI 場景存在效能損耗與相容性風險。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,MACNOX 的雲端實體節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。更多國產模型選型背景可參考 OpenRouter 7 月排行榜分析。
SECTION 07 常見問題 FAQ
Qwen3.8-Max 現在能直接用嗎?開源了沒有?
API 已可透過阿里雲 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 兩種協定。權重尚未開源:官網雖標註 Open-Source,Hugging Face/ModelScope 儲存庫與授權條款預計「下週」(約 8 月 10 日前後)公布,請以官方公告為準。
Qwen3.8-Max 和 Kimi K3 到底誰更強?
尚無雙方都認可的統一評測。唯一可比的獨立盲測(269 檔案架構任務)顯示 Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分,屬同檔位互有勝負。Kimi K3 優勢是已開源且有 Artificial Analysis 數據;Qwen3.8-Max 優勢是更低 API 價與更全面多模態。
2.4 兆參數是不是一般開發者用不起?
2.4 兆是 MoE 總參數,實際激活 950 億,API 呼叫成本接近千億級模型。本機私有化部署完整版需多節點資料中心級硬體;更現實的選擇是等待同期開源的精簡版 Qwen3.8-27B。
阿里公布的跑分能信嗎?
可作參考,不能當定論。數據來自阿里自建框架與部分自訂基準,Artificial Analysis 等平台尚未複現正式版,Arena 排名亦標註 Preliminary。建議關注後續獨立複測或在自有業務場景做 A/B 測試。
對一般使用者有什麼實際影響?
除開發者獲得更便宜的旗艦 API 外,國行 iPhone 的 Apple Intelligence 生成式能力已基於壓縮後的千問模型本機執行,一般使用者將在系統層面間接使用千問系列能力。