馬斯克 7 月 28 日在 X 回覆 Vercel CEO Guillermo Rauch 時透露,xAI 將於 8 月 7 日前後推出參數規模達 1.5 萬億的 Grok 4.6,隨後數週內還會發布 2.1 萬億參數的 Grok 4.7。距離上一代 Grok 4.5 正式上線僅一個月,代表 xAI 今年夏天要連續推出三款前沿模型。本文面向關注前沿模型發布節奏、Agent 選型與 Token 成本的開發者與技術決策者,系統整理時間軸、核心參數、競品對照與未證實資訊的邊界;目前官方尚未公布具體 benchmark 分數與定價,以下內容依馬斯克公開表述及業界報導彙整。
SECTION 01 Grok 4.6 發布前最常見的三大誤讀
- 把馬斯克推文當成官方發布:目前唯一資訊來源是 7 月 28 日 X 上的一則回覆,xAI 官方部落格與產品頁尚未同步公告,實際日期可能提前或延後;
- 把參數規模等同於能力躍升:馬斯克特別強調 Grok 4.6 的升級重點在 SFT 與 RL 後訓練,而非單純堆參數——這與 Grok 4.5 程式設計向定位一脈相承;
- 輕忽「Musk time」彈性:業界常指馬斯克預告的時間表往往比實際晚數天到兩週,發布前建議以 xAI 官方帳號或官網公告為準;
- 把傳聞競品當已發布對標:Claude Fable 5.1 尚未被 Anthropic 官方確認,與已開源的 Kimi K3 和已發布的 Grok 4.5 混在同一對照表時須標註來源;
- 忽略安全合規背景:xAI 7 月對一名使用者提起訴訟,指控其繞過安全限制生成 CSAM,這與模型技術能力評價無關,但會影響企業選型時的供應商風險評估。
先說結論:Grok 4.6 的路線圖可信但尚未經第三方驗證,8 月可能是大模型扎堆發布月,選型應看 Token 效率與真實任務成本,而非參數數字本身。
SECTION 02 從 Grok 4.5 到 4.6、4.7:2026 年 7–9 月時間軸與參數對照
| 日期 | 事件 |
|---|---|
| 2026 年 7 月 8 日 | xAI 正式發布 Grok 4.5,定位程式設計與 Agent 任務,與 Cursor 合作訓練,50 萬 Token 上下文,定價輸入 $2/輸出 $6(每百萬 Token) |
| 2026 年 7 月 16–26 日 | 月之暗面 Kimi K3 從託管服務到完整開源權重(2.8 萬億參數、100 萬 Token 上下文) |
| 2026 年 7 月 28 日 | 馬斯克在 X 回覆 Rauch 首次公開 Grok 4.6/4.7 路線圖;同日 OpenAI、Anthropic 等 1200 餘名員工聯署《Pacing the Frontier》公開信 |
| 約 2026 年 8 月 7 日 | Grok 4.6 計畫發布,1.5 萬億參數,SFT/RL 大幅升級(官方預告,未發布) |
| 約 2026 年 8 月末–9 月初 | Grok 4.7 計畫跟進,2.1 萬億參數,馬斯克稱其全面優於 4.6 但推理稍慢、Token 效率更高 |
| 模型 | 發布/目標時間 | 參數規模 | 定位重點 | 狀態 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026 年 4 月 17 日 | 未公開 | 上一代基線 | 已發布 |
| Grok 4.5 | 2026 年 7 月 8 日 | 未公開(非 MoE 單一 SKU) | 程式設計與 Agent,與 Cursor 聯合訓練 | 已發布 |
| Grok 4.6 | 約 2026 年 8 月 7 日 | 1.5 萬億 | SFT/RL 大幅升級 | 官方預告,未發布 |
| Grok 4.7 | 約 2026 年 8 月末–9 月初 | 2.1 萬億 | 全面優於 4.6,Token 效率更高 | 官方預告,未發布 |
參數規模、定價、benchmark 分數均為廠商/馬斯克自述,Grok 4.6 與 4.7 目前均無第三方獨立評測數據,表中「官方預告」資訊務必以正式發布為準。
SECTION 03 深度拆解:這次升級的重點不是「更大」,而是「更會學」
監督微調(SFT)是用人工標註或精選的高品質樣本修正模型輸出習慣;強化學習(RL)則以獎勵訊號讓模型在真實任務鏈路中學會「怎麼做才對」,尤其是多步驟 Agent 任務。馬斯克強調 Grok 4.6 的升級重點在「SFT & RL」而非參數規模本身——Grok 4.5 當時憑藉與 Cursor 合作取得的真實開發者對話資料,在維持較小輸出 Token 消耗下拿到 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成績,處理同類任務所用輸出 Token 數量遠低於 Claude Opus 4.8(約 1.9 萬 Token 對 6.7 萬 Token)。
Grok 4.6 的 1.5 萬億參數相比 Grok 4.5 是明顯規模躍升,但馬斯克隨後補充 Grok 4.7 會更大(2.1 萬億)卻「推理稍慢」,暗示 xAI 內部清楚參數規模與推理速度之間存在權衡,未來會以兩款不同定位的模型分別滿足「更強」與「更快」的需求。
Grok 4.6 的發布時間表恰好卡在 Kimi K3 全面開源引發業界震動之後的第 10 天左右。Kimi K3 在 Frontend Code Arena 程式設計榜單上以 1679 分登頂,成為首個超越所有閉源模型的開源模型,Artificial Analysis 智慧指數綜合排名全球第三。馬斯克本人也在 Kimi K3 相關評測下留言稱「令人印象深刻」。業界普遍解讀,xAI 加快 Grok 4.6/4.7 發布節奏,與 OpenAI、Anthropic 及中國廠商的競爭烈度上升直接相關。
| 模型 | 廠商 | 參數規模 | 上下文 | 定價(輸入/輸出,每百萬 Token) |
|---|---|---|---|---|
| Grok 4.5 | xAI | 未公開 | 50 萬 Token | $2 / $6 |
| Grok 4.6(預告) | xAI | 1.5 萬億 | 未公開 | 未公開 |
| Kimi K3 | 月之暗面 | 2.8 萬億(MoE,啟用約 16/896 專家) | 100 萬 Token | $0.30(快取命中)/$3(快取未命中)輸入,$15 輸出 |
| Claude Fable 5.1(傳聞) | Anthropic | 未公開 | 未公開 | 傳聞維持 Fable 5 定價($10 輸入/$50 輸出) |
| GPT-5.6 Sol | OpenAI | 未公開 | 未公開 | 未公開 |
表格中 Grok 4.6、Claude Fable 5.1 相關數據均為預告或傳聞,不構成正式 benchmark 對照,僅供參考發布節奏與大致定位。
SECTION 04 爭議點與 2026 年 8 月「扎堆發布月」背景
- 時間表未經第三方驗證:目前唯一資訊來源是馬斯克在 X 上的一則回覆貼文,xAI 官方部落格與產品頁尚未同步公告;
- benchmark 分數與定價全部空白:與 Grok 4.5 發布時詳盡的模型卡、benchmark 表不同,Grok 4.6 目前沒有任何獨立測評或官方模型卡佐證其能力;
- xAI 內容安全爭議:7 月 xAI 對一名使用者提起訴訟,指控其利用 Grok 繞過安全限制生成 CSAM,這也是 xAI 首次就 AI 生成的深度偽造內容起訴使用者。今年 1 月 Common Sense Media 的報告曾將 Grok 評為「未成年人保護最差的 AI 產品之一」;
- 與業界「減速」呼籲的錯位:7 月 28 日馬斯克發布 Grok 4.6/4.7 路線圖的同一天,OpenAI、Anthropic 等公司 1200 餘名員工聯署「Pacing the Frontier」公開信,呼籲美國政府建立主動放緩前沿 AI 發展的治理工具,xAI 並未出現在簽署名單中。
若馬斯克的時間表成立,Grok 4.6、Grok 4.7 將與傳聞中的 Claude Fable 5.1(據 36kr、WinCentral 等多方爆料指向 8 月)在同一個月內相繼登場,疊加 7 月已開源的 Kimi K3 帶來的衝擊,2026 年 8 月很可能成為大模型發布密度最高的月份之一。對開發者與企業使用者而言,選型窗口期極短——上一代旗艦可能剛上線一個月就要面對新一代競品,性價比與 Token 效率(而非單純的參數規模或跑分)會是更實際的決策依據。
SECTION 05 可引用技術數據與 Grok 4.6 發布前 6 步選型清單
- Grok 4.5 benchmark(已發布):Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%(xAI 官方模型卡);
- Grok 4.5 Token 效率:SWE-Bench Pro 任務平均約 15,954 輸出 Token,Claude Opus 4.8 約 67,020(第三方整理);
- Grok 4.6 預告參數:1.5 萬億,重點 SFT/RL 升級(馬斯克 X 貼文,未經第三方驗證);
- Grok 4.7 預告參數:2.1 萬億,全面優於 4.6 但推理稍慢(馬斯克 X 貼文);
- Kimi K3 對照:Frontend Code Arena 1679 分、2.8 萬億參數 MoE、100 萬 Token 上下文(Moonshot 官方);
- Grok 4.5 定價參考:輸入 $2/輸出 $6 每百萬 Token(xAI 官方公告)。
- 鎖定資訊來源:關注 xAI 官方部落格與 @xai X 帳號,勿僅憑二手報導更新正式環境路由;
- 建立 benchmark 對照表:在 Grok 4.6 模型卡發布前,以 Grok 4.5 與 Kimi K3 在自有程式碼庫跑 SWE/Agent 任務,記錄 Token 消耗與成功率;
- 預留 A/B 窗口:8 月首週勿凍結全年 API 合約,為 Grok 4.6、Fable 5.1 傳聞窗口留出切換預算;
- 區分「更強」與「更快」SKU:依馬斯克表述,4.6 偏均衡、4.7 偏品質——提前規劃延遲敏感與品質敏感兩條路由;
- 複核安全與合規:評估 xAI 近期 CSAM 訴訟與未成年人保護評級對企業政策的影響;
- 發布當日核對定價:以 xAI 控制台與 API 文件為準,勿沿用 Grok 4.5 價格假設做財務模型。
以下連結為官方與第三方來源,發版後請以最新頁面為準:
xAI 官方部落格:Introducing Grok 4.5
Elon Musk X 帳號(2026 年 7 月 28 日回覆 @rauchg)
Moonshot AI:Kimi K3 GitHub 儲存庫
若你的團隊正在 Grok 或 Kimi 等前沿模型上建構 Agent 與 iOS/macOS CI 流水線,虛擬化 Mac 環境在 Xcode 編譯、Metal 加速場景下存在效能損耗與相容性風險。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的正式環境,MACNOX 的雲端物理節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。更多背景可參考 Grok 4.5 深度評測與 Kimi K3 全面開源。
SECTION 06 常見問題 FAQ
Grok 4.6 具體是哪天發布?
馬斯克表示「大約 8 月 7 日」,但這是非正式表述,並非 xAI 官方確認的發布日期,實際時間可能提前或延後。
Grok 4.6 和 Grok 4.7 有什麼區別?
Grok 4.6 為 1.5 萬億參數,重點是 SFT 與 RL 後訓練升級;Grok 4.7 為 2.1 萬億參數,預計在 4.6 發布後「數週」跟進,馬斯克稱其能力全面優於 4.6,但推理速度略慢,Token 效率更高。
Grok 4.6 會比 Kimi K3 或 Claude Fable 5.1 更強嗎?
目前無法判斷。Grok 4.6 沒有任何公開 benchmark 分數,Kimi K3 已有實測數據且在部分程式設計榜單上表現突出,Claude Fable 5.1 本身尚未被 Anthropic 官方確認發布,三者暫無法直接對比。
Grok 4.6 大概會怎麼定價?
官方未公布。可參考 Grok 4.5 的定價(輸入 $2/輸出 $6,每百萬 Token)作為大致區間,但新一代模型定價可能調整,務必以正式發布資訊為準。
一般使用者屆時能在哪裡用上 Grok 4.6?
依 Grok 4.5 的分發路徑推測,大概率會先上線 Grok Build、xAI 官方 API 和控制台,隨後逐步接入更多第三方平台,但具體入口以正式發布公告為準。