马斯克 7 月 28 日在 X 上回复 Vercel CEO Guillermo Rauch 时透露,xAI 将于 8 月 7 日前后发布参数规模达 1.5 万亿的 Grok 4.6,随后几周内还会推出 2.1 万亿参数的 Grok 4.7。这距离上一代 Grok 4.5 发布仅一个月,意味着 xAI 在今年夏天要连续推出三款前沿模型。本文面向关注前沿模型发布节奏、Agent 选型与 token 成本的开发者与技术决策者,系统梳理时间线、核心参数、竞品对比与未证实信息边界;目前官方尚未公布具体基准分数和定价,以下信息基于马斯克公开表态及行业报道整理。
SECTION 01 Grok 4.6 发布前最常见的三大误读
- 把马斯克推文当成官方发布:目前唯一信息源是 7 月 28 日 X 上的一条回复,xAI 官方博客与产品页尚未同步公告,实际日期存在提前或推迟的可能;
- 把参数规模等同于能力跃升:马斯克特意强调 Grok 4.6 的升级重点在 SFT 与 RL 后训练,而非单纯堆参数——这与 Grok 4.5 编程向定位一脉相承;
- 忽视「Musk time」弹性:业内常指马斯克预告的时间表往往比实际晚几天到两周,发布前建议以 xAI 官方账号或官网公告为准;
- 把传闻竞品当已发布对标:Claude Fable 5.1 尚未被 Anthropic 官方确认,与已开源的 Kimi K3 和已发布的 Grok 4.5 混在同一对比表时须标注来源;
- 忽略安全合规背景:xAI 7 月对一名用户提起诉讼,指控其绕过安全限制生成 CSAM,这与模型技术能力评价无关,但影响企业选型时的供应商风险评估。
先说结论:Grok 4.6 的路线图可信但未经第三方验证,8 月可能是大模型扎堆发布月,选型应看 token 效率与真实任务成本,而非参数数字本身。
SECTION 02 从 Grok 4.5 到 4.6、4.7:2026 年 7–9 月时间线与参数对照
| 日期 | 事件 |
|---|---|
| 2026 年 7 月 8 日 | xAI 正式发布 Grok 4.5,定位编程与智能体任务,与 Cursor 合作训练,50 万 token 上下文,定价输入 $2/输出 $6(每百万 token) |
| 2026 年 7 月 16–26 日 | 月之暗面 Kimi K3 从托管服务到完整开源权重(2.8 万亿参数、100 万 token 上下文) |
| 2026 年 7 月 28 日 | 马斯克在 X 回复 Rauch 首次公开 Grok 4.6/4.7 路线图;同日 OpenAI、Anthropic 等 1200 余名员工联署《Pacing the Frontier》公开信 |
| 约 2026 年 8 月 7 日 | Grok 4.6 计划发布,1.5 万亿参数,SFT/RL 大幅升级(官方预告,未发布) |
| 约 2026 年 8 月末–9 月初 | Grok 4.7 计划跟进,2.1 万亿参数,马斯克称其全面优于 4.6 但推理稍慢、token 效率更高 |
| 模型 | 发布/目标时间 | 参数规模 | 定位重点 | 状态 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026 年 4 月 17 日 | 未公开 | 上一代基线 | 已发布 |
| Grok 4.5 | 2026 年 7 月 8 日 | 未公开(非 MoE 单一 SKU) | 编程与智能体,与 Cursor 联合训练 | 已发布 |
| Grok 4.6 | 约 2026 年 8 月 7 日 | 1.5 万亿 | SFT/RL 大幅升级 | 官方预告,未发布 |
| Grok 4.7 | 约 2026 年 8 月末–9 月初 | 2.1 万亿 | 全面优于 4.6,token 效率更高 | 官方预告,未发布 |
参数规模、定价、基准分数均为厂商/马斯克自述,Grok 4.6 与 4.7 目前均未有第三方独立评测数据,表中「官方预告」信息务必以正式发布为准。
SECTION 03 深度拆解:这次升级的重点不是「更大」,而是「更会学」
监督微调(SFT)是用人工标注或精选的高质量样本纠正模型输出习惯;强化学习(RL)则用奖励信号让模型在真实任务链路中学会「怎么做才对」,尤其是多步骤智能体任务。马斯克强调 Grok 4.6 的升级重点在「SFT & RL」而非参数规模本身——Grok 4.5 当时凭借与 Cursor 合作获取的真实开发者会话数据,在保持较小输出 token 消耗的情况下拿到 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成绩,处理同类任务所用输出 token 数量远低于 Claude Opus 4.8(约 1.9 万 token 对 6.7 万 token)。
Grok 4.6 的 1.5 万亿参数相比 Grok 4.5 是明显规模跃升,但马斯克随后补充 Grok 4.7 会更大(2.1 万亿)却「推理稍慢」,暗示 xAI 内部清楚参数规模与推理速度之间存在权衡,未来会用两款不同定位的模型分别满足「更强」和「更快」的需求。
Grok 4.6 的发布时间表恰好卡在 Kimi K3 全面开源引发行业震动之后的第 10 天左右。Kimi K3 在 Frontend Code Arena 编程榜单上以 1679 分登顶,成为首个超越所有闭源模型的开源模型,Artificial Analysis 智能指数综合排名全球第三。马斯克本人也在 Kimi K3 相关评测下留言称「令人印象深刻」。业内普遍解读,xAI 加快 Grok 4.6/4.7 发布节奏,与 OpenAI、Anthropic 及中国厂商的竞争烈度上升直接相关。
| 模型 | 厂商 | 参数规模 | 上下文 | 定价(输入/输出,每百万 token) |
|---|---|---|---|---|
| Grok 4.5 | xAI | 未公开 | 50 万 token | $2 / $6 |
| Grok 4.6(预告) | xAI | 1.5 万亿 | 未公开 | 未公开 |
| Kimi K3 | 月之暗面 | 2.8 万亿(MoE,激活约 16/896 专家) | 100 万 token | $0.30(缓存命中)/$3(缓存未命中)输入,$15 输出 |
| Claude Fable 5.1(传闻) | Anthropic | 未公开 | 未公开 | 传闻维持 Fable 5 定价($10 输入/$50 输出) |
| GPT-5.6 Sol | OpenAI | 未公开 | 未公开 | 未公开 |
表格中 Grok 4.6、Claude Fable 5.1 相关数据均为预告或传闻,不构成正式基准对比,仅供参考发布节奏和大致定位。
SECTION 04 争议点与 2026 年 8 月「扎堆发布月」背景
- 时间表未经第三方验证:目前唯一信息源是马斯克在 X 上的一条回复贴,xAI 官方博客和产品页尚未同步公告;
- 基准分数与定价全部空白:与 Grok 4.5 发布时详细的模型卡、基准表不同,Grok 4.6 目前没有任何独立测评或官方模型卡佐证其能力;
- xAI 内容安全争议:7 月 xAI 对一名用户提起诉讼,指控其利用 Grok 绕过安全限制生成 CSAM,这也是 xAI 首次就 AI 生成的深度伪造内容起诉用户。今年 1 月 Common Sense Media 的报告曾将 Grok 评为「未成年人保护最差的 AI 产品之一」;
- 与行业「减速」呼吁的错位:7 月 28 日马斯克发布 Grok 4.6/4.7 路线图的同一天,OpenAI、Anthropic 等公司 1200 余名员工联署「Pacing the Frontier」公开信,呼吁美国政府建立主动放缓前沿 AI 发展的治理工具,xAI 并未出现在签署名单中。
如果马斯克的时间表成立,Grok 4.6、Grok 4.7 将与传闻中的 Claude Fable 5.1(据 36kr、WinCentral 等多方爆料指向 8 月)在同一个月内相继登场,叠加 7 月已经开源的 Kimi K3 带来的冲击,2026 年 8 月很可能成为大模型发布密度最高的月份之一。对开发者和企业用户而言,选型窗口期极短——上一代旗舰可能刚上线一个月就要面对新一代竞品,性价比和 token 效率(而非单纯的参数规模或跑分)会是更实际的决策依据。
SECTION 05 可引用技术数据与 Grok 4.6 发布前 6 步选型清单
- Grok 4.5 基准(已发布):Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%(xAI 官方模型卡);
- Grok 4.5 token 效率:SWE-Bench Pro 任务平均约 15,954 输出 token,Claude Opus 4.8 约 67,020(第三方整理);
- Grok 4.6 预告参数:1.5 万亿,重点 SFT/RL 升级(马斯克 X 帖子,未经第三方验证);
- Grok 4.7 预告参数:2.1 万亿,全面优于 4.6 但推理稍慢(马斯克 X 帖子);
- Kimi K3 对照:Frontend Code Arena 1679 分、2.8 万亿参数 MoE、100 万 token 上下文(Moonshot 官方);
- Grok 4.5 定价参考:输入 $2/输出 $6 每百万 token(xAI 官方公告)。
- 锁定信息源:关注 xAI 官方博客与 @xai X 账号,勿仅凭二手报道更新生产环境路由;
- 建立基准对照表:在 Grok 4.6 模型卡发布前,用 Grok 4.5 与 Kimi K3 在自有代码库跑 SWE/Agent 任务,记录 token 消耗与成功率;
- 预留 A/B 窗口:8 月首周勿冻结全年 API 合约,为 Grok 4.6、Fable 5.1 传闻窗口留出切换预算;
- 区分「更强」与「更快」SKU:按马斯克表述,4.6 偏均衡、4.7 偏质量——提前规划延迟敏感与质量敏感两条路由;
- 复核安全与合规:评估 xAI 近期 CSAM 诉讼与未成年人保护评级对企业政策的影响;
- 发布当日核对定价:以 xAI 控制台与 API 文档为准,勿沿用 Grok 4.5 价格假设做财务模型。
以下链接为官方与第三方来源,发版后请以最新页面为准:
Elon Musk X 账号(2026 年 7 月 28 日回复 @rauchg)
若你的团队正在 Grok 或 Kimi 等前沿模型上构建 Agent 与 iOS/macOS CI 流水线,虚拟化 Mac 环境在 Xcode 编译、Metal 加速场景下存在性能损耗与兼容性风险。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。更多背景可参考 Grok 4.5 深度评测与 Kimi K3 全面开源。
SECTION 06 常见问题 FAQ
Grok 4.6 具体是哪天发布?
马斯克表示「大约 8 月 7 日」,但这是非正式表态,并非 xAI 官方确认的发布日期,实际时间可能提前或延后。
Grok 4.6 和 Grok 4.7 有什么区别?
Grok 4.6 为 1.5 万亿参数,重点是 SFT 与 RL 后训练升级;Grok 4.7 为 2.1 万亿参数,预计在 4.6 发布后「几周」跟进,马斯克称其能力全面优于 4.6,但推理速度略慢,token 效率更高。
Grok 4.6 会比 Kimi K3 或 Claude Fable 5.1 更强吗?
目前无法判断。Grok 4.6 没有任何公开基准分数,Kimi K3 已有实测数据且在部分编程榜单上表现突出,Claude Fable 5.1 本身尚未被 Anthropic 官方确认发布,三者暂无法直接对比。
Grok 4.6 大概会怎么定价?
官方未公布。可参考 Grok 4.5 的定价(输入 $2/输出 $6,每百万 token)作为大致区间,但新一代模型定价可能调整,务必以正式发布信息为准。
普通用户届时能在哪里用上 Grok 4.6?
按 Grok 4.5 的分发路径推测,大概率会先上线 Grok Build、xAI 官方 API 和控制台,随后逐步接入更多第三方平台,但具体入口以正式发布公告为准。