首页 / 博客 / Opus 5 · K3
ENGINEERING_BLOG · 2026.07.25

Claude Opus 5 价格减半逼近旗舰实力,
Kimi K3 却陷「自称 Claude」蒸馏门

2026 年 7 月第四周,AI 开发者与企业技术决策者同时面对两件大事:Claude Opus 5 以与上一代相同的价格实现接近 Fable 5 的智能水平;Kimi K3 则在白宫公开指控与独立研究者「K3 自称是 Claude」的技术证据之间陷入舆论风暴。本文完整涵盖:Opus 5 vs Fable 5 定价与基准对照、K3 2.8T 参数规格、蒸馏门时间线、专家反驳与 Greenblatt 统计分析、开发者 6 步选型清单、可引用硬核数据与 FAQ,帮助你在「性价比战争」中做出可落地的模型决策。

SECTION 01 2026 年中模型选型痛点:性价比、合规与能力来源三重焦虑

Frontier 模型几乎每月一更,但工程团队落地时面临的矛盾并未减少——本周两件事恰好把三类焦虑推到了台前:

  • 性价比焦虑:Fable 5、GPT-5.6 Sol 能力顶尖,但 token 单价让日常 Agent 与 CI 流水线难以承受;
  • 合规与数据留存:旗舰模型往往要求 30 天数据留存协议,金融、医疗、政企场景门槛陡增;
  • 能力来源不透明:开源模型以「半价追平闭源」为卖点时,蒸馏指控与地缘风险成为选型隐性成本——Kimi K3 开源权重K3 深度评测已讨论过规格,但蒸馏门是全新变量。

本周两条新闻的共同主题:谁能在可接受的价格下交付 frontier 级智能——以及,这种智能的可信来源是什么。

SECTION 02 Claude Opus 5 发布:和 Fable 5 比到底值不值得切换?

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用这一最强 Opus 档位。定价与 Opus 4.8 完全相同,性能却出现「跳级」。

Claude Opus 5 vs Fable 5 核心对照(2026-07-24 发布数据)
维度 Claude Opus 5 Claude Fable 5
输入 / 输出定价 $5 / $25 每百万 tokens 约 $10 / $50 每百万 tokens
上下文窗口 100 万 tokens(默认唯一档位) 100 万 tokens
CursorBench 3.2(max effort) 与 Fable 5 峰值相差 0.5% 峰值基准
Frontier-Bench v0.1 超越所有模型,为 Opus 4.8 两倍以上
数据留存政策 默认访问不强制数据留存 需接受 30 天数据留存协议
Claude Max 默认模型 是(2026-07-24 起)
结论 日常 Agent / 编程场景:Opus 5 约为半价、性能损失极小;极限双用途安全能力仍由 Mythos 5 占据

除编程外,Opus 5 在结构生物学、有机化学、生物信息学等科研场景全面超过 Opus 4.8——光谱反推分子结构内部测试提升 10.2 个百分点,蛋白质序列变异功能预测提升 7.7 个百分点。企业客户 Box 报告数据分析工作流提升 11%,尽职调查场景提升 17%。

安全方面,Anthropic 自动化行为审计显示 Opus 5 是迄今为止最对齐的一代——欺骗行为发生率最低,最不容易被诱导滥用。但在网络安全攻击、生物安全等高风险双用途能力上,Anthropic 故意未让 Opus 5 冲到最前,该位置仍由受限发行的 Mythos 5 占据。Opus 5 的网络安全分类器触发频率比 Fable 5 低约 85%,可用于源码级漏洞发现,但仍屏蔽二进制漏洞扫描、渗透测试与 exploit 生成。

SECTION 03 Kimi K3 蒸馏门:白宫指控、时间线争议与社区反应

与 Opus 5 平稳有序的发版形成对照,Kimi K3 在 7 月 16 日 API 上线后迅速卷入地缘政治与技术伦理双重争议。

Kimi K3 核心规格与官方基准(Moonshot AI,2026-07-16)
项目 数据
总参数量 2.8 万亿(全球首个 3T 级开源模型)
架构 稀疏 MoE:896 专家 / token 激活 16(约 500 亿激活参数);KDA + Attention Residuals
上下文 100 万 tokens,原生视觉理解
GPQA-Diamond 93.5%(发布时开源模型最高)
BrowseComp 91.2%(发布时最高)
完整权重开源 承诺 2026-07-27(撰稿时尚未放出)

2026 年 7 月 22–23 日,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提及涉嫌使用未获出口许可的 Nvidia GB300 芯片。财政部长 Scott Bessent 随后称「在很多中国模型上发现了美国大模型的水印」。

这并非空穴来风——早在 2026 年 2 月,Anthropic 已公开点名月之暗面、DeepSeek、MiniMax,称检测到超过 340 万次异常 API 交互,怀疑是「刻意的能力提取」,并称已通过请求元数据追踪到部分行为与月之暗面高层有关。

但 TechCrunch 采访的多位独立研究者对「两周内蒸馏出 K3」持强烈怀疑。Snorkel AI 联合创始人 Braden Hancock 直言:Fable 5 从 7 月 1 日才公开可用,到 K3 发布仅两周,不可能完成深度蒸馏、训练并发布。Allen Institute for AI 研究员 Nathan Lambert 也认为,随着中国模型逼近前沿,简单监督微调式蒸馏的边际收益正在变小,真正拉开差距的是强化学习训练。

连 Elon Musk 都曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型——「蒸馏」本身并不违法,争议核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定。

SECTION 04 Kimi K3 自称是 Claude:Greenblatt 统计证据为何值得关注?

整个蒸馏门里最具技术含金量的发现来自 Redwood Research 首席科学家 Ryan Greenblatt(2026 年 7 月 24 日前后发布,GitHub:rgreenblatt/which_claude_is_k3)。他对多个模型在被问及「你是谁」时的身份自认行为做了交叉熵对比。

  • 异常高频自称 Claude:Kimi K3 在被问及身份时,异常高频地自称是 Claude,而非 Kimi;
  • 吐出内部部署 ID:例如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929——真正的 Claude 模型自己都不会这样准确地报出这些内部版本号
  • 逐代追新规律:K2 的信号指向 Claude Sonnet 4(2025 年中),K3 则指向 Opus 4.5(2025 年末),而非当前 Fable/Mythos 系列;
  • Greenblatt 解读:模型说出「教师模型」部署元数据比教师模型自己还准,很难用「模仿对话风格」解释,更可能指向训练数据混入了带部署元数据标注的 Claude 数据(如 API 日志或打标合成数据)。

Greenblatt 本人强调:这些发现不能直接证明蒸馏发生——身份混淆也可能来自数据污染、系统提示词泄露或公开数据集合成样本。但结合 Anthropic 2 月指控与本次统计规律,这是「蒸馏说」迄今最接地气的技术支撑,而不只是政治喊话。

SECTION 05 开发者 6 步决策清单:Opus 5、Fable 5 还是 Kimi K3?

  1. 明确工作负载类型:日常 Agent / 编程优先评估 Opus 5;极限科研或双用途安全场景才考虑 Fable 5 / Mythos 5;极限成本 + 可接受合规风险才评估 K3 API 或等 7 月 27 日权重自部署。
  2. 核对数据留存与合规条款:Opus 5 默认不强制数据留存;Fable 5 / Mythos 5 需 30 天留存协议;K3 自部署可完全离线,但 API 端仍须评估供应商政策与地缘风险。
  3. 跑一轮真实任务基准:用自家代码库、文档 RAG、自动化脚本三类任务实测,勿只看公开 leaderboard——CursorBench、Frontier-Bench 与 Zapier AutomationBench 仅作参考。
  4. 评估 token economics:Opus 5 约为 Fable 5 半价;K3 API 定价低于两者但需计入 fallback 与审查策略差异;可用 OpenRouter 统一网关做 A/B 切换降低集成成本。
  5. 追踪 K3 权重发布与独立复现:7 月 27 日后关注 Hugging Face 权重、社区 benchmark 复现与架构验证——在独立验证前,K3 能力仍属「官方自评 + 外部猜测」。
  6. 制定供应商风险预案:对蒸馏指控敏感的企业应文档化模型来源决策;准备 Anthropic / OpenAI / 开源三套 fallback 路由,避免单点政策或地缘事件中断生产流水线。

SECTION 06 可引用技术数据、权威信源与性价比趋势判断

  • Opus 5 定价:输入 $5 / 输出 $25 每百万 tokens,与 Opus 4.8 相同;Fast 模式约 2.5 倍速、2 倍价。
  • Opus 5 ARC-AGI 3:得分为「次优模型」的 3 倍;OSWorld 2.0 用不到 Fable 5 三分之一成本超过 Fable 5 最佳成绩。
  • K3 参数量:2.8T 总参数,896 专家 MoE,每 token 激活 16 专家(约 500 亿激活参数)。
  • Anthropic 2 月指控规模:月之暗面相关异常 API 交互超过 340 万次。
  • 时间线关键窗口:Fable 5 公开可用 2026-07-01 → K3 发布 2026-07-16 → 白宫指控 2026-07-22/23 → Greenblatt 分析 2026-07-24 → K3 权重承诺 2026-07-27。

以下权威来源可在发版后再次打开链接核对细节:

Anthropic 官方:Claude Opus 5 发布说明

TechCrunch:独立研究者质疑 K3 蒸馏时间线

Ryan Greenblatt:Kimi K3 身份自认统计分析(GitHub)

把两件事连起来看,2026 年中 AI 竞争的主战场已是性价比:Opus 5 用「半价逼近旗舰」回应闭源市场;K3 用「开源 + 低价 + 少拒答」冲击边界;蒸馏争议则是对「低价能力究竟来自工程优化还是能力提取」的公开摊牌。

对需要整合 LLM Agent、Xcode 编译链与 macOS CI/CD 的团队,纯 API 选型无法替代三类现实需求:① 本地 Metal / Core ML 编译验证;② 7×24 无人值守 Agent 流水线;③ 合规场景下的物理级隔离运行环境。虚拟机跑 macOS CI 存在 Hypervisor 损耗与签名链兼容问题,本地 Mac 关机即断流。对于需要零损耗原生 Apple 算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理 Mac 节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。可参考Mac Mini M4 租 vs 买费用对比OpenRouter 多模型接入教程

SECTION 07 常见问题 FAQ

Claude Opus 5 比 Claude Fable 5 便宜多少?

在相同 token 单价结构下,Opus 5 约为 Fable 5 价格的一半(Fable 5 约为 $10/$50 每百万输入/输出 token,Opus 5 维持 $5/$25),同时在 CursorBench 3.2 max effort 档位与 Fable 5 峰值成绩相差不到 1%。

Claude Opus 5 现在是 Claude Max 的默认模型吗?

是的,2026 年 7 月 24 日发布当天起 Opus 5 成为 Claude Max 的默认模型,也是 Claude Pro 用户可以使用的最强版本。

Kimi K3 真的蒸馏了 Claude 吗?

截至本文发布,这仍是一个有争议、未被最终证实的指控。白宫指控缺乏公开证据;独立专家认为两周内完成深度蒸馏不现实;但 Ryan Greenblatt 发现的「K3 自称是 Claude 并吐出内部版本号」是目前最具技术含量的间接证据。

Kimi K3 的完整权重什么时候能下载?

官方承诺 2026 年 7 月 27 日放出完整权重。本文发布时外部研究者尚无法完全独立验证架构细节与 benchmark 复现。

为什么 Kimi K3 会自称是 Claude?

Greenblatt 的统计分析显示 K3 在被问身份时会异常高频自称 Claude,甚至吐出 Claude 内部部署 ID 字符串——比 Claude 模型自身报出的还准确。这更可能指向训练数据混入了带部署元数据的 Claude 数据,但 Greenblatt 强调不能直接证明蒸馏发生。