Claude Opus 5 半价逼近旗舰实力,
Kimi K3 却陷「自称 Claude」蒸馏门

本周 AI 圈两件大事看似无关,却都指向同一主题——性价比模型能力的真实来源:2026-07-24 Anthropic 发布日常主力 Claude Opus 5,同日成为 Claude Max 默认模型;而 7 月 16 日刚发布的 Kimi K3 则遭白宫公开指控「产业级蒸馏」,独立研究者更发现 K3 会自称是 Claude 并吐出内部部署版本号。

本文面向正在评估 Claude / Kimi API 选型、关注大模型争议与合规风险的开发者与技术决策者,严格依据 Anthropic 官方发布、Moonshot 技术博客、TechCrunch 专家采访与 Ryan Greenblatt 统计分析,回答三件事:Opus 5 相对 Fable 5 值不值得换、K3 蒸馏指控哪些可验证哪些仍是猜测、以及你的 Agent 工作流现在该怎么落地。

01 Claude Opus 5 发布:价格没变,性能跳级,Claude Max 默认模型

选型前的真实痛点:

  • Fable 5 太贵:旗舰智能强,但 $10/$50 每百万输入/输出 token 让日常 Agent 成本难以承受。
  • Opus 4.8 不够用:上一代 Opus 在 CursorBench、Frontier-Bench 等硬任务上明显落后新一代旗舰。
  • 数据留存门槛:Fable 5 / Mythos 5 要求接受 30 天数据留存政策,合规敏感团队被挡在门外。
  • 模型 ID 混乱:API、Bedrock、Vertex、Foundry 多平台并存,须确认统一 ID 为 claude-opus-5

2026-07-24(美国太平洋时间),Anthropic 正式发布 Claude Opus 5:定位「日常主力模型」,官方称接近旗舰 Fable 5 智能水平,价格为 Fable 5 的一半。定价与 Opus 4.8 完全相同——输入 $5 / 百万 tokens,输出 $25 / 百万 tokens;上下文窗口 100 万 tokens(默认且唯一档位);最大输出 128K tokens;Thinking 默认开启,Effort 参数控制思考量。

Claude Opus 5 关键规格(来源:Anthropic 官方发布)
项目 Claude Opus 5 对比说明
定价(输入/输出) $5 / $25 每百万 tokens 与 Opus 4.8 相同,约为 Fable 5 一半
上下文窗口 100 万 tokens 默认且唯一档位
平台可用性 Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry 模型 ID:claude-opus-5
产品定位 Claude Max 默认模型;Claude Pro 最强可用版本 信号:Anthropic 押注日常主力而非仅旗舰
数据留存 默认访问不强制数据留存 Fable 5 / Mythos 5 需接受 30 天留存政策
Fast 模式 速度约 2.5×,价格 2× 与 Opus 4.8 策略一致

官方基准亮点(发版后请以 Anthropic 新闻页再次核对):

  • Frontier-Bench v0.1:软件工程任务超越所有模型,性能为 Opus 4.8 的两倍以上,单任务成本更低。
  • CursorBench 3.2:max effort 档位与 Fable 5 峰值相差仅 0.5%,成本为 Fable 5 一半;high / xhigh / max 档「性价比」超市面所有模型。
  • ARC-AGI 3:新颖问题解决得分为次优模型的 3 倍
  • OSWorld 2.0:任意成本下优于其他模型;用不到 Fable 5 三分之一成本超过 Fable 5 最佳成绩。
  • Zapier AutomationBench:端到端商业自动化通过率约为次优模型 1.5 倍;最低 effort 档仍超任何其他模型;某工作流 Opus 5 达 100% 通过率。

对齐与安全:自动化行为审计显示 Opus 5 是迄今最对齐的 Claude 模型——欺骗行为最低、最难被诱导滥用。但在网络安全攻击、生物安全等「高风险双用途能力」上,Anthropic 故意未让 Opus 5 刷新前沿,该位置仍由受限发行的 Mythos 5 占据。网络安全分类器比 Fable 5 宽松约 85%,可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描、渗透测试、exploit 生成。

客户反馈摘录:Cursor 团队称 Opus 5「接近 Fable 5 智能、Opus 速度与成本」;Zapier 称其在 AutomationBench 登顶且 token 消耗未超以往 Claude 模型;Box 报告数据分析工作流提升 11%、尽职调查提升 17%、整体准确率 8%

官方发布与第三方报道以链接为准,发版后请再次打开核对。

https://www.anthropic.com/news/claude-opus-5

02 Kimi K3 蒸馏门:白宫下场指控,专家质疑时间线不够

如果说 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面 2026-07-16 发布 Kimi K3:总参数 2.8 万亿(2.8T),全球首个进入「3T 级」的开源模型;稀疏 MoE,896 专家中每 token 激活 16 个(约等效 500 亿激活参数);100 万 token 上下文 + 原生视觉理解;基于 Kimi Delta Attention(KDA)+ Attention Residuals + Stable LatentMoE。完整权重承诺 2026-07-27 放出——争议爆发时外部尚无法独立验证。

关于 K3 架构与基准的完整解读,可参阅本站此前深度评测:Kimi K3 深度评测

Kimi K3 蒸馏门时间线
日期 事件
2026-02 Anthropic 首次公开指控月之暗面 / DeepSeek / MiniMax「产业级蒸馏攻击」,称检测到月之暗面超 340 万次异常 API 交互
2026-07-01 Claude Fable 5 面向公众正式可用
2026-07-16 Kimi K3 API/产品正式发布
2026-07-22/23 白宫 OSTP 主任 Michael Kratsios 在 X 指控月之暗面「大规模、隐蔽的产业级蒸馏」+ 涉嫌使用未获出口许可的 Nvidia GB300 芯片
2026-07-23 TechCrunch 刊发多位独立研究者质疑蒸馏说的报道
2026-07-24 左右 Ryan Greenblatt 发布「K3 自称 Claude」统计证据(GitHub: rgreenblatt/which_claude_is_k3)
2026-07-27(计划) Kimi K3 完整权重开源,外部可独立验证

2026-07-22/23,白宫科技政策办公室(OSTP)主任 Michael Kratsios 公开发文,指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提到涉嫌使用未获出口许可的 Nvidia GB300(Grace Blackwell 300)芯片,可能经泰国服务器间接获取。财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的水印」,但财政部未说明「水印」具体指什么。Kratsios 未公开支撑指控的具体证据;月之暗面对训练过程质询未予回应。

TechCrunch(7 月 23 日)采访多位独立研究者,普遍对「蒸馏说」存疑。Snorkel AI 联合创始人 Braden Hancock 直言:Fable 5 从 7 月 1 日才公开可用,到 K3 发布(7 月 16 日)只有两周,不可能在两周内蒸馏足够数据、训练完模型并发布。Allen Institute for AI 研究员 Nathan Lambert 认为,随着中国模型逼近前沿,简单监督微调式蒸馏边际收益变小,真正拉开差距的是强化学习训练——若蒸馏真这么好用,追赶者早该靠蒸馏追平 GLM 或 K3,但事实并非如此。

「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」—— Michael Kratsios,白宫 OSTP 主任

背景:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见。「蒸馏」本身并不必然违法,核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定——这也是 Anthropic 2 月指控与本次白宫喊话的共同焦点。

03 Kimi K3 自称是 Claude?Ryan Greenblatt 发现的最硬核技术证据

整个事件里最具技术含金量、也最适合做深度内容的角度:Redwood Research 首席科学家 Ryan Greenblatt 在 2026-07-24 左右发布统计分析,对多个模型被问「你是谁」时的身份自认行为做交叉熵对比。

  • 异常高频自称 Claude:Kimi K3 在被问及身份时,会异常高频地自称是 Claude,甚至会吐出 Claude 官方内部部署 ID 字符串,例如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 比真 Claude 还准:真正的 Claude Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不会主动报出这类内部版本号,或只会报出旧的错误版本号——教师模型自己都没有 K3 说得准
  • 逐代追新规律:K3 自称的身份锁定在「Claude 4.5 时代」(2025 年末),而非当前 Fable/Mythos 系列;上一代 K2 的信号指向更早的 Claude Sonnet 4(2025 年中),呈现「一代蒸一代、逐代追新」的规律。
  • Greenblatt 的解读:模型说出教师模型部署元数据比教师自己还准确,很难用「单纯模仿对话风格」解释,更可能指向训练数据里混入了带有部署元数据标注的 Claude 数据(如 API 日志或打标合成数据)——这是一种更具体、更难辩解的蒸馏形式。
  • 重要澄清:Greenblatt 强调这些发现不能直接证明蒸馏发生;身份混淆也可能来自训练数据污染、系统提示词泄露或公开数据集合成样本。但结合 Anthropic 2 月指控,这是迄今比「白宫喊话」更扎实的技术支撑。

分析代码与 writeup 以 Greenblatt GitHub 仓库为准,发版后请再次打开核对。

https://github.com/rgreenblatt/which_claude_is_k3

社区反应(Reddit r/LocalLLaMA 等)呈现三种声音:欢呼「开源与闭源差距缩短到几天而非几个月」;调侃「2.8T 参数几乎没人能在本地跑」;务实派认为 K3 真正卖点是低价 + 更少内容审查,而非「打败 Fable 5」。在 7 月 27 日权重放出前,架构细节与基准均无法被外部完全独立验证——这也是舆论持续发酵的原因。

04 Claude Opus 5 vs Fable 5 vs Kimi K3:选型决策矩阵

三模型关键维度对比(2026-07-25 发稿时)
维度 Claude Opus 5 Claude Fable 5 Kimi K3
输入/输出定价(每百万 tokens) $5 / $25 约 $10 / $50 约 $3 / $15(API,见 K3 评测文)
相对 Fable 5 编程能力 CursorBench 峰值差 0.5% 基准参照 官方称整体仅次于 Fable 5 与 GPT-5.6 Sol
上下文 100 万 tokens 100 万 tokens 100 万 tokens + 原生视觉
数据留存政策 默认不强制留存 需接受 30 天留存 依 Moonshot 政策(见官方文档)
开源权重 闭源 闭源 2026-07-27 承诺放出
合规/地缘风险 低(Anthropic 美系闭源) 低,但留存门槛高 高(蒸馏指控 + 芯片出口管制舆论)
适合场景 日常 Agent、编程、企业合规敏感 极限智能、可接受留存与高价 极限成本、开源可控、可接受争议未澄清

两件事连起来看:Opus 5 用「半价逼近旗舰」回应性价比诉求;Kimi K3 用「开源 + 低价 + 少拒答」冲击市场;围绕 K3 的争议,本质是各家在性价比战争里对「低价究竟来自工程优化还是白嫖别人模型」的公开摊牌。

05 开发者六步落地:评估 Opus 5 升级与 K3 争议下的 API 策略

  1. 核对 Claude 控制台默认模型:Claude Max / Pro 用户登录后确认默认已切换为 Opus 5;API 调用将模型 ID 更新为 claude-opus-5,在 Bedrock / Vertex / Foundry 控制台同步检查别名映射。
  2. 跑 CursorBench 等价回归:用你生产环境代表性的 10–20 个 Agent 任务(代码审查、多文件重构、CI 脚本生成)对比 Opus 4.8 / Opus 5 / Fable 5 的通过率与 token 成本,记录 effort 档位对质量的影响。
  3. 评估数据留存条款:若此前因 Fable 5 的 30 天留存政策未升级,Opus 5 的默认不强制留存可能是解锁企业场景的关键——与法务确认 Anthropic 当前 DPA 与服务条款。
  4. 暂勿把 K3 当唯一生产后端:在 7 月 27 日权重开源且第三方复现基准前,将 K3 限于实验分支;合规敏感客户应文档化「蒸馏指控未澄清」的风险说明。
  5. 复现 Greenblatt 身份测试(可选):对 K3 与 Claude 各型号发送标准化「你是谁」prompt 集,记录是否吐出 claude-opus-4-5-* 类内部 ID——作为内部风控与供应商尽职调查的一手材料。
  6. Gateway 与 Agent 部署在 7×24 主机:无论后端选 Opus 5、Fable 5 还是经 OpenRouter 多模型路由,Cursor / OpenClaw / 自研 Agent 的 Gateway 进程应跑在不会休眠的 macOS 裸金属上,避免笔记本合盖导致定时任务与 webhook 中断。

06 可引用技术数据、FAQ 与生产环境收束

  • Opus 5 光谱反推分子结构:相对 Opus 4.8 内部评测提升 10.2 个百分点(Anthropic 生命科学评测)。
  • 蛋白质序列变异功能预测:Opus 5 比 Opus 4.8 高 7.7 个百分点
  • Kimi K3 GPQA-Diamond:93.5%,发布时开源模型最高分(Moonshot 官方)。
  • Anthropic 2 月蒸馏指控:称识别月之暗面超 340 万次异常 API 交互,部分行为追踪至高层(Anthropic 公开声明,月之暗面未正面回应)。

Opus 5 输入 $5/百万 tokens、输出 $25/百万 tokens,约为 Fable 5($10/$50)的一半;CursorBench 3.2 峰值与 Fable 5 相差不到 0.5%。

是的,2026-07-24 发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。

截至本文发布仍属未证实的争议。白宫指控缺乏公开证据;独立专家认为两周时间线难以完成深度蒸馏;Ryan Greenblatt 发现 K3 高频自称 Claude 并吐出内部部署 ID,是目前最具技术含量的间接证据,但不能直接证明蒸馏。

Moonshot 官方承诺 2026-07-27 放出;本文发布时外部研究者尚无法完全独立验证架构与跑分。

对普通开发者与企业用户:先看场景,再看立场。合规、数据留存、供应链风险敏感 → Opus 5「价格没涨、能力跳级」性价比很高;极限成本与开源可控、可接受争议未澄清 → 等 7 月 27 日 K3 权重放出后再实测。

无论选 Opus 5 还是多模型 Gateway,本地笔记本跑 7×24 Agent 都有休眠断连、DerivedData 与日志撑爆磁盘、多人协作权限混乱等隐性成本。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,CALMVPS 的 Mac Mini 裸金属租赁通常是更优解:独占 Apple Silicon、120 秒交付、按月弹性下单,Gateway 与 CI Runner 可长期在线而不依赖个人电脑。

延伸阅读:Claude Fable 5 出口管制与替代方案 · Kimi K3 架构与基准深度评测