本周 AI 圈两件大事看似无关,却都指向同一主题——性价比与模型能力的真实来源:2026-07-24 Anthropic 发布日常主力 Claude Opus 5,同日成为 Claude Max 默认模型;而 7 月 16 日刚发布的 Kimi K3 则遭白宫公开指控「产业级蒸馏」,独立研究者更发现 K3 会自称是 Claude 并吐出内部部署版本号。
本文面向正在评估 Claude / Kimi API 选型、关注大模型争议与合规风险的开发者与技术决策者,严格依据 Anthropic 官方发布、Moonshot 技术博客、TechCrunch 专家采访与 Ryan Greenblatt 统计分析,回答三件事:Opus 5 相对 Fable 5 值不值得换、K3 蒸馏指控哪些可验证哪些仍是猜测、以及你的 Agent 工作流现在该怎么落地。
01 Claude Opus 5 发布:价格没变,性能跳级,Claude Max 默认模型
选型前的真实痛点:
- Fable 5 太贵:旗舰智能强,但 $10/$50 每百万输入/输出 token 让日常 Agent 成本难以承受。
- Opus 4.8 不够用:上一代 Opus 在 CursorBench、Frontier-Bench 等硬任务上明显落后新一代旗舰。
- 数据留存门槛:Fable 5 / Mythos 5 要求接受 30 天数据留存政策,合规敏感团队被挡在门外。
- 模型 ID 混乱:API、Bedrock、Vertex、Foundry 多平台并存,须确认统一 ID 为
claude-opus-5。
2026-07-24(美国太平洋时间),Anthropic 正式发布 Claude Opus 5:定位「日常主力模型」,官方称接近旗舰 Fable 5 智能水平,价格为 Fable 5 的一半。定价与 Opus 4.8 完全相同——输入 $5 / 百万 tokens,输出 $25 / 百万 tokens;上下文窗口 100 万 tokens(默认且唯一档位);最大输出 128K tokens;Thinking 默认开启,Effort 参数控制思考量。
| 项目 | Claude Opus 5 | 对比说明 |
|---|---|---|
| 定价(输入/输出) | $5 / $25 每百万 tokens | 与 Opus 4.8 相同,约为 Fable 5 一半 |
| 上下文窗口 | 100 万 tokens | 默认且唯一档位 |
| 平台可用性 | Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry | 模型 ID:claude-opus-5 |
| 产品定位 | Claude Max 默认模型;Claude Pro 最强可用版本 | 信号:Anthropic 押注日常主力而非仅旗舰 |
| 数据留存 | 默认访问不强制数据留存 | Fable 5 / Mythos 5 需接受 30 天留存政策 |
| Fast 模式 | 速度约 2.5×,价格 2× | 与 Opus 4.8 策略一致 |
官方基准亮点(发版后请以 Anthropic 新闻页再次核对):
- Frontier-Bench v0.1:软件工程任务超越所有模型,性能为 Opus 4.8 的两倍以上,单任务成本更低。
- CursorBench 3.2:max effort 档位与 Fable 5 峰值相差仅 0.5%,成本为 Fable 5 一半;high / xhigh / max 档「性价比」超市面所有模型。
- ARC-AGI 3:新颖问题解决得分为次优模型的 3 倍。
- OSWorld 2.0:任意成本下优于其他模型;用不到 Fable 5 三分之一成本超过 Fable 5 最佳成绩。
- Zapier AutomationBench:端到端商业自动化通过率约为次优模型 1.5 倍;最低 effort 档仍超任何其他模型;某工作流 Opus 5 达 100% 通过率。
对齐与安全:自动化行为审计显示 Opus 5 是迄今最对齐的 Claude 模型——欺骗行为最低、最难被诱导滥用。但在网络安全攻击、生物安全等「高风险双用途能力」上,Anthropic 故意未让 Opus 5 刷新前沿,该位置仍由受限发行的 Mythos 5 占据。网络安全分类器比 Fable 5 宽松约 85%,可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描、渗透测试、exploit 生成。
客户反馈摘录:Cursor 团队称 Opus 5「接近 Fable 5 智能、Opus 速度与成本」;Zapier 称其在 AutomationBench 登顶且 token 消耗未超以往 Claude 模型;Box 报告数据分析工作流提升 11%、尽职调查提升 17%、整体准确率 8%。
官方发布与第三方报道以链接为准,发版后请再次打开核对。
02 Kimi K3 蒸馏门:白宫下场指控,专家质疑时间线不够
如果说 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面 2026-07-16 发布 Kimi K3:总参数 2.8 万亿(2.8T),全球首个进入「3T 级」的开源模型;稀疏 MoE,896 专家中每 token 激活 16 个(约等效 500 亿激活参数);100 万 token 上下文 + 原生视觉理解;基于 Kimi Delta Attention(KDA)+ Attention Residuals + Stable LatentMoE。完整权重承诺 2026-07-27 放出——争议爆发时外部尚无法独立验证。
关于 K3 架构与基准的完整解读,可参阅本站此前深度评测:Kimi K3 深度评测。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次公开指控月之暗面 / DeepSeek / MiniMax「产业级蒸馏攻击」,称检测到月之暗面超 340 万次异常 API 交互 |
| 2026-07-01 | Claude Fable 5 面向公众正式可用 |
| 2026-07-16 | Kimi K3 API/产品正式发布 |
| 2026-07-22/23 | 白宫 OSTP 主任 Michael Kratsios 在 X 指控月之暗面「大规模、隐蔽的产业级蒸馏」+ 涉嫌使用未获出口许可的 Nvidia GB300 芯片 |
| 2026-07-23 | TechCrunch 刊发多位独立研究者质疑蒸馏说的报道 |
| 2026-07-24 左右 | Ryan Greenblatt 发布「K3 自称 Claude」统计证据(GitHub: rgreenblatt/which_claude_is_k3) |
| 2026-07-27(计划) | Kimi K3 完整权重开源,外部可独立验证 |
2026-07-22/23,白宫科技政策办公室(OSTP)主任 Michael Kratsios 公开发文,指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提到涉嫌使用未获出口许可的 Nvidia GB300(Grace Blackwell 300)芯片,可能经泰国服务器间接获取。财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的水印」,但财政部未说明「水印」具体指什么。Kratsios 未公开支撑指控的具体证据;月之暗面对训练过程质询未予回应。
TechCrunch(7 月 23 日)采访多位独立研究者,普遍对「蒸馏说」存疑。Snorkel AI 联合创始人 Braden Hancock 直言:Fable 5 从 7 月 1 日才公开可用,到 K3 发布(7 月 16 日)只有两周,不可能在两周内蒸馏足够数据、训练完模型并发布。Allen Institute for AI 研究员 Nathan Lambert 认为,随着中国模型逼近前沿,简单监督微调式蒸馏边际收益变小,真正拉开差距的是强化学习训练——若蒸馏真这么好用,追赶者早该靠蒸馏追平 GLM 或 K3,但事实并非如此。
「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」—— Michael Kratsios,白宫 OSTP 主任
背景:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见。「蒸馏」本身并不必然违法,核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定——这也是 Anthropic 2 月指控与本次白宫喊话的共同焦点。
03 Kimi K3 自称是 Claude?Ryan Greenblatt 发现的最硬核技术证据
整个事件里最具技术含金量、也最适合做深度内容的角度:Redwood Research 首席科学家 Ryan Greenblatt 在 2026-07-24 左右发布统计分析,对多个模型被问「你是谁」时的身份自认行为做交叉熵对比。
- 异常高频自称 Claude:Kimi K3 在被问及身份时,会异常高频地自称是 Claude,甚至会吐出 Claude 官方内部部署 ID 字符串,例如
claude-opus-4-5-20250929、claude-sonnet-4-5-20250929。 - 比真 Claude 还准:真正的 Claude Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不会主动报出这类内部版本号,或只会报出旧的错误版本号——教师模型自己都没有 K3 说得准。
- 逐代追新规律:K3 自称的身份锁定在「Claude 4.5 时代」(2025 年末),而非当前 Fable/Mythos 系列;上一代 K2 的信号指向更早的 Claude Sonnet 4(2025 年中),呈现「一代蒸一代、逐代追新」的规律。
- Greenblatt 的解读:模型说出教师模型部署元数据比教师自己还准确,很难用「单纯模仿对话风格」解释,更可能指向训练数据里混入了带有部署元数据标注的 Claude 数据(如 API 日志或打标合成数据)——这是一种更具体、更难辩解的蒸馏形式。
- 重要澄清:Greenblatt 强调这些发现不能直接证明蒸馏发生;身份混淆也可能来自训练数据污染、系统提示词泄露或公开数据集合成样本。但结合 Anthropic 2 月指控,这是迄今比「白宫喊话」更扎实的技术支撑。
分析代码与 writeup 以 Greenblatt GitHub 仓库为准,发版后请再次打开核对。
https://github.com/rgreenblatt/which_claude_is_k3
社区反应(Reddit r/LocalLLaMA 等)呈现三种声音:欢呼「开源与闭源差距缩短到几天而非几个月」;调侃「2.8T 参数几乎没人能在本地跑」;务实派认为 K3 真正卖点是低价 + 更少内容审查,而非「打败 Fable 5」。在 7 月 27 日权重放出前,架构细节与基准均无法被外部完全独立验证——这也是舆论持续发酵的原因。
04 Claude Opus 5 vs Fable 5 vs Kimi K3:选型决策矩阵
| 维度 | Claude Opus 5 | Claude Fable 5 | Kimi K3 |
|---|---|---|---|
| 输入/输出定价(每百万 tokens) | $5 / $25 | 约 $10 / $50 | 约 $3 / $15(API,见 K3 评测文) |
| 相对 Fable 5 编程能力 | CursorBench 峰值差 0.5% | 基准参照 | 官方称整体仅次于 Fable 5 与 GPT-5.6 Sol |
| 上下文 | 100 万 tokens | 100 万 tokens | 100 万 tokens + 原生视觉 |
| 数据留存政策 | 默认不强制留存 | 需接受 30 天留存 | 依 Moonshot 政策(见官方文档) |
| 开源权重 | 闭源 | 闭源 | 2026-07-27 承诺放出 |
| 合规/地缘风险 | 低(Anthropic 美系闭源) | 低,但留存门槛高 | 高(蒸馏指控 + 芯片出口管制舆论) |
| 适合场景 | 日常 Agent、编程、企业合规敏感 | 极限智能、可接受留存与高价 | 极限成本、开源可控、可接受争议未澄清 |
两件事连起来看:Opus 5 用「半价逼近旗舰」回应性价比诉求;Kimi K3 用「开源 + 低价 + 少拒答」冲击市场;围绕 K3 的争议,本质是各家在性价比战争里对「低价究竟来自工程优化还是白嫖别人模型」的公开摊牌。
05 开发者六步落地:评估 Opus 5 升级与 K3 争议下的 API 策略
- 核对 Claude 控制台默认模型:Claude Max / Pro 用户登录后确认默认已切换为 Opus 5;API 调用将模型 ID 更新为
claude-opus-5,在 Bedrock / Vertex / Foundry 控制台同步检查别名映射。 - 跑 CursorBench 等价回归:用你生产环境代表性的 10–20 个 Agent 任务(代码审查、多文件重构、CI 脚本生成)对比 Opus 4.8 / Opus 5 / Fable 5 的通过率与 token 成本,记录 effort 档位对质量的影响。
- 评估数据留存条款:若此前因 Fable 5 的 30 天留存政策未升级,Opus 5 的默认不强制留存可能是解锁企业场景的关键——与法务确认 Anthropic 当前 DPA 与服务条款。
- 暂勿把 K3 当唯一生产后端:在 7 月 27 日权重开源且第三方复现基准前,将 K3 限于实验分支;合规敏感客户应文档化「蒸馏指控未澄清」的风险说明。
- 复现 Greenblatt 身份测试(可选):对 K3 与 Claude 各型号发送标准化「你是谁」prompt 集,记录是否吐出
claude-opus-4-5-*类内部 ID——作为内部风控与供应商尽职调查的一手材料。 - Gateway 与 Agent 部署在 7×24 主机:无论后端选 Opus 5、Fable 5 还是经 OpenRouter 多模型路由,Cursor / OpenClaw / 自研 Agent 的 Gateway 进程应跑在不会休眠的 macOS 裸金属上,避免笔记本合盖导致定时任务与 webhook 中断。
06 可引用技术数据、FAQ 与生产环境收束
- Opus 5 光谱反推分子结构:相对 Opus 4.8 内部评测提升 10.2 个百分点(Anthropic 生命科学评测)。
- 蛋白质序列变异功能预测:Opus 5 比 Opus 4.8 高 7.7 个百分点。
- Kimi K3 GPQA-Diamond:93.5%,发布时开源模型最高分(Moonshot 官方)。
- Anthropic 2 月蒸馏指控:称识别月之暗面超 340 万次异常 API 交互,部分行为追踪至高层(Anthropic 公开声明,月之暗面未正面回应)。
Opus 5 输入 $5/百万 tokens、输出 $25/百万 tokens,约为 Fable 5($10/$50)的一半;CursorBench 3.2 峰值与 Fable 5 相差不到 0.5%。
是的,2026-07-24 发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。
截至本文发布仍属未证实的争议。白宫指控缺乏公开证据;独立专家认为两周时间线难以完成深度蒸馏;Ryan Greenblatt 发现 K3 高频自称 Claude 并吐出内部部署 ID,是目前最具技术含量的间接证据,但不能直接证明蒸馏。
Moonshot 官方承诺 2026-07-27 放出;本文发布时外部研究者尚无法完全独立验证架构与跑分。
对普通开发者与企业用户:先看场景,再看立场。合规、数据留存、供应链风险敏感 → Opus 5「价格没涨、能力跳级」性价比很高;极限成本与开源可控、可接受争议未澄清 → 等 7 月 27 日 K3 权重放出后再实测。
无论选 Opus 5 还是多模型 Gateway,本地笔记本跑 7×24 Agent 都有休眠断连、DerivedData 与日志撑爆磁盘、多人协作权限混乱等隐性成本。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,CALMVPS 的 Mac Mini 裸金属租赁通常是更优解:独占 Apple Silicon、120 秒交付、按月弹性下单,Gateway 与 CI Runner 可长期在线而不依赖个人电脑。