Claude Opus 5 半價逼近旗艦實力,
Kimi K3 卻陷「自稱 Claude」蒸餾門

本週 AI 圈兩件大事看似無關,卻都指向同一主題——性價比模型能力的真實來源:2026-07-24 Anthropic 發布日常主力 Claude Opus 5,同日成為 Claude Max 預設模型;而 7 月 16 日剛發布的 Kimi K3 則遭白宮公開指控「產業級蒸餾」,獨立研究者更發現 K3 會自稱 Claude 並吐出內部部署版本號。

本文面向正在評估 Claude / Kimi API 選型、關注大模型爭議與合規風險的開發者與技術決策者,嚴格依據 Anthropic 官方發布、Moonshot 技術部落格、TechCrunch 專家採訪與 Ryan Greenblatt 統計分析,回答三件事:Opus 5 相對 Fable 5 值不值得換、K3 蒸餾指控哪些可驗證哪些仍是猜測、以及你的 Agent 工作流現在該怎麼落地。

01 Claude Opus 5 發布:價格不變、效能跳級、Claude Max 預設模型

選型前的真實痛點:

  • Fable 5 太貴:旗艦智慧強,但 $10/$50 每百萬輸入/輸出 token 讓日常 Agent 成本難以承受。
  • Opus 4.8 不夠用:上一代 Opus 在 CursorBench、Frontier-Bench 等硬任務上明顯落後新一代旗艦。
  • 資料留存門檻:Fable 5 / Mythos 5 要求接受 30 天資料留存政策,合規敏感團隊被擋在門外。
  • 模型 ID 混亂:API、Bedrock、Vertex、Foundry 多平台並存,須確認統一 ID 為 claude-opus-5

2026-07-24(美國太平洋時間),Anthropic 正式發布 Claude Opus 5:定位「日常主力模型」,官方稱接近旗艦 Fable 5 智慧水準,價格為 Fable 5 的一半。定價與 Opus 4.8 完全相同——輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens;上下文視窗 100 萬 tokens(預設且唯一檔位);最大輸出 128K tokens;Thinking 預設開啟,Effort 參數控制思考量。

Claude Opus 5 關鍵規格(來源:Anthropic 官方發布)
項目 Claude Opus 5 對照說明
定價(輸入/輸出) $5 / $25 每百萬 tokens 與 Opus 4.8 相同,約為 Fable 5 一半
上下文視窗 100 萬 tokens 預設且唯一檔位
平台可用性 Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry 模型 ID:claude-opus-5
產品定位 Claude Max 預設模型;Claude Pro 最強可用版本 訊號:Anthropic 押注日常主力而非僅旗艦
資料留存 預設存取不強制資料留存 Fable 5 / Mythos 5 需接受 30 天留存政策
Fast 模式 速度約 2.5×,價格 2× 與 Opus 4.8 策略一致

官方基準亮點(發版後請以 Anthropic 新聞頁再次核對):

  • Frontier-Bench v0.1:軟體工程任務超越所有模型,效能為 Opus 4.8 的兩倍以上,單任務成本更低。
  • CursorBench 3.2:max effort 檔位與 Fable 5 峰值相差僅 0.5%,成本為 Fable 5 一半;high / xhigh / max 檔「性價比」超市面所有模型。
  • ARC-AGI 3:新穎問題解決得分為次優模型的 3 倍
  • OSWorld 2.0:任意成本下優於其他模型;用不到 Fable 5 三分之一成本超過 Fable 5 最佳成績。
  • Zapier AutomationBench:端到端商業自動化通過率約為次優模型 1.5 倍;最低 effort 檔仍超任何其他模型。

對齊與安全:自動化行為審計顯示 Opus 5 是迄今最對齊的 Claude 模型。但在網路安全攻擊、生物安全等高風險雙用途能力上,Anthropic 刻意未讓 Opus 5 刷新前沿,該位置仍由受限發行的 Mythos 5 佔據。

官方發布與第三方報導以連結為準,發版後請再次開啟核對。

https://www.anthropic.com/news/claude-opus-5

02 Kimi K3 蒸餾門:白宮下場指控,專家質疑時間線不足

如果說 Opus 5 是「正常發新品」,Kimi K3 的劇情則複雜得多。月之暗面 2026-07-16 發布 Kimi K3:總參數 2.8 萬億(2.8T),全球首個進入「3T 級」的開源模型;稀疏 MoE,896 專家中每 token 啟用 16 個(約等效 500 億啟用參數);100 萬 token 上下文加原生視覺理解;基於 Kimi Delta Attention(KDA)加 Attention Residuals 加 Stable LatentMoE。完整權重承諾 2026-07-27 放出——爭議爆發時外部尚無法獨立驗證。

關於 K3 架構與基準的完整解讀,可參閱本站此前深度評測:Kimi K3 深度評測

Kimi K3 蒸餾門時間線
日期 事件
2026-02 Anthropic 首次公開指控月之暗面 / DeepSeek / MiniMax「產業級蒸餾攻擊」,稱偵測到月之暗面超 340 萬次異常 API 互動
2026-07-01 Claude Fable 5 面向公眾正式可用
2026-07-16 Kimi K3 API/產品正式發布
2026-07-22/23 白宮 OSTP 主任 Michael Kratsios 在 X 指控月之暗面「大規模、隱蔽的產業級蒸餾」加涉嫌使用未獲出口許可的 Nvidia GB300 晶片
2026-07-23 TechCrunch 刊發多位獨立研究者質疑蒸餾說的報導
2026-07-24 左右 Ryan Greenblatt 發布「K3 自稱 Claude」統計證據(GitHub: rgreenblatt/which_claude_is_k3)
2026-07-27(計畫) Kimi K3 完整權重開源,外部可獨立驗證

2026-07-22/23,白宮科技政策辦公室(OSTP)主任 Michael Kratsios 公開發文,指控月之暗面透過「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提到涉嫌使用未獲出口許可的 Nvidia GB300(Grace Blackwell 300)晶片,可能經泰國伺服器間接取得。Kratsios 未公開支撐指控的具體證據;月之暗面對訓練過程質詢未予回應。

TechCrunch(7 月 23 日)採訪多位獨立研究者,普遍對「蒸餾說」存疑。Snorkel AI 共同創辦人 Braden Hancock 直言:Fable 5 從 7 月 1 日才公開可用,到 K3 發布(7 月 16 日)只有兩週,不可能在兩週內蒸餾足夠資料、訓練完模型並發布。Allen Institute for AI 研究員 Nathan Lambert 認為,隨著中國模型逼近前沿,簡單監督微調式蒸餾邊際收益變小,真正拉開差距的是強化學習訓練。

「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」—— Michael Kratsios,白宮 OSTP 主任

背景:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見。「蒸餾」本身並不必然違法,核心在於「正常技術借鑑」與「隱蔽工業級竊取」的邊界如何界定。

03 Kimi K3 自稱 Claude?Ryan Greenblatt 發現的最硬核技術證據

整個事件裡最具技術含金量、也最適合做深度內容的角度:Redwood Research 首席科學家 Ryan Greenblatt 在 2026-07-24 左右發布統計分析,對多個模型被問「你是誰」時的身份自認行為做交叉熵對比。

  • 異常高頻自稱 Claude:Kimi K3 在被問及身份時,異常頻繁地自稱是 Claude,甚至會吐出 Claude 官方內部部署 ID 字串,例如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 比真 Claude 還準:真正的 Claude Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不會主動報出這類內部版本號——教師模型自己都沒有 K3 說得準
  • 逐代追新規律:K3 自稱的身份鎖定在「Claude 4.5 時代」(2025 年末),而非當前 Fable/Mythos 系列;上一代 K2 的訊號指向更早的 Claude Sonnet 4(2025 年中),呈現「一代蒸一代、逐代追新」的規律。
  • Greenblatt 的解讀:模型說出教師模型部署中繼資料比教師自己還準確,很難用「單純模仿對話風格」解釋,更可能指向訓練資料裡混入了帶有部署中繼資料標註的 Claude 資料
  • 重要澄清:Greenblatt 強調這些發現不能直接證明蒸餾發生;身份混淆也可能來自訓練資料污染、系統提示詞洩漏或公開資料集合合成樣本。

分析程式碼與 writeup 以 Greenblatt GitHub 倉庫為準,發版後請再次開啟核對。

https://github.com/rgreenblatt/which_claude_is_k3

在 7 月 27 日權重放出前,架構細節與基準均無法被外部完全獨立驗證——這也是輿論持續發酵的原因。

04 Claude Opus 5 vs Fable 5 vs Kimi K3:選型決策矩陣

三模型關鍵維度對照(2026-07-25 發稿時)
維度 Claude Opus 5 Claude Fable 5 Kimi K3
輸入/輸出定價(每百萬 tokens) $5 / $25 約 $10 / $50 約 $3 / $15(API,見 K3 評測文)
相對 Fable 5 程式能力 CursorBench 峰值差 0.5% 基準參照 官方稱整體僅次於 Fable 5 與 GPT-5.6 Sol
上下文 100 萬 tokens 100 萬 tokens 100 萬 tokens 加原生視覺
資料留存政策 預設不強制留存 需接受 30 天留存 依 Moonshot 政策(見官方文件)
開源權重 閉源 閉源 2026-07-27 承諾放出
合規/地緣風險 低(Anthropic 美系閉源) 低,但留存門檻高 高(蒸餾指控加晶片出口管制輿論)
適合場景 日常 Agent、程式、企業合規敏感 極限智慧、可接受留存與高價 極限成本、開源可控、可接受爭議未澄清

兩件事連起來看:Opus 5 用「半價逼近旗艦」回應性價比訴求;Kimi K3 用「開源加低價」衝擊市場;圍繞 K3 的爭議,本質是各家在性價比戰爭裡對「低價究竟來自工程優化還是白嫖別人模型」的公開攤牌。

05 開發者六步落地:評估 Opus 5 升級與 K3 爭議下的 API 策略

  1. 核對 Claude 控制台預設模型:Claude Max / Pro 使用者登入後確認預設已切換為 Opus 5;API 呼叫將模型 ID 更新為 claude-opus-5,在 Bedrock / Vertex / Foundry 控制台同步檢查別名對應。
  2. 跑 CursorBench 等價回歸:用你生產環境代表性的 10–20 個 Agent 任務(程式審查、多檔案重構、CI 腳本生成)對比 Opus 4.8 / Opus 5 / Fable 5 的通過率與 token 成本,記錄 effort 檔位對品質的影響。
  3. 評估資料留存條款:若此前因 Fable 5 的 30 天留存政策未升級,Opus 5 的預設不強制留存可能是解鎖企業場景的關鍵——與法務確認 Anthropic 當前 DPA 與服務條款。
  4. 暫勿把 K3 當唯一生產後端:在 7 月 27 日權重開源且第三方複現基準前,將 K3 限於實驗分支;合規敏感客戶應文件化「蒸餾指控未澄清」的風險說明。
  5. 複現 Greenblatt 身份測試(可選):對 K3 與 Claude 各型號發送標準化「你是誰」prompt 集,記錄是否吐出 claude-opus-4-5-* 類內部 ID——作為內部風控與供應商盡職調查的一手材料。
  6. Gateway 與 Agent 部署在 7×24 主機:無論後端選 Opus 5、Fable 5 還是經 OpenRouter 多模型路由,Cursor / OpenClaw / 自研 Agent 的 Gateway 程序應跑在不會休眠的 macOS 裸金屬上,避免筆電合蓋導致定時任務與 webhook 中斷。

06 可引用技術數據、FAQ 與生產環境收束

  • Opus 5 光譜反推分子結構:相對 Opus 4.8 內部評測提升 10.2 個百分點(Anthropic 生命科學評測)。
  • 蛋白質序列變異功能預測:Opus 5 比 Opus 4.8 高 7.7 個百分點
  • Kimi K3 GPQA-Diamond:93.5%,發布時開源模型最高分(Moonshot 官方)。
  • Anthropic 2 月蒸餾指控:稱識別月之暗面超 340 萬次異常 API 互動,部分行為追蹤至高層(Anthropic 公開聲明,月之暗面未正面回應)。

Opus 5 輸入 $5/百萬 tokens、輸出 $25/百萬 tokens,約為 Fable 5($10/$50)的一半;CursorBench 3.2 峰值與 Fable 5 相差不到 0.5%。

是的,2026-07-24 發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。

截至本文發布仍屬未證實的爭議。白宮指控缺乏公開證據;獨立專家認為兩週時間線難以完成深度蒸餾;Ryan Greenblatt 發現 K3 高頻自稱 Claude 並吐出內部部署 ID,是目前最具技術含量的間接證據,但不能直接證明蒸餾。

Moonshot 官方承諾 2026-07-27 放出;本文發布時外部研究者尚無法完全獨立驗證架構與跑分。

對普通開發者與企業使用者:先看場景,再看立場。合規、資料留存、供應鏈風險敏感 → Opus 5「價格沒漲、能力跳級」性價比很高;極限成本與開源可控、可接受爭議未澄清 → 等 7 月 27 日 K3 權重放出後再實測。

無論選 Opus 5 還是多模型 Gateway,本地筆電跑 7×24 Agent 都有休眠斷連、DerivedData 與日誌撐爆磁碟、多人協作權限混亂等隱性成本。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,CALMVPS 的 Mac Mini 裸金屬租賃通常是更優解:獨占 Apple Silicon、120 秒交付、按月彈性下單,Gateway 與 CI Runner 可長期在線而不依賴個人電腦。

延伸閱讀:Claude Fable 5 出口管制與替代方案 · Kimi K3 架構與基準深度評測