本週 AI 圈兩件大事看似無關,卻都指向同一主題——性價比與模型能力的真實來源:2026-07-24 Anthropic 發布日常主力 Claude Opus 5,同日成為 Claude Max 預設模型;而 7 月 16 日剛發布的 Kimi K3 則遭白宮公開指控「產業級蒸餾」,獨立研究者更發現 K3 會自稱 Claude 並吐出內部部署版本號。
本文面向正在評估 Claude / Kimi API 選型、關注大模型爭議與合規風險的開發者與技術決策者,嚴格依據 Anthropic 官方發布、Moonshot 技術部落格、TechCrunch 專家採訪與 Ryan Greenblatt 統計分析,回答三件事:Opus 5 相對 Fable 5 值不值得換、K3 蒸餾指控哪些可驗證哪些仍是猜測、以及你的 Agent 工作流現在該怎麼落地。
01 Claude Opus 5 發布:價格不變、效能跳級、Claude Max 預設模型
選型前的真實痛點:
- Fable 5 太貴:旗艦智慧強,但 $10/$50 每百萬輸入/輸出 token 讓日常 Agent 成本難以承受。
- Opus 4.8 不夠用:上一代 Opus 在 CursorBench、Frontier-Bench 等硬任務上明顯落後新一代旗艦。
- 資料留存門檻:Fable 5 / Mythos 5 要求接受 30 天資料留存政策,合規敏感團隊被擋在門外。
- 模型 ID 混亂:API、Bedrock、Vertex、Foundry 多平台並存,須確認統一 ID 為
claude-opus-5。
2026-07-24(美國太平洋時間),Anthropic 正式發布 Claude Opus 5:定位「日常主力模型」,官方稱接近旗艦 Fable 5 智慧水準,價格為 Fable 5 的一半。定價與 Opus 4.8 完全相同——輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens;上下文視窗 100 萬 tokens(預設且唯一檔位);最大輸出 128K tokens;Thinking 預設開啟,Effort 參數控制思考量。
| 項目 | Claude Opus 5 | 對照說明 |
|---|---|---|
| 定價(輸入/輸出) | $5 / $25 每百萬 tokens | 與 Opus 4.8 相同,約為 Fable 5 一半 |
| 上下文視窗 | 100 萬 tokens | 預設且唯一檔位 |
| 平台可用性 | Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry | 模型 ID:claude-opus-5 |
| 產品定位 | Claude Max 預設模型;Claude Pro 最強可用版本 | 訊號:Anthropic 押注日常主力而非僅旗艦 |
| 資料留存 | 預設存取不強制資料留存 | Fable 5 / Mythos 5 需接受 30 天留存政策 |
| Fast 模式 | 速度約 2.5×,價格 2× | 與 Opus 4.8 策略一致 |
官方基準亮點(發版後請以 Anthropic 新聞頁再次核對):
- Frontier-Bench v0.1:軟體工程任務超越所有模型,效能為 Opus 4.8 的兩倍以上,單任務成本更低。
- CursorBench 3.2:max effort 檔位與 Fable 5 峰值相差僅 0.5%,成本為 Fable 5 一半;high / xhigh / max 檔「性價比」超市面所有模型。
- ARC-AGI 3:新穎問題解決得分為次優模型的 3 倍。
- OSWorld 2.0:任意成本下優於其他模型;用不到 Fable 5 三分之一成本超過 Fable 5 最佳成績。
- Zapier AutomationBench:端到端商業自動化通過率約為次優模型 1.5 倍;最低 effort 檔仍超任何其他模型。
對齊與安全:自動化行為審計顯示 Opus 5 是迄今最對齊的 Claude 模型。但在網路安全攻擊、生物安全等高風險雙用途能力上,Anthropic 刻意未讓 Opus 5 刷新前沿,該位置仍由受限發行的 Mythos 5 佔據。
官方發布與第三方報導以連結為準,發版後請再次開啟核對。
02 Kimi K3 蒸餾門:白宮下場指控,專家質疑時間線不足
如果說 Opus 5 是「正常發新品」,Kimi K3 的劇情則複雜得多。月之暗面 2026-07-16 發布 Kimi K3:總參數 2.8 萬億(2.8T),全球首個進入「3T 級」的開源模型;稀疏 MoE,896 專家中每 token 啟用 16 個(約等效 500 億啟用參數);100 萬 token 上下文加原生視覺理解;基於 Kimi Delta Attention(KDA)加 Attention Residuals 加 Stable LatentMoE。完整權重承諾 2026-07-27 放出——爭議爆發時外部尚無法獨立驗證。
關於 K3 架構與基準的完整解讀,可參閱本站此前深度評測:Kimi K3 深度評測。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次公開指控月之暗面 / DeepSeek / MiniMax「產業級蒸餾攻擊」,稱偵測到月之暗面超 340 萬次異常 API 互動 |
| 2026-07-01 | Claude Fable 5 面向公眾正式可用 |
| 2026-07-16 | Kimi K3 API/產品正式發布 |
| 2026-07-22/23 | 白宮 OSTP 主任 Michael Kratsios 在 X 指控月之暗面「大規模、隱蔽的產業級蒸餾」加涉嫌使用未獲出口許可的 Nvidia GB300 晶片 |
| 2026-07-23 | TechCrunch 刊發多位獨立研究者質疑蒸餾說的報導 |
| 2026-07-24 左右 | Ryan Greenblatt 發布「K3 自稱 Claude」統計證據(GitHub: rgreenblatt/which_claude_is_k3) |
| 2026-07-27(計畫) | Kimi K3 完整權重開源,外部可獨立驗證 |
2026-07-22/23,白宮科技政策辦公室(OSTP)主任 Michael Kratsios 公開發文,指控月之暗面透過「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提到涉嫌使用未獲出口許可的 Nvidia GB300(Grace Blackwell 300)晶片,可能經泰國伺服器間接取得。Kratsios 未公開支撐指控的具體證據;月之暗面對訓練過程質詢未予回應。
TechCrunch(7 月 23 日)採訪多位獨立研究者,普遍對「蒸餾說」存疑。Snorkel AI 共同創辦人 Braden Hancock 直言:Fable 5 從 7 月 1 日才公開可用,到 K3 發布(7 月 16 日)只有兩週,不可能在兩週內蒸餾足夠資料、訓練完模型並發布。Allen Institute for AI 研究員 Nathan Lambert 認為,隨著中國模型逼近前沿,簡單監督微調式蒸餾邊際收益變小,真正拉開差距的是強化學習訓練。
「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」—— Michael Kratsios,白宮 OSTP 主任
背景:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見。「蒸餾」本身並不必然違法,核心在於「正常技術借鑑」與「隱蔽工業級竊取」的邊界如何界定。
03 Kimi K3 自稱 Claude?Ryan Greenblatt 發現的最硬核技術證據
整個事件裡最具技術含金量、也最適合做深度內容的角度:Redwood Research 首席科學家 Ryan Greenblatt 在 2026-07-24 左右發布統計分析,對多個模型被問「你是誰」時的身份自認行為做交叉熵對比。
- 異常高頻自稱 Claude:Kimi K3 在被問及身份時,異常頻繁地自稱是 Claude,甚至會吐出 Claude 官方內部部署 ID 字串,例如
claude-opus-4-5-20250929、claude-sonnet-4-5-20250929。 - 比真 Claude 還準:真正的 Claude Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不會主動報出這類內部版本號——教師模型自己都沒有 K3 說得準。
- 逐代追新規律:K3 自稱的身份鎖定在「Claude 4.5 時代」(2025 年末),而非當前 Fable/Mythos 系列;上一代 K2 的訊號指向更早的 Claude Sonnet 4(2025 年中),呈現「一代蒸一代、逐代追新」的規律。
- Greenblatt 的解讀:模型說出教師模型部署中繼資料比教師自己還準確,很難用「單純模仿對話風格」解釋,更可能指向訓練資料裡混入了帶有部署中繼資料標註的 Claude 資料。
- 重要澄清:Greenblatt 強調這些發現不能直接證明蒸餾發生;身份混淆也可能來自訓練資料污染、系統提示詞洩漏或公開資料集合合成樣本。
分析程式碼與 writeup 以 Greenblatt GitHub 倉庫為準,發版後請再次開啟核對。
https://github.com/rgreenblatt/which_claude_is_k3
在 7 月 27 日權重放出前,架構細節與基準均無法被外部完全獨立驗證——這也是輿論持續發酵的原因。
04 Claude Opus 5 vs Fable 5 vs Kimi K3:選型決策矩陣
| 維度 | Claude Opus 5 | Claude Fable 5 | Kimi K3 |
|---|---|---|---|
| 輸入/輸出定價(每百萬 tokens) | $5 / $25 | 約 $10 / $50 | 約 $3 / $15(API,見 K3 評測文) |
| 相對 Fable 5 程式能力 | CursorBench 峰值差 0.5% | 基準參照 | 官方稱整體僅次於 Fable 5 與 GPT-5.6 Sol |
| 上下文 | 100 萬 tokens | 100 萬 tokens | 100 萬 tokens 加原生視覺 |
| 資料留存政策 | 預設不強制留存 | 需接受 30 天留存 | 依 Moonshot 政策(見官方文件) |
| 開源權重 | 閉源 | 閉源 | 2026-07-27 承諾放出 |
| 合規/地緣風險 | 低(Anthropic 美系閉源) | 低,但留存門檻高 | 高(蒸餾指控加晶片出口管制輿論) |
| 適合場景 | 日常 Agent、程式、企業合規敏感 | 極限智慧、可接受留存與高價 | 極限成本、開源可控、可接受爭議未澄清 |
兩件事連起來看:Opus 5 用「半價逼近旗艦」回應性價比訴求;Kimi K3 用「開源加低價」衝擊市場;圍繞 K3 的爭議,本質是各家在性價比戰爭裡對「低價究竟來自工程優化還是白嫖別人模型」的公開攤牌。
05 開發者六步落地:評估 Opus 5 升級與 K3 爭議下的 API 策略
- 核對 Claude 控制台預設模型:Claude Max / Pro 使用者登入後確認預設已切換為 Opus 5;API 呼叫將模型 ID 更新為
claude-opus-5,在 Bedrock / Vertex / Foundry 控制台同步檢查別名對應。 - 跑 CursorBench 等價回歸:用你生產環境代表性的 10–20 個 Agent 任務(程式審查、多檔案重構、CI 腳本生成)對比 Opus 4.8 / Opus 5 / Fable 5 的通過率與 token 成本,記錄 effort 檔位對品質的影響。
- 評估資料留存條款:若此前因 Fable 5 的 30 天留存政策未升級,Opus 5 的預設不強制留存可能是解鎖企業場景的關鍵——與法務確認 Anthropic 當前 DPA 與服務條款。
- 暫勿把 K3 當唯一生產後端:在 7 月 27 日權重開源且第三方複現基準前,將 K3 限於實驗分支;合規敏感客戶應文件化「蒸餾指控未澄清」的風險說明。
- 複現 Greenblatt 身份測試(可選):對 K3 與 Claude 各型號發送標準化「你是誰」prompt 集,記錄是否吐出
claude-opus-4-5-*類內部 ID——作為內部風控與供應商盡職調查的一手材料。 - Gateway 與 Agent 部署在 7×24 主機:無論後端選 Opus 5、Fable 5 還是經 OpenRouter 多模型路由,Cursor / OpenClaw / 自研 Agent 的 Gateway 程序應跑在不會休眠的 macOS 裸金屬上,避免筆電合蓋導致定時任務與 webhook 中斷。
06 可引用技術數據、FAQ 與生產環境收束
- Opus 5 光譜反推分子結構:相對 Opus 4.8 內部評測提升 10.2 個百分點(Anthropic 生命科學評測)。
- 蛋白質序列變異功能預測:Opus 5 比 Opus 4.8 高 7.7 個百分點。
- Kimi K3 GPQA-Diamond:93.5%,發布時開源模型最高分(Moonshot 官方)。
- Anthropic 2 月蒸餾指控:稱識別月之暗面超 340 萬次異常 API 互動,部分行為追蹤至高層(Anthropic 公開聲明,月之暗面未正面回應)。
Opus 5 輸入 $5/百萬 tokens、輸出 $25/百萬 tokens,約為 Fable 5($10/$50)的一半;CursorBench 3.2 峰值與 Fable 5 相差不到 0.5%。
是的,2026-07-24 發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。
截至本文發布仍屬未證實的爭議。白宮指控缺乏公開證據;獨立專家認為兩週時間線難以完成深度蒸餾;Ryan Greenblatt 發現 K3 高頻自稱 Claude 並吐出內部部署 ID,是目前最具技術含量的間接證據,但不能直接證明蒸餾。
Moonshot 官方承諾 2026-07-27 放出;本文發布時外部研究者尚無法完全獨立驗證架構與跑分。
對普通開發者與企業使用者:先看場景,再看立場。合規、資料留存、供應鏈風險敏感 → Opus 5「價格沒漲、能力跳級」性價比很高;極限成本與開源可控、可接受爭議未澄清 → 等 7 月 27 日 K3 權重放出後再實測。
無論選 Opus 5 還是多模型 Gateway,本地筆電跑 7×24 Agent 都有休眠斷連、DerivedData 與日誌撐爆磁碟、多人協作權限混亂等隱性成本。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,CALMVPS 的 Mac Mini 裸金屬租賃通常是更優解:獨占 Apple Silicon、120 秒交付、按月彈性下單,Gateway 與 CI Runner 可長期在線而不依賴個人電腦。