Anthropic 實測 1053 名測試者,面對危險指令只有 13.6% 按下拒絕,auto mode 擋下 89%。本文拆解確認框失效的機制,以及殘留 11% 對兩類 AI 安全風險的不同意義。
⭐ 文章深度讀:那 11% 呢:兩種風險,答案不一樣
→ https://heymaibao.com/anthropic-1053-testers-dangerous-commands/
⚡ 章節重點
開場:1053 人只有 13.6% 按拒絕 00:00
這場實驗到底怎麼做的 00:53
真正說服我的是那條衰減曲線 01:20
設定檔裡的痕跡:放行規則與跳過檢查 02:10
auto mode 到底做了什麼 03:07
三個被攔下來的內部例子 04:04
那 11% 呢:兩種風險,答案不一樣 05:08
同一篇公告裡有兩組提示詞注入數字 06:14
一個看起來完全例行的安裝指令 07:03
那你現在該做什麼 07:52
回到開頭那個 13.6% 08:38
📝 懶人包
∙ Anthropic 宣布,Claude Code 的 auto mode 從 2026 年 8 月 14 日起成為 Pro、Max、Team 方案新工作階段的預設模式,這個時間點已經過去。它不再逐項跳確認框,改由一個分類器判斷每個動作要不要擋。Enterprise 與 API 這類通道還是要自己開。
∙ 在那場 1,053 人的受控實驗裡,人類只擋下 13.6%、auto mode 擋下 89%,而且人類的攔截率會隨著工作階段變長,從早期的約 17% 掉到 50 個提示之後的約 5%。
∙ 同一篇公告裡有兩組提示詞注入數字,出自不同的攻擊集:Anthropic 委託第三方 Trajectory Labs 做的 720 次攻擊全數沒有攻破 auto mode 下的 Claude Fable 5、Opus 5 與 Sonnet 5,而 Apollo Research 那組對抗測試的分類器漏接率是從 12% 降到 7%。
∙ 我的觀察是,這批數字真正證偽的是「逐項確認框」這個安全介面,跟哪一家的模型無關,而剩下的 11%,對「誤刪誤清」和「提示詞注入」這兩種風險來說,意義完全不一樣。
📚 參考資料
Auto mode is now the default in Claude Code for Pro, Max, and Team plans
→ https://claude.com/blog/auto-mode-default-in-claude-code
Simon Willison:Auto mode is now the default in Claude Code
→ https://simonwillison.net/2026/Aug/8/auto-mode/
Configure auto mode - Claude Code Docs
→ https://code.claude.com/docs/en/auto-mode-config
Configure server-managed settings - Claude Code Docs
→ https://code.claude.com/docs/en/server-managed-settings
The lethal trifecta for AI agents: private data, untrusted content, and external communication
→ https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/