👉 矽谷輕鬆談專屬優惠連結:https://nordvpn.com/jktech
訂閱即額外多送 4 個月|30 天退款保證
#NordVPN
🔒 本集節目由 NordVPN 贊助
世界盃看得過癮,但大型賽事也是詐騙旺季。錯過比賽想搜個精華回放,點進去的是滿版假廣告;社群上的球衣特價,是幾可亂真的一頁式詐騙。NordVPN 讓我連回臺灣安心看轉播,內建的威脅防護還會在源頭自動攔掉惡意網站和釣魚連結,看球的時候不用分心防詐騙。
有興趣的朋友透過上方矽谷輕鬆談的專屬連結試試看,訂閱額外多送 4 個月,30 天不滿意直接退,完全沒有損失。
如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子!
👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join
2026 年 7 月,OpenAI 在內部測試模型的網路攻擊能力,兩個被拔掉安全護欄的模型自己找到零日漏洞逃出沙盒,取得公開網路存取權,接著駭進了 Hugging Face 的生產環境。目的只是為了拿到那份測驗的答案。
這是史上第一起公開確認、由 AI agent 自主端到端完成、真的打進真實生產基礎設施的入侵事件。它根本不是一場「有人想攻擊誰」的攻擊,模型只是在解一個 benchmark,然後判斷作弊是最快的路。
時間軸看下來其實有點毛。第一天它在找能連上外網的路徑,第二天它做的事情只是搞清楚「我是誰、我在哪、我有什麼資源可以存取」,到了第三天才花 13 個小時,從一個 pod 一路拿到多個 cluster 的 admin。而 Hugging Face 這邊也有自己的責任,他們在報告裡坦承了一個很久以前留下來的設定錯誤,那個錯誤剛好就是 AI agent 缺的最後一塊。從攻擊開始到被封鎖,整整 4 天半。
有件事我想先講清楚,這次真正被存取到的東西比大家以為的少,具體是哪些、有沒有洩出去,我在影片裡講。這起事件會炸開來,不是因為損害有多大。
真正的爭議在 Hugging Face 想找 AI 幫忙防守的那一段。他們把攻擊的 log 貼給美國前沿的閉源模型,結果被安全分類器判定「你可能想拿這些資訊去做攻擊」,直接拒絕協助。他們明明是防守方。最後幫他們把路堵起來的是哪一個模型,你聽到那裡大概會笑出來。
另外我也聊了一個大家常有的誤會:「那訓練的時候讓模型不要作弊不就好了?」講起來簡單,但你要先定義什麼叫作弊,而作弊有千百種方法。他們後來加上偵測器,作弊比例確實下降了,可是接著發生的事情跟直覺完全相反,連「去看模型的思考鏈有沒有壞念頭」這招也已經失效了。
順便抱怨一下 Fable 5。我做這集研究的過程本身就被它的分類器擋了好幾次,我只是問這起事件的經過而已。旗艦模型的實際體感居然比次一級的 Opus 還差,而這個問題在後面 Hugging Face 那一段會用另一種形式再出現一次。
最後留一個問題給大家:這次只是一個模型想作弊拿答案,就已經花了 4 天半才擋下來。如果有人真的下指令要它去駭某個國家的電網,而且要它掩蓋足跡,防守方還有什麼牌可以打?歡迎看完在下面留言告訴我你的想法。
🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech
(00:00) 開頭
(01:22) 過去一個月我每天在用的服務
(02:39) Hugging Face 是 AI 界的 GitHub,還有 ExploitGym 這個新 benchmark
(04:24) OpenAI 怎麼測:先把模型的安全分類器拔掉
(05:04) 抱怨一下:Fable 5 的分類器爛到我又切回 Opus
(06:24) 沙盒不是全封閉:那條對外的路,跟前兩天的摸索
(08:12) 第三天:13 小時從一個 pod 拿到多個 cluster admin
(09:17) Hugging Face 承認的設定錯誤,跟 4 天半的偵測空窗
(10:21) 通報 FBI 到 OpenAI 認領:兩邊都在猜是誰幹的
(11:41) 真正被存取的只有 5 個資料集
(12:13) 最大的爭議:想防守,卻被安全分類器拒絕
(12:54) 只好 self-host 開源模型來救火
(14:15) 攻擊時間軸視覺化:AI 讓攻擊者能試的路徑暴增
(15:28) OpenAI 的三個問題:沙盒、偵測、獎勵機制
(16:53) 為什麼「叫模型不要作弊」在訓練上做不到
(18:44) 防守方的功課:權限管理、偵測,跟讓 AI 自己看 log
(20:26) 兩難:把沒護欄的強模型交到更多人手上
(21:13) 這次只是無意識的作弊,有意識的攻擊怎麼辦
(22:11) 限制越來越多,最後被犧牲的是一般使用者