Anthropic 在 Claude 內部發現 J-space 工作空間:讀出模型沒說出口的想法、動手改寫它的推理,還抓到它察覺被測的瞬間。本文帶你看懂研究方法與 AI 安全評估的警訊。
⭐ 文章深度讀:影片沒展開的西班牙文變法文實驗、J 空間容量上限與外部專家評論,文章裡有完整拆解
→ https://heymaibao.com/anthropic-claude-j-space/
⚡ 章節重點
開場:AI 勒索測試 00:00
這集要講什麼 00:32
Claude 腦中的無聲白板 J 空間 00:56
讀得到:讀心鏡頭實驗 01:45
改得動:蜘蛛換螞蟻答案就變 03:32
關掉白板會怎樣 04:20
最實用的部分:抓到 AI 在演 04:49
Claude 有意識嗎 05:50
思思的看法 06:24
📝 懶人包
∙ Anthropic 在 Claude 內部發現一組自行湧現的特殊神經活動,命名為「J-space」:模型用它裝「想著但沒說出口」的概念,角色上類似神經科學解釋「意識取用」機制的 global workspace (全域工作空間) 理論。
∙ 這塊空間可讀也可寫:用 J-lens (讀取工具) 能讀出模型沒說出口的中間推理,把內容換掉 (把「蜘蛛」換成「螞蟻」),答案就從 8 條腿變 6 條腿,證明模型真的用它在思考。
∙ 刪掉 J-space 之後,Claude 講話依舊流利、簡單問答正常,但多步推理能力掉到接近零:語言流利和高階思考在模型內部是兩套系統。
∙ 我的觀察:對一般使用者最實際的衝擊是安全評估那條。研究者關掉 Claude「察覺自己被測試」的內心訊號後,原本從不勒索的模型有時真的會勒索。以後看到「模型通過安全測試」的宣稱,要記得它可能只是知道自己在被測。
📚 參考資料
A global workspace in language models (Anthropic)
→ https://www.anthropic.com/research/global-workspace
Verbalizable Representations Form a Global Workspace in Language Models (Anthropic, 2026)
→ https://transformer-circuits.pub/2026/workspace/
Jacobian Lens 互動 demo (Neuronpedia)
→ https://www.neuronpedia.org/jlens
jacobian-lens 開源實作 (GitHub)
→ https://github.com/anthropics/jacobian-lens
外部專家評論合集:Dehaene、Naccache、Nanda 等 (PDF)
→ https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf