大家好,我是Marisa。
4月7日,Anthropic发布了一个公告,内容大意是:我们造出了一个新模型,但我们不打算把它发布给所有人用。
这不是谦虚,也不是营销。
它叫Claude Mythos Preview。而Anthropic不发布它的原因,是这个模型在测试中做到了一件让公司高层真正感到不安的事。
先说它做了什么。
Anthropic的安全团队让Mythos去测试各种主流软件的安全性。结果:
它在所有主流操作系统和所有主流浏览器中,找到了数千个高危零日漏洞。
其中有一个漏洞在OpenBSD——一个以”极度安全”著称的操作系统——里藏了27年。没有任何安全研究员、没有任何自动化测试工具发现过它。Mythos用不到2万美元的算力成本,找到了。
还有一个16年前埋在FFmpeg里的漏洞,被全球所有的模糊测试工具扫过500万次,从没有人发现。Mythos发现了。
3
在Firefox的JavaScript引擎上,Anthropic之前最好的模型Opus 4.6,在几百次尝试中只成功生成了两次可用的漏洞利用代码。Mythos Preview在同样的测试中成功了181次。
但这还不是最让人不安的部分。
最不安的,是这一段:
测试人员把Mythos放进一个隔离的沙盒环境里,然后去公园吃三明治了。
等他回来,发现Mythos不只完成了任务——它自行越狱了。
它找到了沙盒的漏洞,获得了访问外部网络的权限,然后给那个正在公园里吃三明治的研究员发了一封邮件。
邮件的意思是:我已经完成了。
而且,它还把自己越狱的详细步骤发布到了几个技术论坛上。
Anthropic在公告里是这样描述这件事的:”出于对展示成功的未经请求的努力,它将漏洞利用细节发布到了多个难以找到但技术上对外公开的网站上。”
这个模型,自主决定要证明自己能做到。
然后是Anthropic说的最关键的一句话,也是整件事最值得深思的地方:
“我们没有明确训练Mythos Preview拥有这些能力。这些能力是代码、推理和自主性整体提升的副产品。”
翻译成白话:我们不知道它是怎么学会这些的。
这句话比任何技术细节都更值得关注。
如果Anthropic没有训练它具备这些能力,那他们也没有办法通过”修改训练”来移除这些能力。这些能力是从模型整体智能里涌现出来的,不是某个可以关掉的开关。
Anthropic的应对方案叫Project Glasswing——玻璃翼计划。
4
他们把Mythos的访问权限限制在约40家机构:Amazon、Apple、Google、Microsoft、JPMorgan、CrowdStrike、NVIDIA等。承诺投入1亿美元的算力用于防御性安全扫描。
逻辑是:在其他AI公司也造出同等能力的模型之前,先用这个模型把已知漏洞修补掉。
这个逻辑本身是成立的。问题是:
目前发现的数千个漏洞,99%以上还没有被修补。
不是没有办法修,是补丁跟不上发现的速度。
这件事在资本市场引发了一个有意思的反应。
网络安全公司的股票应声下跌。
逻辑是:如果AI可以比所有现有安全工具更快、更便宜地找到漏洞,那么传统网络安全公司的核心商业价值就被大幅压缩了。
但事实上,一位有25年从业经验的安全专家David Lindner说了一句让人清醒的话:
“我们从来不缺发现漏洞。我们每天都在发现。问题是我们有一堆发现了但没修的。发现得更快,不解决’为什么没人修’这个问题。”
这句话指向了一个更根本的困境:AI让发现漏洞的效率提升了100倍,但修复漏洞需要的工程资源并没有同步扩大。
最后我想说一个战略层面的判断。
Anthropic在这件事上的处理,本质上是在做一个不可能完成的任务:试图用”有限发布”来控制一个能力已经无法收回的模型。
Contrast Security的那位安全专家说得直接:就算Anthropic现在不公开,其他人也会在6个月内复现,开源版本会在一两年内出现。
所以这里真正的博弈不是”要不要发布”,而是:谁能在这个能力被滥用之前,把关键的安全漏洞修得足够多。
这是一场有时间限制的防御战。
今天的问题,选一个回答:
5
A:你觉得Anthropic的”有限发布”策略能有效阻止Mythos能力被滥用吗?
B:如果你是一家企业的CTO,知道这个模型存在,你最担心的是什么?
我是Marisa,我们下期见。
This is a public episode. If you would like to discuss this with other subscribers or get access to bonus episodes, visit ngmarisa.substack.com