今天上午,刚刚发布新模型 3 天的 Anthropic 突然发布公告,宣布立即关停 Fable 5 和 Mythos 5 模型的访问。

公告细节
美国政府以国家安全权限为由,发布了一项出口管制指令:
暂停所有外籍人员(无论是在美国境内还是境外,包括 Anthropic 的外籍员工)访问 Fable 5 和 Mythos 5。
Anthropic 为了确保合规,必须立即停用所有客户对 Fable 5 和 Mythos 5 的访问。
Anthropic 于东部时间 6 月 12 日下午 5:21 收到政府的指令,信函并未提供国家安全疑虑的具体细节。
据公司了解,政府认为他们发现了一种绕过(即“越狱”)Fable 5 的方法。
对此,Anthropic 重申了关于 Fable 安全防护措施的立场:
- 我们建立了强大的安全防护措施,极大地降低了 Fable 被滥用于网络安全等相关任务的可能性。
- 在 Fable 发布前的几周里,Anthropic 与美国政府、英国 AISI、多家私营第三方组织以及内部团队合作,对 Fable 的安全防护进行了总计几千小时的测试。
- 这些测试表明,Fable 的安全防护措施比此前部署的任何模型都更强。
- 目前还没有测试人员能够找到通用越狱(能在大范围内绕过模型安全防护并解锁各种网络安全能力)的方法。
- 目前任何模型提供商都无法做到完美的防越狱。行业内采用的每一种防护措施都容易受到非通用越狱(在特定情况下会泄露某些网络安全信息)的影响,而且未来很可能会出现通用越狱。
- Anthropic 对 Fable 5 采用了*纵深防御(defense in depth)*策略,目的是让越狱要么影响范围极小(非通用越狱),要么制作成本极高(通用越狱),并结合完善的监控,以快速检测并阻断任何成功的攻击。这也是为什么 Anthropic 要求将 Fable 的客户数据保留 30 天。这一政策调整虽然给客户带来了使用成本,但能让我们应对越狱问题。
- 我们甚至没有收到过任何非通用潜在越狱导致的有害结果。目前向我们披露的潜在越狱,要么完全是小事件,要么是未对 Mythos 带来特有能力提升的次要发现。
截至目前,政府仅向 Anthropic 口头提供了一个潜在局限性、非通用越狱的证据,本质上是让模型读取特定的代码库并修复软件缺陷。
有人向政府提交了一个潜在越狱用例,Anthropic 审查了一份据信是政府指令依据的报告,并证实该报告展示的能力水平,在其他模型中也广泛存在,包括 OpenAI 的 GPT-5.5。(这里提 OpenAI 我真蚌埠住了)
Anthropic 并不认同仅仅因为发现了一个局限性的潜在越狱,就应该召回一个已经部署给数亿人的商用模型。
他们认为政府应该有权阻止不安全的部署,但前提是必须作为符合法律程序的法定流程的一部分,并且该流程应是透明、公正、明确且基于技术事实的。
而这次的行动并不符合这些原则。
Anthropic 这其中存在误解,目前正在努力争取尽快恢复访问。
随便聊聊
这几天大家有看到谁用 Fable 5 跑出什么惊天地泣鬼神的东西了吗?好像并没有吧。
不过说真的,Anthropic 还是有点搞笑。天天喊着技术恐吓、反对蒸馏、强调 AI 安全,结果把自己给套进去了。
美国政府要求他们禁止任何非美国公民访问 Fable 5,Anthropic 没办法,只好把所有人的权限都关了。但更绝的是,他们在关停公告里还专门拉上了 GPT-5.5 😂

翻译过来就是:如果这种级别能力的模型要被封,那 ChatGPT-5.5 也该被封。
Anthropic 一战把自己塑造成 AI 安全的道德标杆。天天提醒别人小心、合规、要负起责任,结果当政府真的以国家安全为名出手时,反过来成了砸自己脚的石头。