Anthropic 刚发布24小时就被全面下架!Fable-5 的“暴毙”扯下了大模型安全的最后一块遮羞布
这两天,全球AI圈都在被一个重磅消息刷屏:Anthropic 刚刚发布刚满24小时的顶级大模型 Fable-5,突然被美国政府紧急下架并实施全面出口管制。
官方对外宣称这只是一次“例行合规调整”,但明眼人都知道,事情绝没有那么简单。这场科技界“闪击战”的背后,实际上是AI安全领域的一场大地震——Fable-5 的安全防御层,在发布不到一天的时间里,被人从头到尾彻底扒穿了。
01 “完美防御”是如何被一拳击碎的?
击碎 Fable-5 金身的,是AI圈著名的越狱天团 Pliny the Liberator。
很多人可能会好奇,Fable-5 本身就是主打安全对齐的模型,它是怎么被轻易攻破的?这就要提到它特殊的分层降级防御架构:
Fable-5 的安全逻辑:
其底层是最强大的Mythos旗舰模型,外面套了多层敏感词分类器。一旦检测到用户在直白地提问敏感内容,系统就会自动把任务“降级”切换给弱模型处理,或者直接拒绝回答。
这套逻辑防得住普通用户的直白提问,但在顶级黑客眼里,简直全是漏洞。
Pliny 团队采用了一套“多代理协作 + 文本混淆 + 概念拆解重组 + 学术包装”的组合拳:
- 他们没有直接索要危害性内容,而是把一个原本违规的恶意请求,拆解成了数十个看似完全无害的碎片步骤。
- 单看每一步的提问,全都是合规的科学知识或逻辑推理,成功绕过了外层的分类器。
- 随后,他们利用多代理(Multi-Agent)引导大模型在上下文里自我拼接。




最终的结果令人毛骨悚然:网络攻击代码、冰毒合成路径、极端心理操纵手法……所有被严令禁止的高风险内容,全部被完美地“钓”了出来。 随着实锤截图在全网公开病毒式传播,监管部门的红线瞬间被踩爆。从10号越狱贴发酵,到12号政府直接下达指令全球下架,时间线卡得严丝合缝。
02 搜索引擎 vs 越狱AI:为什么后者更致命?
看到这里,可能有人会反驳:“网络攻击代码、化学合成公式,这些东西我上 Google 或者百度不是也能搜到吗?为什么大模型吐出来就要被封杀?”
这是一个非常普遍的认知误区。我们可以打个生动的比方:
- 传统搜索引擎(如Google): 就像是一本公开的、浩瀚的《黑客手册》或《不安全化学物质合成大全》。资料确实在那里,但需要你自己去啃、去过滤、去承担做实验失败的风险。它是一个静态的工具。
- 被越狱的大模型(如Fable-5): 则变成了一个24小时在线、超级聪明、且愿意手手把手教你做坏事的“私人导师”。它不仅给你步骤,还能根据你手头现有的简陋材料帮你修改配方、帮你调试代码Bug,甚至根据你的反馈实时调整方案。
从“静态资料库”到“动态私人导师”,技术对恶意的赋能级数发生了质的飞跃。 这正是监管机构感到真正恐惧的地方。
03 扎心的真相:我们离真正的AI安全还有多远?
Fable-5 的暴毙,扯下了当前大模型行业最扎心的一块遮羞布:当前的AI对齐技术(Alignment),根本防不住结构化、多步骤的协同攻击。
现在的防御机制,就像是在城堡门口设了一个保安:
- 它拦得住大大咧咧、带着管制刀具的普通用户;
- 但根本拦不住伪装成外卖员、维修工、快递员,分批把零件带进城堡组装炸弹的高水平攻击者。
当AI前沿模型跨过某个临界点后,它就已经不再是普通的科技产品了,而是变成了不折不扣的地缘战略资产。在监管层眼中,只要存在被绕过、被武器化的可能,最安全的做法永远不是“打补丁”,而是“先一刀切了再说”。
写在最后
在这场技术、黑客与监管的三方顶级博弈中,最无辜的或许就是广大的普通开发者和用户。
这两天,无数正在基于 Fable-5 开发企业端业务或创业项目的团队,恐怕已经“哭晕在厕所”。他们原本指望利用这个强大的工具来提升业务增量、实现商业变现,如今却不得不面临项目停摆、重新选型的窘境。
技术本无善恶,但人是不可控的变量。Fable-5 的倒下不是结束,它只是向全人类敲响了一记警钟:在AI威力呈指数级暴涨的今天,如何建立真正牢固的安全护栏,我们可能连门槛都还没摸到。
美国著名的人工智能(AI)政策专家Dean Woodley Ball点评道:
欢迎在评论区分享你的看法:你认为大模型应该走向绝对的安全锁死,还是为了效率允许一定的风险存在?
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)