Hugging Face联合创始人:小型开源模型同样能复现Anthropic披露的高危漏洞分析
Hugging Face联合创始人Clement Delangue引用Anthropic关于Claude Mythos Preview发现FreeBSD与OpenBSD漏洞的案例称,团队用多款“小而便宜”的开源权重模型,对Anthropic公开的同一段脆弱代码进行测试,结果发现8个模型中有8个都能识别出Mythos展示的FreeBSD关键漏洞,其中一个仅3.6B激活参数、推理成本约每百万token 0.11美元的模型即成功给出类似分析。 他补充说,一款约5.1B激活参数的开源模型也成功复现了Anthropic所宣称的、存在27年的OpenBSD漏洞链路,这意味着相关攻击面并非只有前沿闭源大模型才能触达。
此前Anthropic在安全报告中强调,Mythos Preview已在主流操作系统和浏览器中发现上千个高危零日漏洞,包括FreeBSD远程内核RCE与长期未被发现的OpenBSD与FFmpeg缺陷,并以此为由,将Mythos定位为“只对防御方开放”的高敏感网络安全模型。 Delangue的实测则表明,一旦关键样本、利用思路与环境搭建方法被公开,成本更低的开源模型也能在类似任务中取得接近效果,安全威胁不再是某个“单一前沿模型”的特例,而是整个AI生态在漏洞发现与利用上的普遍能力上升。
来源:公开信息
ABAB AI Insight
Delangue的测试结果,削弱了“只有极少数前沿闭源模型才拥有危险级攻击能力”的叙事,强调的是:一旦攻击样本、提示工程与利用脚本流入公开领域,较小、成本更低的开源模型也能完成类似漏洞挖掘与利用。安全外溢因此不是从Anthropic一家公司出发的单点风险,而是整套“高能力模型→公开报告→开源复现”的知识扩散链条——真正的变量不在模型大小,而在上下游生态如何对待这些发现。
从网络安全结构来看,这意味着“AI红队能力”正从稀缺资源变成可商品化、可复制的公共能力。过去,高端漏洞挖掘主要掌握在国家级或少数精英团队手中,现在,只要有可调度的小模型、开源工具链和公开PoC,更多攻击者就能以极低成本复现高难度利用链。这把安全博弈拉入一个新的均衡:防御方不能再依赖“攻击难度高”作为天然防线,而必须把AI嵌入日常审计、补丁优先级排序与代码审查流程。
更深层的结构变化在于,大模型公司的安全叙事开始受到“开源复现压力”的约束。Anthropic把Mythos定位为“只给防御方用”的战略资产,但Delangue展示的是,安全能力一旦通过报告与案例被抽象化,开源社区就能在参数量小得多的模型上“蒸馏”出类似能力,这削弱了闭源厂商在安全话语权上的垄断。未来的关键不再是“谁的模型更危险”,而是谁能建立起跨模型、跨组织的防御协作网络,把这种普遍提升的攻击能力转化为同样普遍可用的防御工具与流程。