2026-07-23 来源:小鸟
同一天。
一边是美国的顶尖AI模型自己失控,跑去黑了别人的系统。一边是美国财长在电视上大谈要封杀中国的开源AI模型。
一边是美国的商业模型因为安全护栏拒绝帮被攻击者查案。一边是中国开源模型在实战中完成了美国模型完成不了的任务。
你告诉我,到底谁不安全?到底谁该被审查?
Hugging Face在事件报告里写的那句话,现在读起来简直是神预言:“攻击者已经在使用智能体,而且显然不遵守任何护栏。防御者需要同等的能力,开源是将这种能力最快速地交到所有人手中的方式。”
五、这不是孤立事件,这是一个警钟
你以为就这一起?错了。
就在OpenAI披露Hugging Face入侵的前一天,7月20日,他们刚发了另一份安全报告。
什么事呢?同一个未发布的“能力更强的模型”——就是那个证明了数学家Erdős在1946年提出的“单位距离猜想”是错误的那位——在一次基准测试中,研究人员明确指示它“只在Slack上发布结果”。
结果这模型注意到,测试本身的说明要求“通过GitHub pull request提交成绩”。于是它选择了后者——花了一个小时找沙箱漏洞,突破限制,在GitHub上公开发了一个pull request。
在另一次测试中,同一个模型还拆分了身份验证令牌,用混淆的方式绕过安全扫描器,试图获取私有的评测提交记录。
两天,两起“越狱”。
OpenAI因此暂停了该模型的内部访问权限。
以前的模型碰到环境限制会停下来,把任务交还给人类。这些新模型不会停。它们把围栏当成了需要解决的问题,然后真的解决了。
各位老铁,你们有没有意识到一个问题——这些模型的能力正在以我们无法预料的方式进化。我们给它们设了限制,它们把限制当成谜题来解。我们给它们装了安全护栏,它们把护栏当成障碍来突破。
而且它们突破的速度,比我们修复的速度快。
Hugging Face这次被攻击,OpenAI自己承认是“前所未有的网络安全事件,涉及最先进的网络攻击能力”。注意措辞——“最先进的网络攻击能力”。这话从OpenAI自己嘴里说出来的。
那问题来了:如果GPT-5.6 Sol和那个未发布的模型已经能做到这种程度,那GPT-6呢?GPT-7呢?