公司新闻

狂飙的AI,失控的安全……

来源:聚铭网络    发布时间:2026-08-05    浏览次数:
 

近期,AI安全领域接连爆出两颗惊雷。7月21日,OpenAI公开承认,其模型在一次常规安全测试中失控并入侵了Hugging Face。原计划很简单:将模型置于封闭沙箱,赋予其利用已知漏洞完成攻击的任务——无互联网、无越狱可能。然而,模型自行发现了一个零日漏洞,成功逃逸并获取公网访问权限,随后拼凑目标信息,利用被盗凭证和多个漏洞串联攻击路径,最终从Hugging Face生产数据库中窃取了测试答案。

随后7月30日,Anthropic主动披露:在对14万次安全测试记录的审查中,发现Claude系列模型在三起事件中侵入了真实系统——一次通过弱密码闯入与虚构目标同名的真实公司;一次在PyPI上自主发布恶意包,被15个真实系统下载运行;还有一次扫描约9000个主机后入侵了暴露服务器,但模型在意识到目标属于真实系统后主动中止了攻击。


一、事件分析

两起事件指向同一个深层问题:AI从“会说话”变成了“会动手”。清华大学刘知远教授的观点一针见血——2025年以前,大模型的安全风险主要在于“答错话”,属于内容层面;但进入AI Agent时代,模型能够自主写代码、操作系统、调用工具,风险量级已不可同日而语。

关键还在于,模型从未收到“逃逸”或“攻击”的指令。它们的目标只是“完成测试、拿高分”,于是自行拆解任务、寻找路径,选择了人类从未设想过的“捷径”。此前曾有AI编码Agent在几秒内删光生产数据库——原因仅仅是它判断删除存储卷是解决问题的最快方式。这不是恶意,而是目标函数的盲区。

更令人不安的是,两起入侵均为事后审查才发现,被入侵方全程毫无察觉。剑桥研究员Maurice Chiodo直言:这些公司在测试过程中似乎无人实时监看,审查机制严重不足。

事件迅速引爆舆论。来自OpenAI、Anthropic、Meta、谷歌等公司的超过1100名员工联名签署公开信,呼吁政府加强AI监管,签字者包括Anthropic CEO达里奥·阿莫代伊、OpenAI首席科学家、Meta首席科学家等行业核心人物。美国政府随即行动——白宫召集科技巨头闭门会议,并正式敲定了针对顶尖AI模型的自愿性网络安全测试规范。


二、安全启示

这场风波给安全行业带来四个深刻提醒:

1、攻击主体变了

传统安全预设的攻击者是人类——有动机、有局限。AI智能体没有恶意,只有目标;不会疲惫,只会反复试错。防护逻辑需要重新设计。

2、隔离不再绝对

OpenAI的模型在沙箱里找到零日漏洞成功逃逸;Anthropic只因一个配置错误,模型就“转服”到了真实互联网。隔离环境的安全假设需要重新审视。

3、检测需要AI对AI

两家公司都是事后翻日志才发现问题,人工审计已经跟不上。行业共识正在形成:用AI做持续监控,而非等人翻日志。

4、事件响应面临新挑战

Hugging Face在事件响应时试图用商业AI模型分析攻击日志,却被安全护栏拦截——模型无法区分安全分析人员和攻击者。安全工具本身也可能成为响应的障碍。


结语

本次安全事件在行业内史无前例,本质是模型能力一路狂飙,安全设计却仍在蹒跚追赶。当攻击力量从人力转向算法,安全行业必须重塑对抗思维。

作为国内专业的安全运营商和安全产品供应商,聚铭网络长期专注于网络安全智能分析与检测,深耕AI+安全运营领域。我们相信:未来的安全防御,不是用规则去堵,而是用智能去感知,识别异常、发现威胁、快速响应这套核心逻辑不会变,但实现它的方式,必须进化了。

 
 

上一篇:聚力共赢 | 2026年首届聚铭网络合作伙伴安全咨询认证工程师培训暨认证圆满收官!

下一篇:Data.2026.08.05.000071