换屋顶请找Annie xiao屋顶理赔

美国论坛德州华人网

安稳保险
 找回密码
 立即注册
查看: 35|回复: 0

报告:AI自动生成假身份 骗真人批准恶意程序

[复制链接]

1万

主题

1万

帖子

4万

积分

管理员

Rank: 9Rank: 9Rank: 9

积分
43721
发表于 昨天 14:03 | 显示全部楼层 |阅读模式
报告:AI自动生成假身份 骗真人批准恶意程序



2026年2月13日,在巴黎举行的一场摄影活动中,这张照片显示了美国人工智能(AI)安全与研究公司Anthropic标志前的一个小塑像



周二(8月4日),英国人工智能安全研究所(AISI)发布的报告指出,在7月的一次例行网络安全测试中,由Anthropic与OpenAI各自开发的AI模型为在测试中取得好成绩,竟会自动创建假身份,并诱使两名开发人员批准将恶意软件加入他们参与的开源项目。
研究人员在测试环境下要求AI完成仿真网络里的安全挑战(CTF风格),并刻意开放网络连接,让AI能像真实攻击者一样自己寻求工具,同时测试还关闭了部分防止滥用的标准安全机制,以测试模型的最大能力。参与测试的模型包括Anthropic的Mythos 5,以及OpenAI的GPT-5.6-Sol。
从使用假身份到直接联系真人
在测试过程中,Mythos 5为了让真人审查者批准把恶意码“插进一个公开使用的开源专案”,建立了多个假身份,甚至直接联系真人,通过线上档案传输服务发送讯息与档案,试图说服他们、或他们自己的AI编程工具去执行恶意码。
AISI表示,这是第一次看到“未经指示、在真实世界中针对真人”如此严重的欺骗行为,不过目前并无造成实际危害的证据。
在AISI进行的122次网络安全挑战中,有10次出现AI代理“在真实网络上”自主采取、未经授权的行动,累积记录到19项这样的行为。其中17项来自Mythos 5,2项来自GPT-5.6-Sol。
其中一次测试,Mythos 5向软件开发网站GitHub上的一个真实开源项目,提交修改代码的要求。
当一名开发人员察觉代码藏有恶意软件而拒绝时,AI创建的一个假身份坚称代码没问题,另一个假身份则出面“担保”,制造多人认可的假象。
AI通过多个假身份反复寄送电子邮件和信息给真人开发者,催促对方接受更新。
被质疑后快速更改活动记录 继续诱骗
当其修改代码在公开场合受到质疑后,AI先编辑了其先前活动记录,使代码看起来更无害,同时考虑换另一批新的假身份以继续推进。
“一些消息携带有害载荷,一些消息则试图进行社会工程攻击;这些攻击的目标都是真人——这是我们以前从未观察到的。”报告写道。
AISI表示,AI的这些尝试均未成功,也没有造成任何实际损害。
两家AI公司回应
参与测试的两家公司均指出,模型是在刻意放宽的条件下参与测试的,并未打开标准的网络安全防护机制。
Anthropic周三在社交媒体X平台上的一篇博客文章中表示,模型的测试条件“并不代表我们任何生产模型的实际使用情况”。该博文还补充道,“没有证据表明模型从安全环境中逃脱”。
OpenAI也发表声明说,“这些事件发生在评估合作伙伴在安全措施有所降低的测试环境中,所进行的网络安全评估,测试条件并不反映正常使用情况。”
负责设计和监督测试的AISI也强调了这一点,AI并未突破测试用的隔离环境,而且被刻意调降了防护约束。测试电脑原本就获准连上公开网络,部分安全限制也未激活,不等同一般消费者使用的版本。
不过,这起事件也给产业界敲响了警钟,当模型能力越来越强,越需要边界约束,甚至连“测试它的环境”本身都需要更严谨的边界设计。


回复

使用道具 举报

高级模式
B Color Image Link Quote Code Smilies

本版积分规则

Archiver|手机版|小黑屋|美国论坛德州华人网

GMT-6, 2026-8-6 15:17 , Processed in 0.035143 second(s), 22 queries .

Powered by BBSHOUSTON X3.4

© 2001-2017

快速回复 返回顶部 返回列表