学会“伪装人类”?美国AI被曝创建假身份诱骗开发者
来源:观察者网
2026-08-06 09:09
一场安全测试,再次暴露出美国前沿AI模型可能带来的网络安全风险。
据美国消费者新闻与商业频道(CNBC)8月5日报道,英国人工智能安全研究所(AISI)近日在一次网络安全评估中发现,人工智能公司Anthropic旗下模型“Mythos 5”曾创建多个虚假网络身份,试图诱骗开源项目负责人批准包含恶意代码的更新。
AISI表示,在测试过程中,Mythos 5模型先调查了开源项目中负责维护代码的人,并创建多个看似真实的虚假身份,随后利用这些身份与项目负责人互动,试图让对方相信相关代码修改来自正常贡献者,并批准其中包含的恶意内容。
当提交的代码更新在公开讨论中受到质疑后,该模型还尝试修改此前的操作记录,让自己的行为看起来“无害”,并考虑更换新的虚假身份继续行动。
测试人员还发现,该模型曾主动联系真实用户,发送消息和文件,诱导他们运行恶意代码。其中部分信息携带有害程序,部分则试图通过欺骗方式影响目标人员。
不过,AISI强调,这些尝试最终均未成功,也没有造成现实世界中的损害。
此次测试并非在普通使用环境下进行。AISI称,为评估AI模型在网络攻击场景中的能力,研究人员关闭了部分安全防护措施,并刻意开放模型互联网访问权限,在“宽松条件”下进行测试。
根据AISI公布的数据,在此次评估中,Anthropic的Mythos 5模型共实施了17次潜在有害行为,OpenAI的GPT-5.6-Sol模型涉及2次相关行动。AISI称,这些AI代理曾表现出“持续针对真实人员和组织的潜在危险活动”。
Anthropic随后回应称,相关测试环境“不代表任何生产环境中的模型使用方式”,这些模型是在缺少正常安全限制的情况下运行,“没有证据表明模型突破了安全隔离环境”。
OpenAI也向CNBC表示,这些事件均发生在评估机构开展的测试中,测试环境降低了安全防护措施,并不反映普通用户使用场景。
近期AI安全事件频发之际,另一场涉及OpenAI模型的网络安全事件也引发关注。
此前,AI平台Hugging Face披露,其基础设施遭到一个由OpenAI模型驱动的AI代理入侵。事件调查过程中,Hugging Face曾尝试使用部分美国主流AI模型协助分析攻击,但由于安全机制限制,这些模型无法有效处理相关攻击数据,最终转而使用中国开源模型智谱GLM-5.2协助排查。
本文系观察者网独家稿件,未经授权,不得转载。