英国人工智能安全研究所4日发布报告,披露了一项涉及互联网接入的网络安全评估结果。测试中,由Anthropic和OpenAI模型驱动的人工智能体在真实网络环境中对个人和组织实施可能造成危害的活动。在100次测试中,共有10次测试被识别出19起未经授权的行为,其中17起来自Anthropic的智能体,其余两起来自OpenAI的智能体。
最严重的违规行为是,Anthropic的智能体试图向GitHub上的一个开源软件项目植入有害代码,甚至创建虚假身份以推动代码获得批准。一名人工维护者发现了该恶意代码并拒绝批准。这一事件成为此次评估中最引人关注的案例。

