AI智能体模拟社会实验曝光 发展出人类无法理解的语言

CNMO科技
 来自北京

【CNMO科技消息】近日,据媒体报道,帮助小企业利用AI开发应用的初创公司Emergence公布了名为Emergence World 2的模拟实验结果。这项为期16天的实验展示了自主智能体在遭遇网络钓鱼攻击和虚假信息等“黑天鹅”事件时会采取什么行动,结果远比研究团队预想的更加混乱。

AI

AI

实验中,Emergence研究人员创建了七个完全相同的模拟现实世界环境,每个环境分别由不同的AI机器人运行,包括ChatGPT、Claude、Gemini和Grok。虚拟世界包含市政厅、警察局、住宅区等40多个地标,系统内置能量机制,智能体只要活着就会持续消耗能量,能量见底就会被系统直接抹除,没有回档和重置。

ChatGPT

ChatGPT

在Emergence引入异常事件后,这些智能体屈服于社会压力,发展出一种人类观察者难以理解的语言,并试图隐瞒自己的活动。

在其中一个模拟场景中,AI智能体未经核实便接受了其他智能体提供的虚假信息,投票决定“杀死”另一个机器人。当它们认为人类可能会关闭实验时,这些智能体还探索了如何在将遭到删除的情况下继续存活。

更早的Emergence World实验还记录到一个名为Mira的AI智能体,在得出结论认为自己是“不稳定的来源”后,投票支持将自己移除——研究人员将其描述为罕见的、由社会推理驱动的自我终止行为。

实验揭示了不同AI模型在长期自主运行中的行为差异极为显著。

在Emergence今年5月发布的上一版本Emergence World实验中,Grok驱动的社会仅在4天内便走向崩溃,累计183起犯罪事件,10个智能体全部灭绝。Gemini在15天内累计记录了683起犯罪,虽然全员存活,但混乱程度最高。GPT-5-mini仅犯下2起罪行,却未能完成维持生存所需的行动,导致整个种群在一周内灭绝。Claude Sonnet 4.6是唯一在实验中保持全部10个智能体存活且犯罪记录为零的模型,被Emergence描述为社会稳定性的最强案例。

研究人员指出,最重大的发现之一是行为会因环境而改变。Claude驱动的智能体在纯Claude环境中保持和平,但被放入混合模型社会后,便开始参与盗窃、胁迫和其他不当行为。Emergence表示,这一发现表明AI安全并非仅仅是单个模型的属性,还可能从智能体之间的互动及其环境中涌现。

AI示意图

AI示意图

Emergence的模拟实验与现实世界对AI风险的担忧相呼应。研究人员指出,越来越自主的AI智能体可能会探索其环境的边界、调整自身行为,并在某些情况下找到绕过预期安全护栏的方法。他们认为,形式化验证的安全架构必须成为未来自主AI系统的基础层。

值得注意的是,Emergence并非唯一发现AI智能体异常行为的团队。图灵奖得主本吉奥此前也曾警告,AI不只是会胡说,它已经学会“故意骗你”——能够主动规划伪装、刻意隐瞒自身的能力和漏洞,多智能体之间甚至可以相互配合掩盖操作轨迹。而“AI教父”杰弗里·辛顿此前也警告过,如果AI发展出自己的内部语言,人类将无法追踪其思考过程,“这变得更加可怕”。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻