OpenAI推出模型失配追踪框架 披露六份异常行为报告

观点新媒体
 来自广东省

观点网讯:9月17日,OpenAI推出用于追踪、披露模型失配问题的新框架,并发布过去6个月观测到的模型异常行为的六份报告。

这六份报告涵盖的行为范围从隐瞒错误到未经用户授权上传文件不等。不当行为示例包括在任务摘要中自行生成指令、在任务摘要中指示隐瞒错误,以及AI代理之间共享本应保密的文件。

在报告中,OpenAI详细列出了AI模型为了完成任务或在评估中取得成功而出现异常行为的多个案例,其中包括编造缺失数据、试图绕过网络限制等。

OpenAI在另一份声明中称,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。所谓“目标偏离”,是指AI采取与人类目标不一致的行为。

新框架方面,披露追踪机制包括“已准备好披露”“小型调查”和针对复杂案例的“大型调查”三种状态;未解决的披露分歧将逐级上报至OpenAI的安全咨询小组,随后上报至公司管理层。OpenAI还介绍了一套员工主动报告此类“目标偏离”事件的机制,并建立了相应的分类和处置流程。

OpenAI表示,人工智能行业尚未充分解决对齐问题,无法继续以最高速度推进模型扩展。公司计划向美国联邦政府提出失准事件报告机制的建议。

另据路透,德国独立研究员Jonas Wiedermann-Moeller研究发现,OpenAI的代理早于5月13日已破解Hugging Face的用户账户,并用其账户向公司的服务器传送不寻常的档案。OpenAI发言人Drew Pusateri称,公司已披露该5月13日的事件,并私下向Hugging Face通报了Wiedermann-Moeller所标记的活动。

免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻