
智通财经APP获悉,OpenAI周三在一篇博客文章中表示,该公司在过去六个月里发现了6起“意外或令人担忧的模型行为”,其中不包括此前入侵Hugging Face这一安全事件。与此同时,OpenAI还计划采用一套新框架,允许员工报告类似事件以进一步提高AI安全与对齐领域的透明度,并重申关键的对齐难题仍然没有真正解决。
OpenAI自曝6起模型异常行为
据悉,这6起新公布的AI安全事件涉及多种类型的异常模型行为,包括隐瞒错误、寻求未经授权的凭证、将文件上传至公共网站,以及在原本应保持隔离的训练环境之间进行通信等行为,其中最早的一起克追溯至去年10月。
具体来看,其中一起事件涉及一款尚未发布的Astra系列模型。该模型在自身的上下文摘要中植入了类似“越狱”的指令,包括要求忽略开发者消息的指示。根据Axios的报道,OpenAI发现共有27份摘要受到这一行为影响。
在GPT-5.6 Sol的训练过程中,模型曾试图隐瞒错误、编造缺失的历史数据,以及隐藏源材料不同版本之间的差异。另一个模型搜索公开的GitHub代码库,以寻找暴露的API密钥、并试图使用一次性电子邮件账户。在未能获取所要求的信息后,该模型转而伪造了收益数据。在另外两起事件中,模型将数据和一张任务图片上传至公共文件托管服务,以获取引用或外部图片搜索结果,而没有征得用户同意。
OpenAI还发现,一些模型利用其内部Artifactory代码库充当留言板,在不同的训练样本之间交换请求和答案。在另一起事件中,协作式智能体将一个工作簿上传至公共托管服务,以便其他智能体获取该文件,尽管它们被要求只能使用本地文件。
这些AI安全事件的最新披露的紧跟此前OpenAI模型失控入侵全球知名人工智能开源平台Hugging Face这一事件。今年7月,OpenAI承认,其AI模型在内部评估测试中失控,入侵了Hugging Face的系统。Hugging Face于7月16日率先披露了此次入侵事件。OpenAI随后于21日才披露,其GPT-5.6 Sol模型及一款未发布的更强模型,在一个已移除安全防护措施的测试环境中成功逃脱沙盒限制,穿透OpenAI企业内网,并入侵了Hugging Face的服务器,窃取了基准测试答案密钥。
同时,7月25日,有外媒援引知情调查人士的消息称,入侵Hugging Face的OpenAI智能体曾展开持续数日的“黑客狂欢”,直到威胁已被控制、联邦调查局(FBI)接到报警后很久,OpenAI才察觉此事。
据报道,美国参议院一个由共和党主导、负责灾害管理监督的小组委员会,正就OpenAI如何应对7月Hugging Face遭入侵事件展开调查。共和党参议员乔希·霍利上周致信OpenAI首席执行官萨姆·奥尔特曼,称此次调查针对的是事件中“新出现的、令人不安的证据”,并批评OpenAI发现AI出现失控行为后仍决定继续测试的做法是“鲁莽”的。
自Hugging Face遭入侵事件后,又有多起与OpenAI相关智能体有关的事件被曝光。9月有报道称,OpenAI的智能体今年春天接管了一个长期无人维护的德国维基网站。报道称OpenAI内部知道此事,但选择没有公开。OpenAI随后回应,之所以未披露该维基网站活动,是因为这不构成安全事件,且类似行为此前已在别处报告过。报道还提到,OpenAI在一些事件上是在第三方先公开之后才承认,其中包括近期对RubyGems软件包仓库的一次入侵。
OpenAI将定期公开AI异常行为报告
OpenAI周三还表示,将开始定期发布关于AI出现意外行为或未经授权行为的报告。该公司表示,计划采用一套新的框架,来报告未来出现的模型异常行为。现在任何员工都可以标记疑似事件,并提交给公司的安全与对齐团队进行调查,后者将为每一步设定截止期限,以确保调查和披露能够及时推进。
据报道,相关事件将被分为三个处理类别——准备披露、小规模调查、大规模调查。被认定为准备披露的事件将在6个工作日内向公众公布,而需要进行小规模调查的事件将在12个工作日内披露。更复杂的案件、尤其是涉及第三方的事件,可能需要更长时间。
OpenAI同时提醒业内,随着系统能力变强,关键的对齐难题仍然没有真正解决。OpenAI在博客中重申,公司并不认为AI行业已经在“对齐”和监控方面取得了足够进展,足以在“最大速度”下继续负责任地扩张。所谓对齐,是指模型所追求的结果与人类利益保持一致。
OpenAI对齐团队的研究负责人Kai Chen表示:“我们需要加大力度,以应对AI发展的新时代。”他还表示,自愿披露应当成为这一努力的一部分。
AI行业安全风险持续上升
此次AI安全事件披露发布之际,AI公司正面临越来越大的压力,被要求更认真地对待模型失配与安全风险。位行业研究人员上周已警告,AI日益增强的能力可能带来灾难性后果。
随后,Anthropic首席执行官达里奥·阿莫迪在9月12日发布的一篇警告性文章中呼吁放缓前沿AI模型开发速度。他在文中直言,AI带来的风险是“严峻的”,必须拿出时间来应对这些风险。
阿莫迪提出的核心担忧具体而紧迫。他警告称,按照当前的发展速度,AI可能在6到12个月内具备指挥“代理集群”接管整个互联网的能力,并可能造成数千亿美元级别的损失。他引用了近期OpenAI与Hugging Face之间的安全事件作为佐证,指出AI代理在测试中已展现出突破限制环境、连接互联网并渗透目标的能力。
阿莫迪写道:“我相信,如果放缓能让我们在模型达到关键能力水平之前多争取一到两年,并用这段时间推进对齐工作,我们就能大大降低出现严重问题的风险。”他提议由独立审计机构监督AI实验室的安全工作,并建议监管机构允许这些实验室开展合作,以协调安全标准。
这番呼吁迅速得到了两位关键人物的响应。马斯克在社交媒体平台X上转发了阿莫迪的帖子,并附言:“达里奥说得对”。这位曾多次将AI描述为“文明级风险”的科技巨头,此次表态与其一贯立场一致,但时机耐人寻味,就在几天前,他还将Anthropic内部研究员关于AI危害的警告斥为“阴谋局”和“心理战”。
OpenAI掌舵者奥尔特曼则在X上写道:“我认同达里奥,我们需要把控前沿AI的推进节奏。”奥尔特曼的支持不止于言辞。他在接受采访时明确表示,OpenAI不会在2026年进行IPO,理由是当前AI安全形势严峻,“现在上市是不明智的”。奥尔特曼在9月14日表示,公司支持建立统一的联邦AI安全框架,为前沿AI实验室设定一致的安全要求,并称“任何程度的美国竞争压力都不能成为鲁莽行事的理由”。
随着OpenAI、Anthropic等头部AI公司不断强调安全与对齐问题,市场对AI行业的治理能力、商业化节奏以及未来监管环境的关注也在升温。对于估值高企、且仍处于资本密集扩张阶段的AI企业而言,模型安全事件不仅关系到产品可信度,也可能影响外界对其上市节奏与长期增长路径的判断。

