蚂蚁开源大模型安全护栏SingProbe,已适配29个主流开源模型

财经网
 来自北京

9月16日消息,蚂蚁AI安全实验室宣布开源大模型内生式安全护栏SingProbe,同步开放相关代码、模型和评测基准,为开发者提供与模型生成过程同步运行的安全检测能力。目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,支持开发者在现有推理流程中集成安全防护。

随着大模型进入日常问答、办公辅助、客户服务等业务场景,开发者既需要关注回答质量,也需要及时发现不安全内容和编造信息。

目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等待完整回答生成后再检查,风险信号可能来得太晚;如果提高检查频率,又会进一步增加运行负担。

运行时探针是学界探索兼顾安全检测效果与运行效率的一条技术路径,但从研究走向实际应用,还需要模型适配、推理框架集成等工程支持。SingProbe通过适配多种开源模型、接入主流推理框架,补充了相关部署能力,让开发者更方便地将内生式安全护栏接入实际业务。

SingProbe如同一个模型内的“安全探头”,通过复用大模型推理过程中已经产生的内部信息,持续输出用户意图、回答安全和幻觉风险分数。模型一边生成回答,探针一边提供风险信号,应用系统无需等待整段回答结束,就可以据此采取告警、中止回答、重新生成等措施。

热点新闻