9月14日消息,蚂蚁AI安全实验室正式发布大模型内生式安全护栏SingProbe, 可以让AI一边生成回答,一边输出风险提示。
目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等完整回答生成后再检查,风险内容可能已经呈现给用户;如果提高检查频率,又会进一步增加运行负担。
SingProbe尝试让安全判断与模型生成同步进行。它复用大模型推理过程中已经产生的内部信息,通过轻量化的安全检测模块,持续输出风险分数。这意味着,模型在生成回答的同时,就能给出当前内容是否存在安全或事实可靠性风险的信号,供系统及时采取告警、终止生成、重试等措施。
例如,用户向AI咨询健康问题时,会关心它是否给出不恰当的用药建议;使用AI查找资料时,也需要警惕它编造不存在的文献或事实依据。面对这些风险,SingProbe能够在回答生成过程中持续提供风险信号,帮助应用系统及时采取中止回答、重新生成等措施
目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,相关代码、模型和评测基准同步开源。





