科技·商业·财经

蚂蚁开源SingProbe:以轻量探针实现大模型生成风险实时拦截

   时间:2026-09-14 21:24 作者:苏婉清

蚂蚁集团AI安全实验室近日宣布,正式开源一款名为SingProbe的大模型内生式安全护栏技术。与传统的外挂式安全审核模式不同,该技术通过复用基座模型推理过程中的隐藏状态,以极低的计算成本实现风险信号的实时输出,为人工智能安全领域提供了全新解决方案。

当前主流的大模型安全防护普遍采用外挂架构,即在模型输入输出两端分别部署独立审核模块。这种设计虽然能实现完整内容检查,但存在双重计算成本高、响应延迟大等缺陷。更关键的是,外挂模型容量通常仅为基座模型的十分之一,面对复杂语义时容易出现理解偏差,导致误判或漏判风险内容。

SingProbe创新性地采用内生式设计,直接读取模型推理过程中产生的隐藏状态信息。通过部署仅数百万参数的轻量级探针,该技术能够在文本生成过程中同步完成意图分类、安全检测和幻觉识别三项核心任务。实验数据显示,其额外计算开销不足0.5%,却能实现token级别的实时风险评估,在内容完整输出前即可完成拦截。

在医疗健康等高风险场景中,这种技术优势尤为突出。当模型处理用药建议、疾病诊断等敏感信息时,SingProbe可持续监测每个生成单元的安全性,对潜在风险内容实施毫秒级阻断。这种特性有效解决了传统方案中"先生成后审核"导致的暴露风险,为医疗AI应用提供了关键安全保障。

从行业格局来看,外挂式方案仍是当前主流选择。包括绿盟科技、百度、阿里巴巴等国内企业,以及国际知名的Llama Guard 3、ShieldGemma等项目,均采用这种成熟架构。而内生式安全技术作为新兴方向,虽然学术界已有相关研究,但SingProbe是首个由大型科技企业开源的完整解决方案,目前已实现与29个主流大模型的适配。

该技术的开源代码和预训练模型已同步发布,包含完整的实现框架与使用文档。这种开放姿态将推动行业建立更高效的安全防护标准,特别是在需要实时风险监控的垂直领域,为人工智能技术的可信应用提供重要支撑。

 
 
更多>同类内容
全站最新
热门内容