国家网络安全宣传周期间,蚂蚁AI安全实验室正式发布大模型内生式安全护栏SingProbe。该技术将安全检测融入模型生成过程,使模型在输出回答的同时持续提供风险信号,以较低的额外计算开销为大模型应用提供更及时的安全防护。
随着大模型进入日常问答、办公辅助、客户服务等真实业务场景,用户对AI回答的安全性和可靠性提出了更高要求。如何及时发现不安全内容和编造信息,同时减少安全审核对响应速度和用户体验的影响,成为大模型应用落地过程中需要解决的关键问题。例如,用户向AI咨询健康问题时,需要关注其是否给出不恰当的用药建议;使用AI查找资料时,也需要警惕其编造不存在的文献或事实依据。
目前,大模型应用通常采用独立的外置护栏模型审核输入或输出内容。这种方式通用性较强,但需要额外处理待审核内容,增加了计算和部署成本。若等完整回答生成后再进行检查,风险内容可能已经呈现给用户;若提高检查频率,又会进一步增加运行负担。SingProbe的设计思路是让安全判断与模型生成同步进行,复用大模型推理过程中已经产生的内部信息,通过轻量化的安全检测模块持续输出风险分数。当检测到风险时,应用系统可及时采取中止回答、重新生成等措施。
据研发团队在Ling-3.0-flash模型生产环境中的实测数据,SingProbe在解码阶段引入的额外开销低于0.5%。团队评测显示,flash版本在回答安全分类和流式安全检测任务上超过所选公开基线,在幻觉检测任务上与参考基线基本持平,为兼顾检测能力与运行效率提供了新的技术路径。
针对流式生成场景,团队同步发布了评测基准SingStreamBench。该基准关注模型从正常回答转向风险内容的具体时刻,不仅检验护栏能否发现风险,还考察是否过早触发以及发现是否及时,以更贴近实际应用的方式衡量安全防护效果。
在医疗生成场景中,研发团队进一步探索了从风险识别到按需纠偏的技术应用,提出SingProbe-Med。该方案持续监测生成过程中的医疗风险,仅在达到触发条件后对局部高风险内容进行解码干预。据团队在AntAngelMed-100B上的医疗评测,完整干预能够纠正基线模型中25.03%原本出错的回答,展示了内生风险信号用于生成过程安全控制的潜力。
目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,相关代码、模型和评测基准同步开源。后续团队将逐步扩展对更多开源模型的支持,推动安全防护更紧密地融入大模型推理与部署流程。
从行业视角来看,SingProbe所代表的内生式安全护栏思路,将安全检测从外挂式的事后审核转变为与生成过程同步的原生能力。这一技术路径若能在更广泛的模型和场景中得到验证,有望降低大模型安全部署的综合成本,为AI应用在医疗、金融等高风险垂直领域的规模化落地提供基础设施层面的支撑。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。