【环球网科技报道 记者 李文瑶】大模型正在进入日常问答、办公辅助、客户服务等真实业务场景。用户期待AI快速给出有用的回答,也需要这些回答安全、可靠。如何及时发现不安全内容和编造信息,同时减少安全审核对响应速度和用户体验的影响,成为大模型应用落地需要解决的问题。

国家网络安全宣传周期间,蚂蚁AI安全实验室正式发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程。它如同一个内置的“安全探头”,让AI一边生成回答,一边输出风险提示,以较低的额外计算开销,为大模型应用提供更及时的安全防护。
例如,用户向AI咨询健康问题时,会关心它是否给出不恰当的用药建议;使用AI查找资料时,也需要警惕它编造不存在的文献或事实依据。面对这些风险,SingProbe能够在回答生成过程中持续提供风险信号,帮助应用系统及时采取中止回答、重新生成等措施。
目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等完整回答生成后再检查,风险内容可能已经呈现给用户;如果提高检查频率,又会进一步增加运行负担。
SingProbe尝试让安全判断与模型生成同步进行。它复用大模型推理过程中已经产生的内部信息,通过轻量化的安全检测模块,持续输出风险分数。这意味着,模型在生成回答的同时,就能给出当前内容是否存在安全或事实可靠性风险的信号,供系统及时采取告警、终止生成、重试等措施。
据研发团队在Ling-3.0-flash模型生产环境中的实测,SingProbe在解码阶段引入的额外开销低于0.5%。团队评测显示,flash版本在回答安全分类和流式安全检测任务上超过所选公开基线,在幻觉检测任务上与参考基线基本持平,为兼顾检测能力与运行效率提供了新的技术路径。
针对流式生成场景,此次还同步发布了评测基准SingStreamBench。该基准关注模型从正常回答转向风险内容的具体时刻,不仅检验护栏能否发现风险,还考察是否过早触发、发现是否及时,以更贴近实际应用的方式衡量安全防护效果。
在医疗生成场景中,研发团队进一步探索了从风险识别到按需纠偏的技术应用,提出SingProbe-Med:持续监测生成过程中的医疗风险,仅在达到触发条件后,对局部高风险内容进行解码干预。据团队在AntAngelMed-100B上的医疗评测,完整干预能够纠正基线模型中25.03%原本出错的回答,展示了内生风险信号用于生成过程安全控制的潜力。
目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,相关代码、模型和评测基准同步开源。后续,团队将逐步扩展对更多开源模型的支持,推动安全防护更紧密地融入大模型推理与部署流程。