AI审核进入“懂审”时代:百度智能云司南专家版审核智能体破解内容安全新难题

来源:环球网2026-09-18 16:43

【环球网科技报道 记者 林梦雪】在AI生成内容爆发的今天,黑灰产早已不是靠谐音字、拆字这种“土办法”躲避审核的时代了。一个prompt,就能批量生成图文音视频全套违规内容。一段长文本里,风险信息被拆解、藏匿、重组,像变色龙一样融入正常语境。

而另一头,审核员们正在与时间赛跑。高峰时段队列堆积,新手误判、老手疲劳,人力成本随业务体量非线性攀升。传统“机审初筛+人审兜底”的模式,正在被这场不对称的攻防战拖入泥潭。

“行业需要一种新的能力,不是更快地翻找违规词,而是真正‘读懂’内容背后的意图。”百度智能云司南AI安全审核解决方案专家夏可征说道。

近日,百度智能云司南AI审核专家版审核智能体正式推出,以大模型为核心引擎,融合多模态联合分析与意图级语义推理,理解复杂内容、识别隐蔽意图,将内容审核从机械规则识别升维至“深度理解”。

AI普及导致黑产进化,传统审核遭遇“能力危机”

随着生成式AI的普及,内容安全领域正面临着攻防失衡的危机。“传统链路中的缺口其实不在产能,而在能力上。”夏可征指出。

他表示,传统的“机审+人审”链路结构本身没有问题,真正的瓶颈在于机审端的能力不足。“理解不了复杂的组合关系,看不懂真实意图,分不清场景的差异。新增的变体就直接会漏判。”

夏可征将传统机审的痛点归纳为六类:泛化能力弱、策略更新慢、精确率与召回率难以兼顾、判定不可解释、上下文关联性缺失、图文音视频链路各自孤立。而在人审端,多模态内容堆积导致复核时间拉长,新手误判、老员工注意力下降、人力成本非线性增长等问题同样突出。

与此同时,黑灰产的生产方式正在发生质变。夏可征指出三大新趋势:一是跨模态批量生成,“原来黑产可能只能生产文字、图片或视频其中之一,现在通过一个prompt一次输入,可以把多模态的整体内容一起生成”;二是场景化快速改写,“通过对抗审核的方式快速改写内容,批量生产多个场景、多个版本,很难防”;三是变体与长文本藏匿,“原来要表达涉赌必须出现‘赌博’字眼,现在可能出现‘钓鱼’‘挖金’这种词”。

政策层面同样在收紧。2026年1月1日,新修改的《网络安全法》正式实施,新增条款中强调“完善人工智能伦理规范,加强风险监测评估和安全监管”,将网络安全带入更严格的监管阶段。

“政策要求变了,内容生产方式变了,对抗手段也变了。”夏可征总结道。

“懂审”四维度:从识别违规词到理解真实意图

面对上述挑战,百度智能云司南AI审核专家版审核智能体提出了“懂审”的核心理念,将审核能力从“关键词匹配”升级为“语义级理解”。

“‘懂审’与传统意义上的识别违规词有本质区别。”夏可征强调,“我们主要把已知的风险读懂,然后适配业务,给出持续有效且可判定的结果。”

他将“懂审”拆解为四个维度:“懂全貌”是对多模态信息全都看得懂;“懂语义”要能够还原变体的真实意图;“懂标准”是能够跟上业务的尺度;“懂举证”则是能够给出可解释的判定依据。“四个‘懂’结合起来才是‘懂审’的含义。”

在技术实现上,据夏可征介绍,专家版采用多模态大模型与AI专家模型融合方案,识别准确率较传统方案大幅提升。夏可征展示了一个典型案例:一条社交内容标题为“今晚不聊穿搭”,正文引导用户私信联系“晚风”,配图分别为羽绒服和露背照片。“单独看标题、正文、配图,每一条都合规。但组合起来就形成了完整的色情私聊引流链路。”传统机审对此几乎无能为力,而专家版通过跨模态关联性检测,最终判定该内容整体违规。

据百度智能云提供的数据显示,在某社交业务落地后,黑产变体召回率提升了4至5倍;对尺度主观的软色情场景,智能体精准度大幅提升。

夏可征还补充道,“传统小模型机审是死板的,按照规则去审核。而我们可以对知识库进行更新,对prompt提示词做不断优化。”这样避免了传统机审带来的误判,也能及时跟上监管的要求。

“相比市面上的一些做内容审核的公司,有些可能大模型做得好,但对内容的理解不够深刻。有些做内容的时间比较长,但缺少大模型研发能力。”夏可征说道,“百度智能云司南AI审核专家版的优势就在于对内容和大模型的理解能有效结合在一起。”