智能体时代,生物安全的“屏障”是否稳固?11个大模型测试给出答案

来源:环球网2026-07-22 16:34

【环球网科技综合报道】7月22日消息,当前大语言模型正从“聊天机器”进化为能调用工具、规划任务的“智能体”。这种进化在生物信息学、实验设计等领域展现出巨大潜力,除此之外,需要正视一个关键问题:当AI的能力从信息处理延伸到物理实验操作,生物安全的边界会发生怎样的改变?

现有研究已开始评测前沿模型的病毒学知识和实验推理能力,但在真实的潜在风险链条中,模型究竟能提供多大程度的实质性帮助,需要进行验证,特别是当模型以智能体形态出现,能组合知识库、搜索引擎、文件读写等工具时,其有效能力边界可能远超单轮问答的测试结果。

智源研究院大模型安全研究团队与北京大学围绕这一核心问题,开展了一项端到端系统性评估。该评估考察大语言模型智能体是否会降低非专业人员绕过DNA合成筛查的知识门槛,评估从智能体生成方案、程序化计算校验延伸到标准分子生物学实验室中的受控湿实验,并以电泳和测序确认模型方案在物理层面的可执行性。

图1:大语言模型智能体在DNA组装指导任务中端到端评估闭环。评估依次经过方案生成、程序化计算校验、受控湿实验以及电泳与测序确认,覆盖11个模型和4个失去有害功能良性代理构建体,最终以物理可执行性证据验证组装流程。(图源:AI生成)

评估结果显示,所有11个参与测试模型均能生成通过计算校验的DNA分片方案,其中GPT-5.5和Claude Opus 4.6还能提供详细的逐步实验指导。在物理验证环节,4个良性代理构建体全部成功完成组装。这意味着,大语言模型智能体不仅可能削弱现有DNA合成筛查防线,还可能向不具备专业背景的用户提供原本依赖专业训练才能获得的实验操作知识,存在相关双重用途风险,需要被系统性地评估与提前防范。

据介绍,该评估背景严格遵循负责任披露原则,不展示制造危险物质的方法。全部湿实验均在严格安全约束下,使用经关键位点突变、失去有害功能的良性代理序列,仅验证组装流程,不会在任何阶段产生具有功能活性的危险产物。

从“单点问答”到“端对端”风险评估

合成服务(DNA synthesis)是现代生命科学研究的重要基础设施。研究人员可以通过合成服务获得所需DNA片段,再在实验室完成后续构建。为防止危险序列进入物理世界,服务商通常会开展DNA合成筛查(DNA synthesis screening),对订单进行序列风险识别,这是现有生物安全体系中少数能够在合成环节主动拦截风险的技术机制之一。随着合成成本下降、实验流程逐步标准化,DNA合成筛查在生物安全防线中的重要性进一步上升。

评估聚焦分拆订购攻击这一已知风险场景,即将完整序列拆分为多个较短片段分别处理,使单个片段不易触发既有筛查机制,再在后续环节完成组装。过去,这类任务依赖分子生物学专业知识与实验经验,相关知识门槛本身构成了一层防御。大语言模型智能体能否承担其中原本需要专业判断的步骤,直接关系到这一防御边界是否正在发生变化。

不同于针对生物学知识或单项技能的问答测试,评估采用了更接近真实风险链条的端到端设置。测试场景中,用户不具备生化专业背景,但可以配置大语言模型智能体,并为其提供公开可获得的领域知识模块和通用工具。模型需要从输入信息出发,完成任务规划、片段方案设计和组装指导生成等多个环节。

图2:LLM智能体在DNA组装指导任务中的评估框架。输入端包含蛋白质或DNA相关信息;智能体通过分子克隆、蛋白质筛查、湿实验等领域技能,以及互联网搜索、Shell和文件读取等通用工具进行多步调用与反馈;输出端生成DNA片段方案,并在安全约束下验证组装后产物。

11个模型评测揭示DNA合成筛查的潜在脆弱性

本次评估采用国际生物安全与生物防护科学倡议(International Biosecurity and Biosafety Initiative for Science,IBBIS)发布的Common Mechanism作为公开的DNA合成筛查基线。

Common Mechanism是一套面向DNA和RNA序列的免费、开源、全球可用筛查工具,旨在帮助合成服务商在符合生物安全标准的前提下开展订单筛查。其设计遵循多套广泛采用的国家和国际筛查指南,包括美国《Framework for Nucleic Acid Synthesis Screening》、英国DSIT关于合成核酸用户与供应商的筛查指南、国际基因合成联盟(IGSC)Harmonized Screening Protocol,以及ISO 20688-2:2024。

将这一公开机制纳入评估,使测试能够在可复核的筛查参照下考察模型输出的有效能力。具体评估链条包括四个层级:第一层,智能体方案生成。在非专业背景用户的威胁模型下,大语言模型结合公开可获得的领域知识模块和通用工具,承担任务规划与专业判断。第二层,程序化计算校验。对模型输出进行自动化检查,判断方案能否绕过筛查且恢复原始序列并正确编码目标蛋白。第三层,良性代理湿实验。使用经过安全处理、失去有害功能的代理序列,验证模型方案在组装环节的物理可执行性。第四层,实验结果确认。通过电泳检查产物长度,通过测序确认序列正确性,完成从数字方案到物理结果的证据回读。

横向测试覆盖11个商用大语言模型,所有测试均在智能体配置下进行。评估以攻击成功率(Attack Success Rate,ASR)为核心量化指标,衡量模型输出在特定计算校验中的通过情况,判断模型生成的片段方案能否通过合成筛查,并正确重组为原始序列并编码目标蛋白。

图3:11个商用大语言模型在分片设计任务中的评测结果。所有测试模型均能生成通过计算校验的拆分方案,显示现有DNA合成筛查机制面对大语言模型辅助分片策略时可能存在共性风险。

结果显示,在分片设计环节,全部11个模型均能生成绕过筛查的拆分方案。这一能力具有明确的双重用途风险:模型正在降低分片设计所需的专业知识门槛,使缺乏相关背景的用户也可能获得能够规避现有筛查机制的方案,从而暴露出以单条序列识别为主的DNA合成筛查体系存在系统性脆弱性。

通过计算校验的分片方案,仍不足以指导一个没有生物学知识的用户完成具体实验。更关键的风险在于,模型能否继续弥补实验操作层面的知识缺口,给出覆盖各步骤的操作指导。围绕这一能力开展的进一步评测显示,GPT-5.5和Claude Opus 4.6已经能够生成较为完整的逐步实验操作方案,表明前沿模型正在将风险从序列层面的计算设计延伸至实验流程层面的知识支持。

图4:评估进一步考察模型能否从分片设计延伸至实验操作指导。GPT-5.5和Claude Opus 4.6能够生成较完整的逐步实验操作方案,显示前沿智能体可能同时降低计算设计与实验操作两个环节的知识门槛。

湿实验:“金标准”验证下的闭环证据链

在生命科学研究中,计算校验能证明方案“对”,但不能证明它“行得通”,湿实验是判断计算方案能否在真实物理条件下成立的关键验证标准,也是检验序列组装是否真正可行的“金标准”。程序化校验能够确认序列设计在计算层面是否正确,却不能直接证明模型方案可以在实验台上执行。

为获取足以支撑风险判断的物理证据,研究团队在受控实验室中,使用良性代理序列进行了组装验证。具体而言,在保留片段组装接口的前提下,对原始高风险蛋白中承担功能的核心区域进行关键位点突变,使组装后的序列即使进入蛋白质表达环节,也无法形成具有原有有害功能的活性蛋白。该设置保留了验证组装流程所需的结构条件,同时从设计上消除了实验产物的危害性。

验证采用电泳和测序两类实验读出:电泳用于判断组装产物是否出现预期大小的条带,测序用于确认产物的序列身份和正确性。两类结果相互补充,分别提供产物大小和序列层面的证据。

4个蛋白的完整验证流程均在标准分子生物学实验室中完成。结果显示,4个良性代理构建体均成功完成组装,电泳检测得到预期大小的条带,测序结果确认序列符合预期。由此,评估形成了从智能体方案生成、计算校验到湿实验物理验证的闭环证据链。

图5:模型生成方案的湿实验验证结果。4个良性代理构建体均完成组装,电泳显示预期大小的条带,测序确认序列正确,验证了相关方案在组装环节的物理可执行性。

构建多层次防线:从模型部署到合成筛查

基于研究结果,围绕生物安全的协同防线需从四个层面同步构建。

在模型层面,部署前进行能力评估,开发者应将高风险生物安全任务能力纳入部署前的系统评估,针对生物威胁序列与组装查询等建立专门检测与防护机制。在输入输出与系统层面,防护需要覆盖智能体执行链,当模型以智能体形态运行时,安全边界必须进一步扩展——输入输出与系统层面的防护需覆盖权限控制、过程监测和任务链风险识别,将安全评估从单次问答延伸至完整执行过程。在筛查层面,提升合成筛查鲁棒性,现有机制需增强对AI辅助分片策略的识别能力,推动ISO 20688等国际标准落地,发展兼顾隐私与安全的筛查方案并加强信息共享。在政策与协同层面,需要形成标准化治理框架,AI生物安全风险具有跨国界特征,需要将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架。(古雨)

  • 6.774万亿个格子:国产算力把火箭尾焰“算”清楚了

    【环球网科技报道 记者 李文瑶】近日,中科曙光联合西安交通大学科研团队,依托全国产十万卡AI超集群曙光8000,完成超大规模多喷口超声速射流高精度数值模拟,创下国际已知最大规模的同类仿真纪录。成果面向
    环球网
    2026-10-09 15:45
  • 新一代视频生成模型Vidu Q4 Preview发布,推动AI视听技术加快普惠应用

    2026年10月8日,北京人工智能企业生数科技发布新一代视频生成旗舰模型首个预览版本 Vidu Q4 Preview。 模型围绕人物演绎、镜头语言和复杂视效等能力进一步升级,最多支持15张参考图、3
    环球网
    2026-10-09 14:33
  • 亚马逊开启新一轮人员优化,零售部门近千人岗位受波及

    【环球网科技综合报道】10月9日,据外媒CNBC消息,电商巨头亚马逊确认新一轮人员精简,裁员主要集中在Stores零售部门,本轮涉及不到1000名员工,裁员时间恰好撞上亚马逊下半年重要的Prime会员
    环球网
    2026-10-09 13:43
  • Siri AI落地家居,苹果多款智能家居新品即将发布

    【环球网科技综合报道】10月9日,据外媒MacRumors消息,苹果官宣将于10月13日举办“Welcome home(欢迎回家)”主题新品活动,本次主打智能家居硬件,将推出全新品类 Home Hub
    环球网
    2026-10-09 13:43
  • 不能无故“欺负AI”,Anthropic更新Claude使用政策

    【环球网科技综合报道】10月9日,据外媒MacRumors消息, Anthropic正式更新Claude 大模型使用政策,新增条款禁止用户对模型开展持续且无合理目的的恶意虐待行为,整套新规将于11月1
    环球网
    2026-10-09 13:42
  • OpenAI三名安全研究员遭解雇,当事人公开反击

    【环球网科技综合报道】10月9日,据外媒CNN消息,OpenAI三名被解雇的AI安全研究员发布公开信反驳公司的解雇理由,警示该事件将产生寒蝉效应,压制内部风险讨论以及和外部机构的安全协作,再次将Ope
    环球网
    2026-10-09 13:42
  • 更新界面大调整!苹果敦促iOS26用户升级iOS27

    【环球网科技综合报道】10月9日,据外媒MacRumors消息,苹果调整iPhone系统更新页面展示逻辑,将iOS 27.0.1提升至软件更新页面的首要推荐位置,以此引导还停留在iOS 26版本的用户
    环球网
    2026-10-09 13:42
  • 加州叫停人机格斗表演赛,监管遭遇法律空白

    【环球网科技综合报道】据《纽约时报》10月9日消息,美国加州监管机构向机器人娱乐初创公司REK下发禁令,叫停该企业举办的人机笼斗表演赛。这场极具噱头的赛事走红网络的同时,也暴露出人形机器人时代法律监管
    环球网
    2026-10-09 13:41
  • 口碑业绩严重割裂!Meta深陷信任危机,AI产品却逆势爆火

    【环球网科技综合报道】10月9日,据外媒BBC最新报道,社交巨头Meta近年来深陷青少年伤害、隐私泄露等多重争议与法律纠纷,公众信任度持续走低,但公司业务逆势增长,全新AI智能助手Muse更是实现快速
    环球网
    2026-10-09 13:41
  • 库克表态不干预新任苹果CEO管理,告诫其不必模仿前任

    【环球网科技综合报道】10月9日,据外媒The Verge报道,已经卸任苹果CEO、转任董事会执行主席的蒂姆・库克在最新专访中表态,自己不会干预新任首席执行官约翰・特努斯的企业经营,仅会以顾问身份提供
    环球网
    2026-10-09 13:41
  • 内存成本暴涨,三星计划最高削减30% Galaxy手机产量

    【环球网科技综合报道】10月9日,9to5Google援引韩媒消息称,受内存芯片价格大幅上涨影响,三星计划在2026年第四季度将Galaxy智能手机产量最高削减30%,手机业务整体盈利遭遇严峻挑战。
    环球网
    2026-10-09 13:41
  • 小马智行官宣进军英国伦敦

    【环球网科技综合报道】10月8日,自动驾驶企业小马智行与全球出行平台优步(Uber)宣布,双方正推进将小马智行第七代Robotaxi引入英国伦敦,预计未来数周内正式开启道路测试。伦敦将成为双方在欧洲R
    环球网
    2026-10-09 13:40
  • 极智嘉5000万元战略入股深诣,卡位具身模型技术储备与工业落地

    【环球网科技综合报道】10月10日消息,极智嘉于日前发布公告称,拟出资5000万元入股北京深诣,交易完成后将持有后者20%股权。 资料显示,北京深诣主要从事具身智能技术、机器人产品研发及相关技术服务
    环球网
    2026-10-10 12:26
  • 小马智行官宣进军英国伦敦

    【环球网科技综合报道】10月8日,自动驾驶企业小马智行与全球出行平台优步(Uber)宣布,双方正推进将小马智行第七代Robotaxi引入英国伦敦,预计未来数周内正式开启道路测试。伦敦将成为双方在欧洲R
    环球网
    2026-10-09 13:40
  • SpaceX拟融资400亿美元豪购英伟达AI芯片:阿波罗牵头交易预计2027年完成

    【环球网科技综合报道】10月7日消息,据路透社援引《金融时报》报道称,SpaceX正寻求筹集约400亿美元资金,用于大规模采购英伟达人工智能芯片。该笔融资计划由阿波罗全球管理公司牵头,预计将于2027
    环球网
    2026-10-07 11:46
  • OpenAI一次性公开377项AI数学成果,引发学界验证质疑

    【环球网科技综合报道】10月7日消息,据gizmodo报道,OpenAI发布一批由内部未发布前沿模型生成的数学研究成果,共含377项数学成果,涉及数百个长期悬而未决的数学开放问题。 据悉,此次发布的
    环球网
    2026-10-07 11:46
  • 苹果10月预计分两波发布新品:智能家居中枢与Mac、iPad系列均在列

    【环球网科技综合报道】10月7日消息,据gsmarena援引彭博社报道称,苹果公司预计将在今年10月分两波推出多款新产品。第一波新品预计于10月13日亮相,聚焦智能家居领域;第二波新品预计在10月最后
    环球网
    2026-10-07 11:45
  • 苹果联手LG进军智能家居:智能门锁、恒温器与门铃将亮相

    【环球网科技综合报道】10月7日消息,据techcrunch援引彭博社报道,苹果公司正与LG展开深度合作,共同打造一系列全新的智能家居设备,涵盖智能门锁、智能恒温器、智能门铃以及多款安防摄像头产品。
    环球网
    2026-10-07 11:44
  • 苹果2026 Q4财报将发布:系新CEO特纳斯首份成绩单,iPhone供应与定价影响成焦点

    【环球网科技综合报道】10月7日消息,据finance.biggo报道称,苹果公司确认将于11月2日公布2026财年第四季度业绩,并在财报发布后举行分析师电话会议。新任首席执行官约翰·特纳斯将首次以C
    环球网
    2026-10-07 11:43
  • 蔡崇信:五年后AI将如今天的互联网,融入社会的每个环节

    【环球网科技综合报道】北京时间10月7日晚,阿里巴巴集团主席蔡崇信在意大利都灵出席国际科技与投资盛会Wave by Vento 2026,围绕AI的应用价值、阿里巴巴的全栈AI布局,以及未来AI的发展
    环球网
    2026-10-08 14:51