【环球网科技综合报道】当AI从“一问一答”的对话模式走向持续感知、跨应用协同的智能体阶段,移动芯片的计算架构正面临一次新的重构。高通技术公司产品市场高级总监Cisco Cheng近日发表署名博客文章,介绍下一代旗舰移动平台将搭载的全新Hexagon NPU。该NPU针对智能体AI的持续运行、多模态推理和低时延需求设计,引入Element Accelerator专用加速单元与大容量共享内存系统,为终端侧运行智能体AI提供硬件支撑。

从单一大模型到多模型协同 智能体AI改变计算需求
智能体AI能够理解用户个人情境、跨应用协同运行、持续推理,并根据用户意图完成操作。随着AI智能体化深入,主流架构正从依赖单一庞大模型处理所有任务,转向由多个专用模型组成的系统,根据任务、情境和用户需求进行智能调度。
这一转变对移动计算提出了新要求:不仅需要更快的AI推理能力,还需要面向持续运行、多模态且低时延场景设计的架构。下一代骁龙旗舰移动平台为此引入全新Hexagon NPU,包含两项关键特性——Element Accelerator和扩展后的大容量共享内存系统。
Element Accelerator与共享内存协同 助力提升智能体响应速度
Element Accelerator专为生成式AI和智能体AI的Transformer工作负载设计,结合向量计算单元和标量计算单元,加速大模型中的关键运算,帮助智能体提升响应速度和推理效率,同时兼顾移动端能效。
与此同时,Hexagon NPU扩展了大容量共享内存。通过将多模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,该平台能够缓解内存瓶颈,使智能体在处理更长上下文、调用更多工具以及执行并发任务时保持流畅响应。大容量共享内存减少了访问外部内存的频次,支持更长的上下文窗口和更快的token生成速度,使智能体在工具和任务之间切换更为顺畅。
在计算单元层面,向量计算单元负责高吞吐量AI数学计算,标量计算单元则支持智能体对决策逻辑、路由和编排能力的需求。三者与共享内存组成协同架构,共同加速Transformer工作负载、处理控制逻辑复杂的智能体任务,并将上下文数据保留在靠近计算单元的位置。
混合专家模型与多精度支持 平衡性能与功耗
Hexagon NPU同时面向下一代模型架构设计。高通技术公司正与内存和模型厂商合作,引入混合专家模型(MoE)构建终端侧AI架构。以一个300亿参数的MoE模型为例,在保持数百亿参数可用的同时,NPU每次生成一个词元仅需激活约30亿个被路由选中的参数。与每次推理都需要大部分网络参与的密集模型不同,MoE根据输入动态选择专用专家网络,从而减少实际计算负载和内存带宽需求。结合专家模块闪存到内存的加载管理机制与缓存技术,该方法能够以较低功耗和内存需求实现较大模型级别的AI体验。
在精度支持方面,该平台覆盖INT2、INT4、INT8、FP8和FP16,使开发者能够在性能、内存、模型质量和功耗之间取得平衡。规模较小的模型可承担更多端侧AI任务,较大模型则在处理复杂任务时调用。对于基于INT4的模型,该平台可实现最高50%的预填充性能提升,同时加快解码吞吐速度、增强推测解码,提升每秒词元生成速度。
终端侧智能体AI进入硬件落地阶段
智能体AI的核心特征是持续运行和即时响应,这要求计算能力尽可能靠近用户、留在终端侧,而非完全依赖云端。下一代Hexagon NPU通过加速单元、共享内存、多精度支持和模型加载机制的协同,使更多智能能力能够在终端运行,同时兼顾响应速度、隐私保护和功耗控制。
从对话式AI到智能体AI,移动计算的重心正在从“单次推理”转向“持续协同”。Hexagon NPU的技术布局表明,芯片厂商已开始从硬件架构层面回应这一变化,终端侧智能体AI正从概念走向可落地的产品体验。随着下一代骁龙旗舰移动平台的推出,这些技术将进入消费终端,接受真实应用场景的检验。(心月)