300亿参数MoE大模型“装进”手机,高通携手合作伙伴推动端侧智能体落地

来源:环球网2026-09-23 13:21

【环球网科技综合报道】当一个拥有300亿参数的MoE(混合专家)大模型能够完整部署在智能手机平台上,而无需依赖云端完成推理, AI体验会发生怎样的变化?北京时间9月22日,在2026骁龙峰会期间,高通宣布携手阶跃、无量火与江波龙开展四方合作,基于第六代骁龙8超级至尊版移动平台,将阶跃StepEdge-Omni 30B-MoE模型面向端侧进行深度适配与推理优化,打造具备自主服务和个性化能力的端侧智能体助手,并在峰会现场完成基于高通参考设计的演示,验证了复杂智能体AI工作流在智能手机上的部署与扩展能力。

第六代骁龙8超级至尊版移动平台

与每次推理均需激活全部参数的稠密模型相比,MoE模型仅按任务需要激活部分专家模块,在保持大模型容量与能力的同时,降低计算量和内存带宽需求。因此,MoE日益成为推动云端规模大模型向终端侧部署的技术路径之一,为智能体AI体验在智能手机、PC及其他终端落地提供了现实基础。

新一代移动平台为端侧大模型提供硬件支撑

第六代骁龙8超级至尊版移动平台搭载Qualcomm Oryon CPU、下一代Adreno GPU和重新设计的Hexagon NPU,并配备LPDDR6内存与高速存储通道,面向智能体AI体验提供计算支撑。

其中,定制Oryon CPU峰值频率达5GHz,并引入可扩展缓存架构Oryon FlexCache,支撑智能体多任务处理和系统规划能力;Adreno GPU引入针对AI负载打造的Adreno Matrix Cores,并支持Adreno Neural Fusion特性,将AI和图形处理结合;Hexagon NPU则面向智能体AI的Transformer工作负载引入Element Accelerator,并将大容量共享内存扩容50%,提升端侧推理性能。

四方协同优化内存需求降低超50%

在硬件平台基础上,无量火的自研Ember推理引擎与Ember Kernel端侧编排内核,基于第六代骁龙8超级至尊版移动平台的AI性能和软件栈支持,以XCompute异构调度实现跨CPU/GPU/NPU的统一高性能编排,在不修改模型结构、不损失推理精度的前提下,使阶跃30B-MoE模型的运行内存需求较行业常规方案降低超50%。

基于江波龙提供的端侧AI存储解决方案,模型权重可从端侧闪存高效加载,通过存储与计算协同减少大模型对运行内存的持续占用,提升模型加载和运行效率。四方合作打造的端侧智能体助手,实现从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享到邮件草拟的自主办公流程,全程本地完成,无需云端调用。

性能数据方面,得益于NPU+GPU双引擎协同,模型预填充吞吐性能超过330 Token/s,较NPU单引擎方案提升超过30%,解码吞吐性能超过28 Token/s,并能保持持续稳定运行,首个词元生成速率达到毫秒级,较云端API调用快数倍至数十倍。

端侧AI从概念走向规模化应用

高通技术公司高级副总裁兼手机业务总经理Chris Patrick表示,此次合作展现了硬件、软件、内存和AI模型等多个领域的技术进步,如何推动复杂的AI工作负载直接在移动终端上运行。通过与阶跃、无量火和江波龙合作,团队优化了阶跃30B-MoE模型在第六代骁龙8超级至尊版移动平台上的部署,在提升吞吐性能、降低内存需求的同时,实现了持续稳定的终端侧运行。这些成果有助于推动响应快速、注重隐私保护的AI体验直接在智能手机上运行。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick

阶跃副总裁、端侧模型负责人俞刚表示,阶跃30B-MoE模型在第六代骁龙8超级至尊版移动平台上完成跑通和验证,平台的端侧算力释放了模型的推理能力,为低时延、高隐私的端侧智能体应用拓展了应用空间。

无量火CEO王瑜琨表示,基于第六代骁龙8超级至尊版移动平台,无量火自研的Ember推理引擎将大模型内存需求降低超过50%,让手机可以运行30B规模的MoE模型。期待与高通技术公司及生态伙伴深化协作,让手机成为个人智能终端,带来低延迟、高隐私的端侧AI体验。

江波龙副总裁、嵌入式存储事业部总经理黄强表示,端侧AI的规模化落地,离不开算力与存储的协同。江波龙将iSA存储智能体适配第六代骁龙8超级至尊版移动平台,通过存算协同释放平台算力价值,应对端侧大模型推理的存储需求。期待与高通技术公司持续深化生态协作,共同打造端侧AI解决方案,为终端用户带来稳定、可靠的本地AI体验。

从邮件处理到行程安排,一个300亿参数的智能体在手机本地完成全部推理,数据不出终端、响应以毫秒计——这项演示意味着,大参数MoE模型的端侧运行已从架构设想进入可验证的智能手机平台实践,并开始具备规模部署的技术条件。300亿参数MoE模型在旗舰移动平台上的完整端侧部署表明,通过模型架构与软硬件协同优化,智能手机正在具备运行更大规模模型、承载更复杂智能体任务的技术基础。随着硬件架构、推理引擎和存储方案的协同优化,更多复杂的AI能力有望在终端侧稳定运行,让个性化、低时延、注重隐私的智能体体验成为智能手机的日常功能。(心月)