当AI从对话走向生产 清微智能以可重构算力解码互联网算力新需求

来源:环球网2026-09-14 16:58

9月9日至12日,以“共创AI新经济”为主题的2026 Inclusion·外滩大会在上海黄浦世博园区举办。大会吸引超5万人报名、300余家企业参展,汇聚600余位全球学者、科学家、企业家与投资人,海外嘉宾覆盖50余个国家和地区。本届大会将AI经济增长动能作为核心议题,探讨方向从“AI能做什么”转向“AI如何创造新的增长”。国产可重构AI芯片企业清微智能亮相"数据与计算"展区,展示其在互联网算力场景的技术成果与合作进展。

如果说去年清微智能首次参展外滩大会,是携可重构算力与蚂蚁集团联袂亮相;那么今年再度赴约,清微带来的是一份经过市场检验的成绩单:从2025年下半年与蚂蚁集团的深度调优,到大模型推理性能实现十倍跃升;从今年与腾讯云等互联网客户达成战略合作,到Token工厂的布局推进,清微正在互联网算力赛道上,探索可重构架构的差异化应用路径。

可重构计算3.0与超节点产品 回应高并发低成本算力需求

走进本届外滩大会的科技展区,一个明显的感受是“AI正在变成生意”。当AI走出对话框、进入生产与生活的真实场景,产业对算力的诉求,也正从追求峰值性能,转向高并发、低成本、绿色低碳的稳定供给。这正是清微智能可重构算力的应用方向。

清微智能展台

本届外滩大会,清微带来适配互联网算力场景的两项成果。芯片层面,可重构计算3.0以3.5D存算融合技术为核心,将可重构计算芯粒与DRAM存储芯粒高密度集成,把部分信号传输距离从毫米级压缩至微米级,缓解“内存墙”问题,提升带宽并降低数据搬运延迟。系统层面,REX81 Supernode 4K超节点单集成4096颗TX81芯片,算力达每秒500千万亿次,并以算力网格互联架构,将节点间互联成本降低约90%。

高性能与低成本的结合,回应了AI新经济时代“算力既要跑得快、又要用得起”的产业需求。而算力的成色,需要放到实际场景中检验。互联网场景对AI算力的要求包括高并发、低延迟、强灵活性,任何一项短板都可能让算力方案止步于实验室。今年6月,清微智能与腾讯云签署战略合作协议,双方围绕国产算力供给、智算中心建设、行业解决方案及应用等领域展开协同:清微算力产品纳入腾讯云异构算力资源池,并为腾讯云提供基于国产算力的Token推理服务。依托RAISA软件栈,清微实现对腾讯混元Hy3等主流大模型的Day-0适配。

除腾讯云外,清微的互联网客户还在持续拓展,从“东数西算”枢纽的千卡智算中心,到服务亿万用户的互联网云平台,国产可重构算力正进入互联网产业的应用场景。

与蚂蚁集团深度调优 推理性能实现十倍跃升

互联网算力场景的能力跃升,来自与客户的深度协同。清微智能与蚂蚁集团的合作始于2025年初,蚂蚁集团旗下上海云玡战略投资清微智能,此后双方在技术层面展开磨合:在互联网大模型推理场景中,双方组成联合调优团队,围绕TX8系列可重构算力芯片与Qwen系列大模型,开展了数月的系统级性能优化。

一组数据呈现了“芯网协同”的成果:QPS(每秒查询量)提升26.7倍;TTFT(首字延迟)降低87.5%,首字响应速度提升7倍;TPOT(非首字延迟)降低75%,生成速率提升3倍——整体推理性能实现十倍以上跃升。对用户而言,这些数字意味着更短的等待时间与更快的内容输出;对于日活千万级的互联网产品而言,性能提升直接转化为体验改善与运营成本下降。

生态层面,TX8系列芯片已完成对SGLang框架的适配,支持Qwen系列模型;同时完成对SGLang-JAX框架的适配,支持Qwen2.5-VL-72B、Qwen2.5-Omni等多模态模型,实现图像、视频等视觉内容的解析。SGLang是当前大模型推理领域的主流框架,该生态的打通,意味着可重构算力能够接入互联网企业现有技术栈,降低迁移成本。

资本、技术、生态的协同,是清微在互联网算力场景推进的基础:蚂蚁的场景需求为清微提供了应用验证环境,清微的架构创新则为蚂蚁的AI战略提供了差异化的算力底座。

Token工厂布局推进 算力服务走向可计量可交付

与腾讯云的合作、与蚂蚁的调优,是清微在互联网算力赛道的当前进展;而Token工厂的布局,则是清微面向未来的规划。

大模型时代,Token已成为AI经济的基础计量单位——每一轮对话、每一次Agent决策、每一帧内容生成,背后都是Token的规模化生产与消耗。面向这一趋势,清微智能在本届外滩大会上介绍了下一阶段的Token工厂布局。围绕“Token Factory(词元工厂)+ Token Hub(词元枢纽)”体系,清微将提供以国产可重构AI算力为核心的芯片与产品支撑:供给侧面向大模型厂商、云厂商、运营商及智算中心、MaaS厂商,通过高性能推理、PD分离部署、弹性扩缩容与稳定SLA,支撑Token的规模化生产与稳定交付;服务侧打造通用Token Hub,以统一入口实现多模型聚合与弹性调度,支持按Token、按AI Key计量与清分结算,让互联网应用、企业级Agent、政企客户乃至个人开发者,便捷地获取AI算力服务。

目前,清微已在北京与合作伙伴共建Token工厂,以可重构算力芯片与产品为底座,将算力资源转化为可计量、可交易、可交付的Token服务。这一布局的能力支撑包括:在互联网场景中打磨出的高并发推理能力、与蚂蚁协同建立的性能优化方法论、覆盖近20个智算中心的规模化交付经验。

清微智能成立八年来,从新架构算力研发起步,逐步进入国产算力应用领域。随着全国一体化算力网加快构建,算力正加速走向网络化、服务化、普惠化。当AI从实验室走向产业,算力不再只是芯片参数的比拼,而是稳定供给、成本可控、生态兼容的综合能力竞争。清微智能以可重构架构切入互联网算力场景,并向Token服务模式延伸,为国产算力在AI新经济中的应用提供了一种可观察的实践路径。(心月)