【环球网科技报道 记者 冯超男】当前,算力产业的增长引擎正悄然换挡,需求重心从模型训练向推理侧迁移。
对于国内市场而言,国产算力芯片采购渠道通畅,具备硬件落地的基础优势,不过从底层驱动到上层服务的全栈软件支持仍显薄弱,导致硬件性能未能充分释放。
“这也正是目前行业存在的巨大机遇。”在日前举办的“GPUStack AI Infra 生态与技术创新大会”上,GPUStack CTO梁胜如是说。他表示,公司核心战略,正是为国产算力芯片打造具备核心竞争力的全栈软件体系——向下,覆盖算力、集群、网络、存储的基础接口适配;向上,贯通模型生成、训练与推理、服务交付的全流程能力。
(图/GPUStack提供)
往更深层次看,算力时代本质上是技术与软硬件资源体系化整合的时代。依托行业合作伙伴的生态支持,GPUStack持续完善国产算力全栈软件体系,核心目标是通过补齐软件短板、完善产业生态,赋能国产算力产业突破瓶颈。
“GPU卡有数十种,模型数量更是庞大。两者之间,中间层的推理后端可能就有十几种,而每种推理后端自身的优化手段又或有十几种。本质上是一个极为稠密的矩阵关系,组合规模极其庞大。要将这一体系自上而下顺畅地运营起来,我们将其定义为‘词元(Token)工厂’。”在媒体采访环节,GPUStack CEO泰小康如此阐释。
在他看来,过去行业的重心在于资源管理;如今模型部署成为新的难点。词元工厂的核心,正是既要管好算力基础设施,又要实现模型的一键部署,以简便的方式完成从硬件到模型的全链路运营。“这是一揽子工程,也是公司全力推进的方向。”
进一步来看,模型能够运转起来,必须依赖运行环境,而环境中最核心的组件,便是推理后端。推理后端并非单一软件,是由众多软件构成的生态。通常,芯片厂商都会有自己的推理后端,还有一些开源组织开发了通用推理后端——目前行业内最流行的两个,是vLLM 和 SGLang。
当一个模型厂商发布新模型时,通常仅会在某一推理后端跑通,且模型厂商可能会对后端进行修改,并非标准版本。基于此,GPUSTack采用了“推理后端的可插拔”机制。也就是说,在公司GPU平台上,推理后端即插即用:平台预留“插槽”,无论哪个厂商发布新模型及其特殊后端,用户只需将后端包导入即可运行。
“现在大家经常比喻,未来适用算力就像用水用电一样。在 GPU 时代,铺水管、建水塔属于基础设施层,对应的是 GPU 硬件能力及其驱动等底层组件。当水进入到千家万户时,装上水龙头,就必须有管控和调度——水压大了要调节,水不够了要从蓄水设备多放一些,核心目标是让前端用户获得良好体验,感知不到背后的复杂性。”泰小康称。
至于国产GPU的利用率问题,随着模型架构日益复杂,不同架构的模型在不同硬件上的优化程度差异很大,因此很难给出一个明确的回答。但通过一些方案,可将国产GPU的利用率进一步提升。而这既依赖 GPUStack 在上层编排和工程层面的组合优化,也需要底层硬件厂商和整个开源社区在底层算子等层面持续投入。
“作为基础设施提供者,我们的核心判断是:随着模型架构不断演进,推理适配的工程复杂度正急剧攀升。唯有整个社区共同构建底层推理基础设施技术栈,才能持续提升各类硬件的利用率。”康小康称。
正是在这一背景下,GPUStack 通过开源模式形成了独特的飞轮效应:大量用户使用、大量厂商适配,在AI自我进化的趋势下,于复杂环境、各种硬件和各种模型之上真正跑起来并发现问题。而11万的部署量,意味着每天都有用户在各类硬件上帮助测试、打磨和迭代产品,从而更快速地提升国产 GPU 利用率及综合性能。
帝欧水华集团董事长朱江称,“作为GUPStack第二大股东,我们认为,随着GPU供应逐步充裕,真正稀缺的将是管好算力的软件平台。AI Infra 这个板块,它和模型公司不同。模型公司需要极强的创造力;而基础设施研发更多是工程能力,核心是产品力的问题。投资这个企业,对我们自身而言,将来构建国产算力平台确实需要这样一套体系。”