小米MiMo-V3全新架构核心技术HySparse2正式发布 百万Token下预填充算力降低5倍

来源:环球网2026-09-24 11:02

【环球网科技综合报道】9月24日消息,小米MiMo大模型负责人罗福莉宣布,MiMo大模型下一代版本MiMo-V3将搭载全新自研架构,其核心技术HySparse2同步对外公开。

据技术披露信息,HySparse2是小米在大模型混合稀疏注意力领域的迭代,对比此前MiMo-V2.6搭载的混合SWA架构,在100万Token长度的测试场景下,实现了预填充计算量(FLOPs)降低5.02倍,KV缓存占用直接缩小4.5倍。同时在长上下文权威评测MRCRv2和RULER-v2中获得更高得分,代表智能体推理流畅度的AgentPPL和长文本生成稳定性的LongPPL指标也实现显著下降,在大幅降低资源消耗的同时,模型的长文本处理与智能推理性能同步提升。

针对行业普遍面临的智能体推理效率瓶颈,HySparse2通过两级KV共享机制针对性破解核心痛点。罗福莉解释,智能体推理的工作负载和传统大模型对话完全不同:每一轮交互中,智能体执行的短操作往往会返回一段很长的观测文本,需要重新执行预填充流程,且整个上下文长度会持续累加,这就让预填充成本、KV缓存容量、长上下文检索准确率三个问题同时成为制约落地的核心矛盾。而HySparse2的KV桥接技术遵循YOCO设计思路,让交叉解码器中的全注意力层直接从自解码器的隐藏状态构建KV对,避免了冗余的重复计算;KV复用机制则在每个混合块内部,让所有稀疏层直接复用前一层全注意力层输出的KV缓存和Token选择索引,从底层减少资源重复开销。

除此之外,HySparse2还完成了两处关键的架构优化:用Token级别的细粒度选择替代了传统的块级选择,大幅提升长文本中关键信息检索的灵活性;用强制近期Token窗口替代独立的SWA分支,让局部Token和全局Token可以共享同一份KV缓存,进一步简化了缓存管理逻辑。得益于所有交叉解码器的KV缓存全部来自自解码器,预填充流程在自解码器计算完成后即可直接终止,不需要额外执行后续计算,整体运行效率得到进一步释放。(青山)