2026-09-24

小米旗下MiMo团队于9月24日发布了面向MiMo-V3的核心架构HySparse2,该架构专为下一代长上下文Agent设计,旨在以更低成本处理网页、文件、代码及工具调用记录,并从持续增长的任务历史中更精准地提取关键信息。

以下是官方详细介绍:

HySparse2专为长程多轮Agent优化,实现了更少的Prefill计算、更小的KV Cache以及更精准的长上下文检索。

自Xiaomi MiMo-V2系列起,团队持续探索模型能力与计算效率的同步提升。MiMo-V2系列采用的Hybrid SWA混合注意力架构,融合了全注意力与滑动窗口注意力,在保持模型效果的同时提升了训练与推理效率。

过去半年,团队深入推进强化学习技术的研究与试验,并将积累的训练经验应用于近期发布的MiMo-V2.6系列,显著增强了模型能力。在持续优化V2系列的同时,面向MiMo-V3的新一代架构研究也从未停歇。此前公开的HySparse,正是这一探索路径的开端。

今天,我们正式公开MiMo-V3的核心架构HySparse2。在HySparse的基础上,它进一步升级了KV共享与稀疏选择机制,使模型能更高效、更精准地处理长上下文。

01、Agent的长程多轮任务需要怎样的注意力架构?

一次简短的工具调用,可能带回一整页网页、一份文件,或长长的执行日志。Agent每前进一步,都需要处理新的输入;随着任务推进,还要从不断增长的历史中,准确找到下一步所需的信息。

模型会将已读内容的表示保存在KV Cache中,供后续生成使用。读入新增内容并建立这些缓存的过程称为Prefill。在多轮Agent任务中,每次工具返回新信息,都需要重新处理新增输入。因此,新架构需同时满足三个要求。

  • 高效读入:减少处理长输入所需的计算,让模型尽快进入下一轮生成。
  • 节省显存:降低KV Cache的占用,使不断增长的历史更易保留。
  • 精准检索:从长历史中找出相关证据,实现精准的跨轮次信息整合。

第一代HySparse已迈出一步。它通过少量Full Attention层提供KV Cache和重要位置的选择结果,让后续Sparse Attention层直接复用,从而降低注意力计算与缓存开销。但在HySparse架构中,Prefill仍需执行所有层;面对多轮、长距离的信息检索,块级选择也有进一步提升精度的空间。HySparse2针对这些问题,引入两级KV共享、token级稀疏选择,以及统一的局部信息访问方式。

02、两级KV共享,让KV Cache更早就绪

借鉴YOCO的设计,HySparse2将模型分为前后两部分。前半部分是Self-Decoder,采用Full Attention与SWA的混合结构;后半部分是Cross-Decoder,采用Full Attention与Sparse Attention的混合结构。

在此基础上,KV共享分为两个层级:KV Bridging和KV Reuse。

KV Bridging:跨前后两部分,提前构建KV

后半部分的每个Full Attention层,都从前半部分对应Full Attention层的输入隐藏状态中,生成自己的KV Cache。每个目标层保留独立的K/V投影,因此即使使用同一份源隐藏状态,也能构建不同的KV。

这样,后半部分Full Attention层的KV就不必等到输入逐层经过它们后才能得到。生成这些缓存所需的信息,在前半部分就已具备。

KV Reuse:在同一Hybrid Block内,复用KV与选择结果

每个Hybrid Block由一层Full Attention和随后的多层Sparse Attention组成。Full Attention在完成自身计算时,也根据注意力分数选出重要位置;后续稀疏层直接复用它的KV Cache和选择索引。

这保留了HySparse的核心设计:少量全注意力层提供全局信息与选择结果,多层稀疏注意力高效使用这些信息,无需额外训练独立的选择器。

03、远处选得更细,近处始终可见

从“选一块”到“选一个token”

第一代HySparse采用块级稀疏选择。在长上下文中,为选中一个重要token,模型往往也会将其周围一整块内容纳入计算。Agent所需的线索可能分散在不同轮次的对话、工具结果和代码片段中。HySparse2改为token级选择,让同样的注意力预算能更精细地分配到这些位置。在相同全局token预算下,Token级选择在RULER-v2、多轮检索MRCR-v2和图推理GraphWalks上均获得提升,验证了更细粒度选择对这类任务的价值。

局部窗口保留,独立分支合并

全局检索之外,模型仍需稳定地看到最近的上下文。HySparse2会强制选中最近的128个token,再从窗口外选择1,024个全局token。两部分共同读取Full Attention层提供的共享KV Cache。

因此,稀疏层不再需要单独的SWA分支和局部KV Cache。HySparse中由独立分支承担的局部信息访问,在HySparse2中被合并到同一次稀疏注意力计算里。

这也解除了一项关键依赖:独立SWA分支的缓存原本来自该层自己的隐藏状态,构建它需要继续执行后半部分Cross-Decoder的计算。合并后,局部与全局信息都能使用在Self-Decoder阶段就已准备好的KV。

局部信息仍然重要。HySparse2的消融实验显示,强制局部窗口在多项长文任务上保持竞争力,部分指标也存在取舍;这一设计同时省去了独立SWA分支的投影参数与KV Cache开销,为Prefill提前退出创造了条件。

04、Prefill提前一半结束,减轻推理部署压力

两级KV共享与局部窗口的合并,使模型后半部分所需的全部KV Cache都能从前半部分的隐藏状态构建。完成Self-Decoder的计算和KV Bridging投影后,输入的KV Cache构建即可结束。

在49层的模型中,Prefill只需执行前25层Self-Decoder以及桥接KV投影,其中只有一层Full Attention。在Prefill–Decode分离部署时,Prefill节点也只需部署这部分Self-Decoder网络,所需的模型权重存储接近减半。

这使优化从减少注意力计算,进一步延伸到缩短长输入经过模型的计算路径。生成阶段仍然保留完整网络,继续使用后半部分的全局检索与建模能力。

05、更低的成本,更快的速度,更好的长文表现

我们在80B-A3B MoE模型上,使用相同的数据与训练流程,对比了Hybrid SWA、HySparse和HySparse2。三者采用相同的MoE设计,不同的注意力设计,HySparse2还使用了更紧凑的MQA配置。

百万token下,计算与缓存同时降低

在百万token的成本分析中,相对Hybrid SWA,HySparse2的Prefill计算量降至1/5,KV Cache从12GB降至2.7 GB。相对第一代HySparse,HySparse2的Prefill计算量降至1/3,KV Cache从6.7 GB降至2.7 GB。

长文检索与多轮上下文建模同步改善

预训练后,HySparse2保持了大致相当的通用能力,长上下文表现更优。经过相同的轻量后训练后,在最高256k的评测范围内,HySparse2在各项已测长度上都获得了更高的MRCR-v2、RULER-v2分数,以及更低的AgentPPL、LongPPL。前两项考察长上下文中的检索与问答;后两项衡量模型对多轮Agent轨迹和依赖远距离信息的token的预测能力。相对第一代HySparse,MRCR-v2和RULER-v2在各报告长度上的平均分分别提高了11.30和19.81个百分点。

这些结果表明,更少的KV Cache与更短的Prefill,可以与更好的长文检索共同实现。HySparse2为多轮、长上下文Agent提供了更高效的架构基础。

06、从读入到生成,让每一轮少一些等待

Agent完成一项任务,需要不断读入信息、生成行动,再根据返回的结果继续推进。每一轮的效率,都影响着用户最终需要等待多久。

此前,MiMo-UltraSpeed通过模型与系统协同设计,采用低比特量化、投机解码、MegaKernel等技术,探索更快的Decode;今天,HySparse2进一步降低长上下文的Prefill与缓存开销。两项工作分别从输入处理和输出生成入手,推动模型更高效地完成任务。

面向MiMo-V3,我们希望把这些探索结合起来,在持续提升模型智能的同时,为用户带来同等模型规模下更快的Prefill和Decode,帮助用户更快地完成更复杂的任务。用户可通过球友会下载获取相关更新信息。