铭鸿体育资讯网

团队之前的这篇文章IndexCache: Accelerating Sparse

团队之前的这篇文章IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse 发表在大模型的一个国际会议 COLM,只改了几行代码就能实现:DSA 让注意力变快了,却留下一笔隐性的 O(L²) 开销:indexer 每层都要重算一次。但相邻层其实在挑几乎相同的 token——大多数层根本不需要自己的 indexer。IndexCache 让它们共享索引:indexer 计算减少 75%,prefill 最高提速 1.82×,已在 GLM-5 生产级模型上得到验证。