白有辉
中国科学技术大学特任副研究员
白有辉2021年获得中国科学技术大学计算机系统结构博士学位。博士毕业后进入华为2012实验室任主任工程师,2025年回到中国科学技术大学计算机科学与技术学院,现任特任副研究员。他长期围绕大模型分布式并行计算开展研究,重点解决大模型训练与推理中的数据移动、通信、内存和稀疏计算瓶颈,在SOSP、OSDI、CVPR、AAAI、HPCA、TPDS等国际顶级会议和期刊发表论文12篇,其中CCF A类论文11篇、第一作者或通讯作者论文7篇,申请国家发明专利10余项、重大技术秘密1项。相关成果获2026 USENIX OSDI Jay Lepreau最佳论文奖(国内首次)、2024世界人工智能大会青年优秀论文奖(全球10篇,唯一入选的系统类论文)、2023 ACM SIGCSE优秀博士论文奖(全国2人)等荣誉。他主持国家自然科学基金青年科学基金项目及字节跳动、腾讯等企业合作项目,并作为技术骨干参与国家科技重大专项和合肥市揭榜挂帅等项目。
演讲主题
面向国产超节点的稀疏注意力驱动的KVCache管理系统
长上下文推理中,KVCache 对高带宽内存(HBM)的持续占用制约了服务并发与解码吞吐。本报告面向国产超节点,分享稀疏注意力驱动的KVCache管理系统设计,以Top-K索引驱动token级按需读取,将完整历史KV存于超节点host内存池,在NPU侧缓存热点并组装当前所需数据,通过索引拷贝算子兼容图执行。结合SGLang集成实践,介绍基于超节点的KVCache内存池的重新设计,探讨长上下文推理的容量扩展与性能优化。 大纲: 1.长上下文推理瓶颈:分析 KV Cache 容量对解码并发的限制,以及页级搬运与 token 级稀疏访问之间的粒度不匹配。 2.稀疏驱动的系统设计:介绍 SparseKVCacheManager 的主机存储、设备缓存与索引映射,以及 UniDex 索引拷贝算子如何兼容 NPU 图执行。 3.SGLang 集成与性能分析:分享国产 NPU 上的接入实践,分析释放 HBM、扩大解码批次与吞吐提升的关系,以及按需搬运的开销。 4.面向国产超节点的扩展:介绍基于 HCCS 与 MemFabric 的远端 DRAM 稀疏访问验证,讨论共享 KV 内存池设计及预填充与解码分离场景下的内存利用。 听众收益 1.理解长上下文推理中的 KV Cache 容量与带宽瓶颈,掌握通过稀疏访问减少设备驻留数据、提升服务并发的设计思路。 2.了解 Top-K 索引驱动的 token 级 KV 管理与数据搬运机制,获得动态稀疏访问适配 NPU 图执行的工程方法。 3.掌握国产超节点共享 KV 内存池的架构要点,理解高速互联、远端 DRAM 访问与跨节点索引定位如何协同扩展可用容量。 4.借鉴 SGLang 集成和性能分析经验,学会结合 HBM 占用、传输开销、解码吞吐及请求时延判断卸载方案的适用场景。