[FAST'25] Mooncake: Trading More Storage for Less Computation — A KVCache-centric Architecture for Serving LLM Chatbot 论文阅读
Mooncake 是 Moonshot AI 推出的 LLM 聊天机器人服务 Kimi 的底层服务平台. 该平台采用以 KVCache 为中心的分离式架构: 不仅将 Prefill 集群与 Decoding 集群分离, 还充分利用 GPU 集群中未被充分使用的 CPU, DRAM, SSD 和 NIC 资源, 构建出一个分离式的 KVCache 池. Mooncake 的核心是其以 KVCache 为中心的全局缓存, 以及一个在满足严格的延迟类服务级别目标 (SLO) 的前提下最大化吞吐量的调度器.