tag: dp-attention.md

Tag: dp-attention

1 posts
DP Attention:让 KV Cache 不再复制

在 MoE 大模型推理中,传统的 TP + EP 方案会让每张卡都持有一份完整的 KV Cache,造成严重的显存冗余。DP Attention 通过让每张卡只负责自己的 request,彻底消除这种冗余。本文对比两种方案(4 GPU、8 Experts 示例),配有可交互动画。

...