Live sizing for transformer KV-cache memory. Supports standard MHA as well as GQA/MQA through the number of KV heads.
| Quantity | Value |
|---|---|
| K elements per token per layer | |
| V elements per token per layer | |
| K+V elements per token per layer | |
| K+V bytes per token across all layers | |
| Total elements cached | |
| Total bytes cached |