AI/ML

KV Cache (Key-Value Cache)

Definition

Der KV Cache speichert die Key-Value-Paare aller bisherigen Tokens in einem LLM, um wiederholte Berechnungen zu vermeiden. Er w线性 mit der Sequenzlaenge. Bei grossen Context-Windows (1M Tokens) kann der KV Cache mehrere Gigabyte VRAM belegen.

Beispiel

Ein 70B-LLM mit 128K Context benoetigt 16 GB VRAM allein fuer den KV Cache.