KV Cache (Key-Value Cache)
Definition
Der KV Cache speichert die Key-Value-Paare aller bisherigen Tokens in einem LLM, um wiederholte Berechnungen zu vermeiden. Er w线性 mit der Sequenzlaenge. Bei grossen Context-Windows (1M Tokens) kann der KV Cache mehrere Gigabyte VRAM belegen.
Beispiel
Ein 70B-LLM mit 128K Context benoetigt 16 GB VRAM allein fuer den KV Cache.
Verwandte Begriffe
Mehr aus “AI/ML”
QLoRA (Quantized LoRA)
QLoRA kombiniert LoRA mit 4-bit Quantisierung des Basis-Modells. Dadurch wird der Speicherbedarf drastisch reduziert, sodass sogar 70-Milliarden-Parameter-Modelle auf einer einzelnen GPU fine-getuned werden koennen. Es ist der De-facto-Standard fuer ressourceneffizientes Fine-Tuning.
DALL-E
DALL-E ist OpenAIs Bildgenerierungsmodell, das Text-Prompts in Bilder umwandelt. DALL-E 3 ist in ChatGPT integriert und ermoeglicht natuerlichsprachige Bildbeschreibungen. Es versteht komplexe Prompts und generiert konsistente Bilder mit lesbarem Text.
Neural Network (Neuronales Netz)
Ein Neural Network ist ein vom menschlichen Gehirn inspiriertes KI-Modell aus verbundenen Knoten (Neuronen) in Schichten. Es lernt aus Daten, indem es Gewichte anpasst. Tiefe Netzwerke (Deep Learning) mit vielen Schichten koennen extrem komplexe Muster erkennen.
RLHF (Reinforcement Learning from Human Feedback)
RLHF ist eine Trainingsmethode, bei der ein LLM durch menschliches Feedback lernt. Menschen bewerten verschiedene Modell-Antworten, und ein Belohnungsmodell trainiert das LLM, bevorzugte Antworten zu generieren. RLHF war entscheidend fuer den Erfolg von ChatGPT.