KV Cache (Key-Value Cache)
Definition
Der KV Cache speichert die Key-Value-Paare aller bisherigen Tokens in einem LLM, um wiederholte Berechnungen zu vermeiden. Er w线性 mit der Sequenzlaenge. Bei grossen Context-Windows (1M Tokens) kann der KV Cache mehrere Gigabyte VRAM belegen.
Beispiel
Ein 70B-LLM mit 128K Context benoetigt 16 GB VRAM allein fuer den KV Cache.
Verwandte Begriffe
Mehr aus “AI/ML”
CUDA (Compute Unified Device Architecture)
CUDA ist NVIDIAs parallele Computing-Plattform und Programmiermodell fuer GPUs. Es ermoeglicht Entwicklern, die Rechenleistung von NVIDIA-GPUs fuer nicht-grafische Aufgaben wie KI-Training zu nutzen. CUDA ist der De-facto-Standard fuer GPU-Computing in der KI-Forschung.
LangChain
LangChain ist ein beliebtes Open-Source-Framework fuer die Entwicklung von LLM-Anwendungen. Es provides Module fuer Prompt-Management, Chains, Agenten, Memory und RAG-Pipelines. LangChain unterstuetzt alle grossen LLM-Anbieter und Vector Databases.
Stable Diffusion
Stable Diffusion ist ein Open-Source-Diffusionsmodell fuer Bildgenerierung von Stability AI. Es kann lokal auf Consumer-GPUs ausgefuehrt werden und hat die KI-Bildgenerierung demokratisiert. Version 3.5 bietet stark verbesserte Textwiedergabe und Fotorealismus.
Federated Learning
Federated Learning trainiert KI-Modelle dezentral auf mehreren Geraeten, ohne Daten zu teilen. Jedes Geraet trainiert lokal und sendet nur Modell-Updates an einen zentralen Server. Dies schuetzt die Privatsphaere und wird von Google und Apple eingesetzt.