Quantization (Quantisierung)
Definition
Quantization reduziert die Praezision der Gewichte in einem KI-Modell (z. B. von FP16 auf INT4). Dadurch werden Modellgroesse und Speicherbedarf massiv verringert, bei minimalen Genauigkeitsverlusten. INT4 und INT8 sind die gaengigsten Formate fuer Edge-Inferenz.
Beispiel
Ein 8B-LLM in INT4 braucht nur noch 4 GB statt 16 GB VRAM.
Verwandte Begriffe
Mehr aus “AI/ML”
QLoRA (Quantized LoRA)
QLoRA kombiniert LoRA mit 4-bit Quantisierung des Basis-Modells. Dadurch wird der Speicherbedarf drastisch reduziert, sodass sogar 70-Milliarden-Parameter-Modelle auf einer einzelnen GPU fine-getuned werden koennen. Es ist der De-facto-Standard fuer ressourceneffizientes Fine-Tuning.
KV Cache (Key-Value Cache)
Der KV Cache speichert die Key-Value-Paare aller bisherigen Tokens in einem LLM, um wiederholte Berechnungen zu vermeiden. Er w线性 mit der Sequenzlaenge. Bei grossen Context-Windows (1M Tokens) kann der KV Cache mehrere Gigabyte VRAM belegen.
FLOPS (Floating Point Operations Per Second)
FLOPS misst die Anzahl der Gleitkomma-Operationen pro Sekunde. Im Gegensatz zu TOPS, das ganze Operationen zaehlt, erfasst FLOPS genauer die mathematische Leistung. Es wird in PetaFLOPS (10^15) oder ExaFLOPS (10^18) angegeben.
Training (Modell-Training)
Training ist der Prozess, bei dem ein KI-Modell aus Daten lernt, indem es seine internen Gewichte iterativ anpasst. Es verwendet Algorithmen wie Backpropagation und Gradient Descent. Das Training grosser Modelle kann Wochen bis Monate dauern.