AI/ML

Quantization (Quantisierung)

Definition

Quantization reduziert die Praezision der Gewichte in einem KI-Modell (z. B. von FP16 auf INT4). Dadurch werden Modellgroesse und Speicherbedarf massiv verringert, bei minimalen Genauigkeitsverlusten. INT4 und INT8 sind die gaengigsten Formate fuer Edge-Inferenz.

Beispiel

Ein 8B-LLM in INT4 braucht nur noch 4 GB statt 16 GB VRAM.