Pruning (Beschneidung)
Definition
Pruning entfernt weniger wichtige Gewichte oder Neuronen aus einem trainierten KI-Modell, um es kleiner und schneller zu machen. Structured Pruning entfernt ganze Filter oder Schichten, Unstructured Pruning einzelne Gewichte. Die Genauigkeit bleibt meist erhalten.
Beispiel
Sparse-Pruning kann ein Modell um 50% verkleinern bei weniger als 1% Genauigkeitsverlust.
Verwandte Begriffe
Mehr aus “AI/ML”
Quantization (Quantisierung)
Quantization reduziert die Praezision der Gewichte in einem KI-Modell (z. B. von FP16 auf INT4). Dadurch werden Modellgroesse und Speicherbedarf massiv verringert, bei minimalen Genauigkeitsverlusten. INT4 und INT8 sind die gaengigsten Formate fuer Edge-Inferenz.
Inference (Inferenz)
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs fuer Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Geraet statt.
INT8 (8-bit Integer)
INT8 ist das am haeufigsten verwendete Quantisierungsformat fuer KI-Inferenz. Es bietet eine gute Balance zwischen Praezision und Effizienz. Die meisten NPUs sind auf INT8 optimiert, und TOPS-Werte werden typischerweise fuer INT8 angegeben.
Mojo (Programmiersprache)
Mojo ist eine von Modular entwickelte Programmiersprache, die als Superset von Python konzipiert ist. Sie kombiniert die Lesbarkeit von Python mit der Performance von C++ und ist speziell fuer KI-Entwickler optimiert. Mojo kann bis zu 35.000x schneller sein als Python.