Pruning (Beschneidung)
Definition
Pruning entfernt weniger wichtige Gewichte oder Neuronen aus einem trainierten KI-Modell, um es kleiner und schneller zu machen. Structured Pruning entfernt ganze Filter oder Schichten, Unstructured Pruning einzelne Gewichte. Die Genauigkeit bleibt meist erhalten.
Beispiel
Sparse-Pruning kann ein Modell um 50% verkleinern bei weniger als 1% Genauigkeitsverlust.
Verwandte Begriffe
Mehr aus “AI/ML”
Hallucination (KI)
Hallucination beschreibt das Phaenomen, dass ein LLM selbstbewusst falsche oder erfundene Informationen ausgibt. Es entsteht durch statistische Muster im Training, die nicht mit Fakten uebereinstimmen. RAG und bessere Fine-Tuning-Methoden reduzieren Halluzinationen.
FP16 (Half Precision)
FP16 (16-bit Floating Point) ist das Standardformat fuer KI-Training und Inferenz. Es bietet ausreichend Praezision fuer die meisten Modelle bei halbem Speicherbedarf gegenueber FP32. Tensor Cores sind fuer FP16 optimiert.
ONNX (Open Neural Network Exchange)
ONNX ist ein offenes Format fuer KI-Modelle, das den Austausch zwischen verschiedenen Frameworks (PyTorch, TensorFlow, etc.) ermoeglicht. Ein in PyTorch trainiertes Modell kann als ONNX exportiert und auf jeder Hardware ausgefuehrt werden. ONNX Runtime ist die entsprechende Inferenz-Engine.
Model Compression
Model Compression umfasst verschiedene Techniken, um KI-Modelle kleiner und effizienter zu machen. Dazu zaehlen Quantisierung, Pruning, Knowledge Distillation und Low-Rank Factorization. Ziel ist der Einsatz auf Geraeten mit begrenzten Ressourcen.