Model Compression
Definition
Model Compression umfasst verschiedene Techniken, um KI-Modelle kleiner und effizienter zu machen. Dazu zaehlen Quantisierung, Pruning, Knowledge Distillation und Low-Rank Factorization. Ziel ist der Einsatz auf Geraeten mit begrenzten Ressourcen.
Beispiel
Durch Model Compression kann ein Spracherkennungsmodell auf einer Smartwatch laufen.
Verwandte Begriffe
Mehr aus “AI/ML”
Fine-Tuning
Fine-Tuning ist die Anpassung eines vortrainierten Modells an eine spezifische Aufgabe oder Doemaene. Es benötigt deutlich weniger Daten und Rechenleistung als das Training von Grund auf. LoRA und QLoRA sind beliebte effiziente Fine-Tuning-Methoden.
Inference (Inferenz)
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs fuer Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Geraet statt.
Diffusion Model
Diffusion Models generieren Daten (Bilder, Audio, Video), indem sie schrittweise Rauschen entfernen. Sie wurden von Nicht-Gleichgewichts-Thermodynamik inspiriert. Stable Diffusion, DALL-E und Midjourney basieren alle auf Diffusionsarchitektur.
LLM (Large Language Model)
Ein LLM ist ein auf riesigen Textmengen trainiertes Neural Network, das menschenahnliche Texte generieren kann. Es verwendet Transformer-Architektur mit Milliarden von Parametern. GPT, Claude, Gemini und Llama sind bekannte Beispiele fuer LLMs.