Knowledge Distillation
Definition
Knowledge Distillation ist eine Technik, bei der ein grosses 'Teacher'-Modell ein kleineres 'Student'-Modell trainiert. Das Student-Modell lernt, die Ausgaben des Teachers nachzuahmen, erreicht aber aehnliche Performance mit deutlich weniger Parametern.
Beispiel
DistilBERT hat 40% weniger Parameter als BERT, behaelt aber 97% seiner Leistung.
Verwandte Begriffe
Mehr aus “AI/ML”
Edge AI
Edge AI bezeichnet die Ausfuehrung von KI-Modellen direkt auf dem Endgeraet (Smartphone, IoT, PC) statt in der Cloud. Dies reduziert Latenz, spart Bandbreite und schuetzt die Privatsphaere. NPUs sind die Grundlage fuer Edge AI auf mobilen Geraeten.
TinyML
TinyML ist das Feld des Machine Learning fuer extrem ressourcenbeschraenkte Geraete (Mikrocontroller, Sensoren). Modelle werden auf wenige Kilobyte komprimiert. Typische Anwendungen sind Keyword-Spotting, Gestenerkennung und Anomalie-Erkennung auf Batterie-Geraeten.
MoE (Mixture of Experts)
MoE ist eine Architektur, bei der nur ein Teil der Modell-Parameter pro Token aktiviert wird. Ein Router entscheidet, welche Experten (Sub-Netzwerke) fuer jede Eingabe verwendet werden. DeepSeek-V3 und Mixtral nutzen MoE fuer hohe Kapazitaet bei niedriger Inferenz-Kosten.
LoRA Fine-Tuning
LoRA Fine-Tuning ist der Prozess des Anpassens eines vortrainierten LLM an eine spezifische Aufgabe mit Low-Rank Adaptation. Statt alle Gewichte zu aktualisieren, werden nur zusaetzliche niedrigdimensionale Matrizen trainiert. Dies reduziert Speicherbedarf und Kosten um bis zu 100x.