Inference Optimization
Definition
Inference Optimization umfasst Techniken, um die Ausfuehrungsgeschwindigkeit eines trainierten KI-Modells zu erhoehen. Dazu gehoeren Quantization, Pruning, Knowledge Distillation, Speculative Decoding und KV-Cache-Optimierung. Moderne Inference-Engines wie vLLM und TensorRT kombinieren mehrere Techniken.
Beispiel
Durch Inference Optimierung kann ein 70B-LLM 5x schneller auf derselben Hardware ausgefuehrt werden.
Verwandte Begriffe
Mehr aus “AI/ML”
Hallucination (KI)
Hallucination beschreibt das Phaenomen, dass ein LLM selbstbewusst falsche oder erfundene Informationen ausgibt. Es entsteht durch statistische Muster im Training, die nicht mit Fakten uebereinstimmen. RAG und bessere Fine-Tuning-Methoden reduzieren Halluzinationen.
Inference (Inferenz)
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs fuer Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Geraet statt.
LoRA Fine-Tuning
LoRA Fine-Tuning ist der Prozess des Anpassens eines vortrainierten LLM an eine spezifische Aufgabe mit Low-Rank Adaptation. Statt alle Gewichte zu aktualisieren, werden nur zusaetzliche niedrigdimensionale Matrizen trainiert. Dies reduziert Speicherbedarf und Kosten um bis zu 100x.
Inference Engine
Eine Inference Engine ist die Software-Komponente, die ein trainiertes KI-Modell ausfuehrt. Sie optimiert die Modellausfuehrung fuer die jeweilige Hardware (CPU, GPU, NPU). Bekannte Engines sind ONNX Runtime, TensorRT, OpenVINO und Core ML.