AI/ML

Inference Optimization

Definition

Inference Optimization umfasst Techniken, um die Ausfuehrungsgeschwindigkeit eines trainierten KI-Modells zu erhoehen. Dazu gehoeren Quantization, Pruning, Knowledge Distillation, Speculative Decoding und KV-Cache-Optimierung. Moderne Inference-Engines wie vLLM und TensorRT kombinieren mehrere Techniken.

Beispiel

Durch Inference Optimierung kann ein 70B-LLM 5x schneller auf derselben Hardware ausgefuehrt werden.