AI/ML

Inference Engine

Definition

Eine Inference Engine ist die Software-Komponente, die ein trainiertes KI-Modell ausfuehrt. Sie optimiert die Modellausfuehrung fuer die jeweilige Hardware (CPU, GPU, NPU). Bekannte Engines sind ONNX Runtime, TensorRT, OpenVINO und Core ML.

Beispiel

TensorRT 10 kann die Inference-Geschwindigkeit eines LLMs auf NVIDIA H100 um 40% steigern.