Inference Engine
Definition
Eine Inference Engine ist die Software-Komponente, die ein trainiertes KI-Modell ausfuehrt. Sie optimiert die Modellausfuehrung fuer die jeweilige Hardware (CPU, GPU, NPU). Bekannte Engines sind ONNX Runtime, TensorRT, OpenVINO und Core ML.
Beispiel
TensorRT 10 kann die Inference-Geschwindigkeit eines LLMs auf NVIDIA H100 um 40% steigern.
Mehr aus “AI/ML”
Speculative Decoding
Speculative Decoding ist eine Inferenz-Optimierungstechnik, bei der ein kleiles Modell schnell Entwuerfe generiert und ein grosses Modell diese verifiziert. Akzeptierte Tokens werden uebernommen, abgelehnte verworfen. Dies kann die Inference-Geschwindigkeit um den Faktor 2-3 erhoehen.
Machine Learning
Machine Learning ist ein Teilbereich der KI, bei dem Computer aus Daten lernen, ohne explizit programmiert zu werden. Es umfasst ueberwacht (Supervised), unueberwacht (Unsupervised) und bestaerkendes (Reinforcement) Lernen. Deep Learning ist eine spezielle Methode des Machine Learning.
AI Agent
Ein AI Agent ist ein KI-System, das eigenstaendig Aufgaben plant und ausfuehrt, indem es Tools, APIs und Datenquellen nutzt. Es bricht komplexe Anfragen in Teilschritte herunter und kann Code schreiben, Web-Recherche betreiben und Entscheidungen treffen.
OpenVINO
OpenVINO ist Intels Open-Source-Toolkit fuer KI-Inferenz-Optimierung. Es optimiert Modelle fuer Intel-Hardware (CPU, integrierte GPU, NPU) und bietet signifikante Performance-Verbesserungen. OpenVINO unterstuetzt ONNX-Modelle als Eingabe.