Inference Optimization
Definition
Inference Optimization umfasst Techniken, um die Ausfuehrungsgeschwindigkeit eines trainierten KI-Modells zu erhoehen. Dazu gehoeren Quantization, Pruning, Knowledge Distillation, Speculative Decoding und KV-Cache-Optimierung. Moderne Inference-Engines wie vLLM und TensorRT kombinieren mehrere Techniken.
Beispiel
Durch Inference Optimierung kann ein 70B-LLM 5x schneller auf derselben Hardware ausgefuehrt werden.
Verwandte Begriffe
Mehr aus “AI/ML”
Copilot+ PC
Copilot+ PC ist eine Microsoft-Zertifizierung fuer Windows-Rechner mit mindestens 40 TOPS NPU-Leistung. Solche PCs unterstuetzen Recall (Timeline-Suche), Live-Captions, Cocreator (Bildgenerierung) und lokale Phi-Silika-Modelle. Der Standard wurde mit Windows 11 24H2 eingefuehrt.
Knowledge Distillation
Knowledge Distillation ist eine Technik, bei der ein grosses 'Teacher'-Modell ein kleineres 'Student'-Modell trainiert. Das Student-Modell lernt, die Ausgaben des Teachers nachzuahmen, erreicht aber aehnliche Performance mit deutlich weniger Parametern.
Vector Database
Eine Vector Database speichert Embeddings und ermoeglicht schnelle Aehnlichkeitssuche. Sie ist essenziell fuer RAG-Systeme und AI-Anwendungen. Bekannte Vector DBs sind Pinecone, Weaviate, Qdrant und Chroma. Sie nutzen Approximate Nearest Neighbor (ANN) Algorithmen.
AI-PC
Ein AI-PC ist ein Computer mit integrierter NPU, der KI-Aufgaben lokal und energieeffizient ausfuehrt. Microsoft definiert AI-PCs mit mindestens 40 TOPS und Copilot+ Funktion. Sie ermoeglichen Features wie Live-Untertitel, Bildgenerierung und lokale LLMs ohne Cloud.