Inference Engine
Definition
Eine Inference Engine ist die Software-Komponente, die ein trainiertes KI-Modell ausfuehrt. Sie optimiert die Modellausfuehrung fuer die jeweilige Hardware (CPU, GPU, NPU). Bekannte Engines sind ONNX Runtime, TensorRT, OpenVINO und Core ML.
Beispiel
TensorRT 10 kann die Inference-Geschwindigkeit eines LLMs auf NVIDIA H100 um 40% steigern.
Mehr aus “AI/ML”
Knowledge Distillation
Knowledge Distillation ist eine Technik, bei der ein grosses 'Teacher'-Modell ein kleineres 'Student'-Modell trainiert. Das Student-Modell lernt, die Ausgaben des Teachers nachzuahmen, erreicht aber aehnliche Performance mit deutlich weniger Parametern.
QLoRA (Quantized LoRA)
QLoRA kombiniert LoRA mit 4-bit Quantisierung des Basis-Modells. Dadurch wird der Speicherbedarf drastisch reduziert, sodass sogar 70-Milliarden-Parameter-Modelle auf einer einzelnen GPU fine-getuned werden koennen. Es ist der De-facto-Standard fuer ressourceneffizientes Fine-Tuning.
LLM (Large Language Model)
Ein LLM ist ein auf riesigen Textmengen trainiertes Neural Network, das menschenahnliche Texte generieren kann. Es verwendet Transformer-Architektur mit Milliarden von Parametern. GPT, Claude, Gemini und Llama sind bekannte Beispiele fuer LLMs.
Context Window (Kontextfenster)
Das Context Window ist die maximale Anzahl an Tokens, die ein LLM gleichzeitig verarbeiten kann. Es umfasst Eingabe und Ausgabe. Groessere Context Windows erlauben laengere Dokumente und ausgedehntere Konversationen. Gemini 2 erreicht 2 Millionen Tokens.