Model Serving
Definition
Model Serving ist der Prozess, ein trainiertes KI-Modell in einer Produktionsumgebung verfuegbar zu machen. Es umfasst API-Endpunkte, Load Balancing, Versionierung und Monitoring. Bekannte Serving-Frameworks sind vLLM, TGI (Text Generation Inference) und TorchServe.
Beispiel
vLLM kann ein 70B-LLM auf 8 GPUs mit 10.000 Requests pro Sekunde servieren.
Mehr aus “AI/ML”
ROCm (Radeon Open Compute)
ROCm ist AMDs Open-Source-Plattform fuer GPU-Computing, aehnlich wie NVIDIA CUDA. Es unterstuetzt PyTorch und TensorFlow und ist die Grundlage fuer KI-Training auf AMD-GPUs. ROCm 7 brachte deutliche Verbesserungen bei Performance und Kompatibilitaet.
Autoregressive Model
Autoregressive Modelle generieren Daten sequenziell, indem sie jedes neue Element basierend auf den zuvor generierten Elementen vorhersagen. LLMs wie GPT sind autoregressiv: Jedes Token wird basierend auf allen vorherigen Tokens generiert.
Transformer (Architektur)
Die Transformer-Architektur wurde 2017 von Google eingefuehrt und ist die Grundlage aller modernen LLMs. Sie nutzt Self-Attention-Mechanismen, um Beziehungen zwischen allen Tokens gleichzeitig zu erfassen. Dadurch sind Transformer stark parallelisierbar und skalierbar.
Gemini Nano
Gemini Nano ist Googles kleinstes LLM, das fuer die Ausfuehrung auf mobilen Geraeten optimiert ist. Es laeuft auf Pixel-Smartphones und Android-Geraeten mit ausreichend RAM. Es ermoeglicht MagIC-Answer, Summarize in Chrome Recorder und Smart Reply ohne Internetverbindung.