Model Serving
Definition
Model Serving ist der Prozess, ein trainiertes KI-Modell in einer Produktionsumgebung verfuegbar zu machen. Es umfasst API-Endpunkte, Load Balancing, Versionierung und Monitoring. Bekannte Serving-Frameworks sind vLLM, TGI (Text Generation Inference) und TorchServe.
Beispiel
vLLM kann ein 70B-LLM auf 8 GPUs mit 10.000 Requests pro Sekunde servieren.
Mehr aus “AI/ML”
GAN (Generative Adversarial Network)
GANs bestehen aus zwei Neural Networks, die gegeneinander antreten. Ein Generator erzeugt gefaelschte Daten, ein Diskriminator versucht, diese von echten zu unterscheiden. Durch diesen Wettbewerb werden beide besser. GANs werden fuer Deepfakes und Bildgenerierung verwendet.
Training (Modell-Training)
Training ist der Prozess, bei dem ein KI-Modell aus Daten lernt, indem es seine internen Gewichte iterativ anpasst. Es verwendet Algorithmen wie Backpropagation und Gradient Descent. Das Training grosser Modelle kann Wochen bis Monate dauern.
NPU (Neural Processing Unit)
Eine NPU ist ein spezialisierter Prozessor fuer KI-Inference-Aufgaben. Sie ist extrem energieeffizient und entlastet CPU und GPU bei AI-Workloads. Moderne Smartphones und Laptops integrieren NPUs direkt im SoC. Die Leistung wird in TOPS gemessen.
Autoregressive Model
Autoregressive Modelle generieren Daten sequenziell, indem sie jedes neue Element basierend auf den zuvor generierten Elementen vorhersagen. LLMs wie GPT sind autoregressiv: Jedes Token wird basierend auf allen vorherigen Tokens generiert.