AI/ML

Model Serving

Definition

Model Serving ist der Prozess, ein trainiertes KI-Modell in einer Produktionsumgebung verfuegbar zu machen. Es umfasst API-Endpunkte, Load Balancing, Versionierung und Monitoring. Bekannte Serving-Frameworks sind vLLM, TGI (Text Generation Inference) und TorchServe.

Beispiel

vLLM kann ein 70B-LLM auf 8 GPUs mit 10.000 Requests pro Sekunde servieren.