MLX (Apple ML Framework)
Definition
MLX ist Apples Open-Source-Machine-Learning-Framework, speziell fuer Apple Silicon optimiert. Es nutzt Unified Memory und die Neural Engine effizient. MLX ermoeglicht das Training und die Inferenz von LLMs auf Macs mit bisher unerreichter Effizienz.
Beispiel
MLX kann ein Llama 3 8B Modell auf einem MacBook Pro M5 mit 30 Tokens/Sekunde ausfuehren.
Verwandte Begriffe
Mehr aus “AI/ML”
Knowledge Distillation
Knowledge Distillation ist eine Technik, bei der ein grosses 'Teacher'-Modell ein kleineres 'Student'-Modell trainiert. Das Student-Modell lernt, die Ausgaben des Teachers nachzuahmen, erreicht aber aehnliche Performance mit deutlich weniger Parametern.
Inference Engine
Eine Inference Engine ist die Software-Komponente, die ein trainiertes KI-Modell ausfuehrt. Sie optimiert die Modellausfuehrung fuer die jeweilige Hardware (CPU, GPU, NPU). Bekannte Engines sind ONNX Runtime, TensorRT, OpenVINO und Core ML.
FP8 (8-bit Floating Point)
FP8 ist ein 8-bit-Gleitkommaformat, das 2022 von NVIDIA, AMD und ARM gemeinsam spezifiziert wurde. Es bietet hoehere Praezision als INT8 bei gleichem Speicherbedarf. Die RTX 50-Serie unterstuetzt FP4 und FP8 nativ fuer maximale AI-Performance.
Model Serving
Model Serving ist der Prozess, ein trainiertes KI-Modell in einer Produktionsumgebung verfuegbar zu machen. Es umfasst API-Endpunkte, Load Balancing, Versionierung und Monitoring. Bekannte Serving-Frameworks sind vLLM, TGI (Text Generation Inference) und TorchServe.