OpenVINO
Definition
OpenVINO ist Intels Open-Source-Toolkit fuer KI-Inferenz-Optimierung. Es optimiert Modelle fuer Intel-Hardware (CPU, integrierte GPU, NPU) und bietet signifikante Performance-Verbesserungen. OpenVINO unterstuetzt ONNX-Modelle als Eingabe.
Beispiel
OpenVINO kann die Inferenzgeschwindigkeit eines LLMs auf Intel Core Ultra verdreifachen.
Mehr aus “AI/ML”
Matrix Multiply (GEMM)
Matrix Multiply (General Matrix Multiply, GEMM) ist die fundamentale Operation in Neural Networks. praktisch alle Berechnungen in einem LLM lassen sich auf Matrix-Multiplikation zurueckfuehren. Tensor Cores und NPUs sind hardwareseitig fuer maximale GEMM-Performance optimiert.
Triton (GPU Programming)
Triton ist eine von OpenAI entwickelte Programmiersprache fuer GPU-Kernel. Sie ermoeglicht Entwicklern, hochperformante GPU-Kernel in Python-Syntax zu schreiben, ohne CUDA-Experten zu sein. Triton wird in PyTorch 2.0 und Flash Attention verwendet.
FP4 (4-bit Floating Point)
FP4 ist ein 4-bit-Gleitkommaformat, das von NVIDIA mit der RTX-50-Serie eingefuehrt wurde. Es halbiert den Speicherbedarf gegenueber INT8 und ermoeglicht extrem schnelle AI-Inferenz. Die 5. Generation der Tensor Cores unterstuetzt FP4 nativ.
Machine Learning
Machine Learning ist ein Teilbereich der KI, bei dem Computer aus Daten lernen, ohne explizit programmiert zu werden. Es umfasst ueberwacht (Supervised), unueberwacht (Unsupervised) und bestaerkendes (Reinforcement) Lernen. Deep Learning ist eine spezielle Methode des Machine Learning.