Matrix Multiply (GEMM)
Definition
Matrix Multiply (General Matrix Multiply, GEMM) ist die fundamentale Operation in Neural Networks. praktisch alle Berechnungen in einem LLM lassen sich auf Matrix-Multiplikation zurueckfuehren. Tensor Cores und NPUs sind hardwareseitig fuer maximale GEMM-Performance optimiert.
Beispiel
Ein 4096x4096 Matrix-Multiply ist die Kernoperation in einem Transformer-Attention-Layer.
Verwandte Begriffe
Mehr aus “AI/ML”
TinyML
TinyML ist das Feld des Machine Learning fuer extrem ressourcenbeschraenkte Geraete (Mikrocontroller, Sensoren). Modelle werden auf wenige Kilobyte komprimiert. Typische Anwendungen sind Keyword-Spotting, Gestenerkennung und Anomalie-Erkennung auf Batterie-Geraeten.
BF16 (Bfloat16)
BF16 (Brain Float 16) ist ein von Google entwickeltes 16-bit-Format, das den gleichen Dynamikbereich wie FP32 bietet. Es ist stabiler als FP16 beim Training grosser Modelle und wird von allen modernen AI-Beschleunigern (TPU, H100, A100) unterstuetzt.
FP8 (8-bit Floating Point)
FP8 ist ein 8-bit-Gleitkommaformat, das 2022 von NVIDIA, AMD und ARM gemeinsam spezifiziert wurde. Es bietet hoehere Praezision als INT8 bei gleichem Speicherbedarf. Die RTX 50-Serie unterstuetzt FP4 und FP8 nativ fuer maximale AI-Performance.
Transformer (Architektur)
Die Transformer-Architektur wurde 2017 von Google eingefuehrt und ist die Grundlage aller modernen LLMs. Sie nutzt Self-Attention-Mechanismen, um Beziehungen zwischen allen Tokens gleichzeitig zu erfassen. Dadurch sind Transformer stark parallelisierbar und skalierbar.