Matrix Multiply (GEMM)
Definition
Matrix Multiply (General Matrix Multiply, GEMM) ist die fundamentale Operation in Neural Networks. praktisch alle Berechnungen in einem LLM lassen sich auf Matrix-Multiplikation zurueckfuehren. Tensor Cores und NPUs sind hardwareseitig fuer maximale GEMM-Performance optimiert.
Beispiel
Ein 4096x4096 Matrix-Multiply ist die Kernoperation in einem Transformer-Attention-Layer.
Verwandte Begriffe
Mehr aus “AI/ML”
GAN (Generative Adversarial Network)
GANs bestehen aus zwei Neural Networks, die gegeneinander antreten. Ein Generator erzeugt gefaelschte Daten, ein Diskriminator versucht, diese von echten zu unterscheiden. Durch diesen Wettbewerb werden beide besser. GANs werden fuer Deepfakes und Bildgenerierung verwendet.
Context Window (Kontextfenster)
Das Context Window ist die maximale Anzahl an Tokens, die ein LLM gleichzeitig verarbeiten kann. Es umfasst Eingabe und Ausgabe. Groessere Context Windows erlauben laengere Dokumente und ausgedehntere Konversationen. Gemini 2 erreicht 2 Millionen Tokens.
Neural Network (Neuronales Netz)
Ein Neural Network ist ein vom menschlichen Gehirn inspiriertes KI-Modell aus verbundenen Knoten (Neuronen) in Schichten. Es lernt aus Daten, indem es Gewichte anpasst. Tiefe Netzwerke (Deep Learning) mit vielen Schichten koennen extrem komplexe Muster erkennen.
Quantization (Quantisierung)
Quantization reduziert die Praezision der Gewichte in einem KI-Modell (z. B. von FP16 auf INT4). Dadurch werden Modellgroesse und Speicherbedarf massiv verringert, bei minimalen Genauigkeitsverlusten. INT4 und INT8 sind die gaengigsten Formate fuer Edge-Inferenz.