Flash Attention
Definition
Flash Attention ist ein optimierter Algorithmus fuer die Attention-Berechnung in Transformern. Er minimiert Lese-/Schreibzugriffe auf den VRAM und fuhrt zu 2-4x schnelleren Training- und Inferenzzeiten. Flash Attention 3 nutzt Triton fuer maximale GPU-Auslastung.
Beispiel
Flash Attention 3 auf H100 verdreifacht die Training-Geschwindigkeit eines 7B-Modells.
Verwandte Begriffe
Mehr aus “AI/ML”
TinyML
TinyML ist das Feld des Machine Learning fuer extrem ressourcenbeschraenkte Geraete (Mikrocontroller, Sensoren). Modelle werden auf wenige Kilobyte komprimiert. Typische Anwendungen sind Keyword-Spotting, Gestenerkennung und Anomalie-Erkennung auf Batterie-Geraeten.
RLHF (Reinforcement Learning from Human Feedback)
RLHF ist eine Trainingsmethode, bei der ein LLM durch menschliches Feedback lernt. Menschen bewerten verschiedene Modell-Antworten, und ein Belohnungsmodell trainiert das LLM, bevorzugte Antworten zu generieren. RLHF war entscheidend fuer den Erfolg von ChatGPT.
FP4 (4-bit Floating Point)
FP4 ist ein 4-bit-Gleitkommaformat, das von NVIDIA mit der RTX-50-Serie eingefuehrt wurde. Es halbiert den Speicherbedarf gegenueber INT8 und ermoeglicht extrem schnelle AI-Inferenz. Die 5. Generation der Tensor Cores unterstuetzt FP4 nativ.
Inference (Inferenz)
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs fuer Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Geraet statt.