AI/ML

Flash Attention

Definition

Flash Attention ist ein optimierter Algorithmus fuer die Attention-Berechnung in Transformern. Er minimiert Lese-/Schreibzugriffe auf den VRAM und fuhrt zu 2-4x schnelleren Training- und Inferenzzeiten. Flash Attention 3 nutzt Triton fuer maximale GPU-Auslastung.

Beispiel

Flash Attention 3 auf H100 verdreifacht die Training-Geschwindigkeit eines 7B-Modells.