Flash Attention
Definition
Flash Attention ist ein optimierter Algorithmus fuer die Attention-Berechnung in Transformern. Er minimiert Lese-/Schreibzugriffe auf den VRAM und fuhrt zu 2-4x schnelleren Training- und Inferenzzeiten. Flash Attention 3 nutzt Triton fuer maximale GPU-Auslastung.
Beispiel
Flash Attention 3 auf H100 verdreifacht die Training-Geschwindigkeit eines 7B-Modells.
Verwandte Begriffe
Mehr aus “AI/ML”
CUDA (Compute Unified Device Architecture)
CUDA ist NVIDIAs parallele Computing-Plattform und Programmiermodell fuer GPUs. Es ermoeglicht Entwicklern, die Rechenleistung von NVIDIA-GPUs fuer nicht-grafische Aufgaben wie KI-Training zu nutzen. CUDA ist der De-facto-Standard fuer GPU-Computing in der KI-Forschung.
Model Compression
Model Compression umfasst verschiedene Techniken, um KI-Modelle kleiner und effizienter zu machen. Dazu zaehlen Quantisierung, Pruning, Knowledge Distillation und Low-Rank Factorization. Ziel ist der Einsatz auf Geraeten mit begrenzten Ressourcen.
Metal (Apple GPU Framework)
Metal ist Apples Low-Level-API fuer GPU-Programmierung auf iOS und macOS. Es wird von Core ML und MLX fuer KI-Workloads genutzt. Metal Performance Shaders bieten optimierte Kernel fuer AI-Inferenz auf Apple Silicon.
FLOPS (Floating Point Operations Per Second)
FLOPS misst die Anzahl der Gleitkomma-Operationen pro Sekunde. Im Gegensatz zu TOPS, das ganze Operationen zaehlt, erfasst FLOPS genauer die mathematische Leistung. Es wird in PetaFLOPS (10^15) oder ExaFLOPS (10^18) angegeben.