AI Benchmark
Definition
AI Benchmarks messen die Leistung von Hardware oder Software bei KI-Workloads. Bekannte Benchmarks sind MLPerf (Training/Inference), AI-Benchmark (Smartphone NPU) und LMSYS Chatbot Arena (LLM-Qualitaet). Sie ermoeglichen objektive Vergleiche zwischen verschiedenen Systemen.
Beispiel
MLPerf Inference v5.0 zeigt, dass der NVIDIA H100 2,5x schneller ist als der A100 bei LLM-Inference.
Verwandte Begriffe
Mehr aus “AI/ML”
AGI (Artificial General Intelligence)
AGI bezeichnet eine KI, die kognitive Faehigkeiten auf menschlichem Niveau in allen Bereichen erreicht. Anders als schmale KI (Narrow AI) kann AGI jede intellektuelle Aufgabe erlernen, die ein Mensch erlernen kann. Ob AGI erreicht wurde, ist unter Experten umstritten.
FP4 (4-bit Floating Point)
FP4 ist ein 4-bit-Gleitkommaformat, das von NVIDIA mit der RTX-50-Serie eingefuehrt wurde. Es halbiert den Speicherbedarf gegenueber INT8 und ermoeglicht extrem schnelle AI-Inferenz. Die 5. Generation der Tensor Cores unterstuetzt FP4 nativ.
Edge Inference
Edge Inference fuehrt KI-Modelle direkt auf dem Endgeraet aus, ohne Cloud-Verbindung. Dies reduziert Latenz, spart Bandbreite und schuetzt die Privatsphaere. NPUs mit 40+ TOPS ermoeglichen Edge Inference fuer LLMs mit bis zu 7 Milliarden Parametern.
Flash Attention
Flash Attention ist ein optimierter Algorithmus fuer die Attention-Berechnung in Transformern. Er minimiert Lese-/Schreibzugriffe auf den VRAM und fuhrt zu 2-4x schnelleren Training- und Inferenzzeiten. Flash Attention 3 nutzt Triton fuer maximale GPU-Auslastung.