Triton (GPU Programming)
Definition
Triton ist eine von OpenAI entwickelte Programmiersprache fuer GPU-Kernel. Sie ermoeglicht Entwicklern, hochperformante GPU-Kernel in Python-Syntax zu schreiben, ohne CUDA-Experten zu sein. Triton wird in PyTorch 2.0 und Flash Attention verwendet.
Beispiel
Flash Attention 3 nutzt Triton, um Attention 2x schneller als die CUDA-Implementierung zu machen.
Verwandte Begriffe
Mehr aus “AI/ML”
INT4 (4-bit Integer)
INT4 ist ein Quantisierungsformat, das Gewichte mit nur 4 Bits speichert. Es reduziert den Speicherbedarf eines Modells um den Faktor 4 gegenueber FP16. Moderne NPUs und GPUs (wie RTX 50 mit FP4) unterstuetzen INT4/FP4 nativ fuer maximale Effizienz.
Quantization (Quantisierung)
Quantization reduziert die Praezision der Gewichte in einem KI-Modell (z. B. von FP16 auf INT4). Dadurch werden Modellgroesse und Speicherbedarf massiv verringert, bei minimalen Genauigkeitsverlusten. INT4 und INT8 sind die gaengigsten Formate fuer Edge-Inferenz.
AI-PC
Ein AI-PC ist ein Computer mit integrierter NPU, der KI-Aufgaben lokal und energieeffizient ausfuehrt. Microsoft definiert AI-PCs mit mindestens 40 TOPS und Copilot+ Funktion. Sie ermoeglichen Features wie Live-Untertitel, Bildgenerierung und lokale LLMs ohne Cloud.
LoRA (Low-Rank Adaptation)
LoRA ist eine effiziente Fine-Tuning-Methode, die nur einen kleinen Satz zusaetzlicher Parameter trainiert statt des gesamten Modells. Dies reduziert Speicherbedarf und Trainingskosten um den Faktor 10 bis 100. QLoRA kombiniert LoRA mit Quantisierung fuer noch mehr Effizienz.