Triton (GPU Programming)
Definition
Triton ist eine von OpenAI entwickelte Programmiersprache fuer GPU-Kernel. Sie ermoeglicht Entwicklern, hochperformante GPU-Kernel in Python-Syntax zu schreiben, ohne CUDA-Experten zu sein. Triton wird in PyTorch 2.0 und Flash Attention verwendet.
Beispiel
Flash Attention 3 nutzt Triton, um Attention 2x schneller als die CUDA-Implementierung zu machen.
Verwandte Begriffe
Mehr aus “AI/ML”
Deep Learning
Deep Learning ist ein Teilbereich des Machine Learning, der Neural Networks mit vielen Schichten verwendet. Es ermoeglicht das Lernen hierarchischer Merkmale aus grossen Datenmengen. Deep Learning treibt Innovationen in Bilderkennung, Sprachverarbeitung und autonomen Systemen.
DirectML
DirectML ist Microsofts Hardware-beschleunigte Machine Learning API fuer Windows. Es ermoeglicht KI-Inferenz auf jeder DirectX-12-kompatiblen GPU (NVIDIA, AMD, Intel). DirectML ist die Grundlage fuer Windows AI Studio und lokale KI auf Windows-Copilot+-PCs.
Inference (Inferenz)
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs fuer Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Geraet statt.
Federated Learning
Federated Learning trainiert KI-Modelle dezentral auf mehreren Geraeten, ohne Daten zu teilen. Jedes Geraet trainiert lokal und sendet nur Modell-Updates an einen zentralen Server. Dies schuetzt die Privatsphaere und wird von Google und Apple eingesetzt.