RLHF (Reinforcement Learning from Human Feedback)
Definition
RLHF ist eine Trainingsmethode, bei der ein LLM durch menschliches Feedback lernt. Menschen bewerten verschiedene Modell-Antworten, und ein Belohnungsmodell trainiert das LLM, bevorzugte Antworten zu generieren. RLHF war entscheidend fuer den Erfolg von ChatGPT.
Beispiel
ChatGPT wurde mit RLHF trainiert, um hilfreiche und sichere Antworten zu priorisieren.
Verwandte Begriffe
Mehr aus “AI/ML”
NPU (Neural Processing Unit)
Eine NPU ist ein spezialisierter Prozessor fuer KI-Inference-Aufgaben. Sie ist extrem energieeffizient und entlastet CPU und GPU bei AI-Workloads. Moderne Smartphones und Laptops integrieren NPUs direkt im SoC. Die Leistung wird in TOPS gemessen.
LoRA Fine-Tuning
LoRA Fine-Tuning ist der Prozess des Anpassens eines vortrainierten LLM an eine spezifische Aufgabe mit Low-Rank Adaptation. Statt alle Gewichte zu aktualisieren, werden nur zusaetzliche niedrigdimensionale Matrizen trainiert. Dies reduziert Speicherbedarf und Kosten um bis zu 100x.
ROCm (Radeon Open Compute)
ROCm ist AMDs Open-Source-Plattform fuer GPU-Computing, aehnlich wie NVIDIA CUDA. Es unterstuetzt PyTorch und TensorFlow und ist die Grundlage fuer KI-Training auf AMD-GPUs. ROCm 7 brachte deutliche Verbesserungen bei Performance und Kompatibilitaet.
CUDA (Compute Unified Device Architecture)
CUDA ist NVIDIAs parallele Computing-Plattform und Programmiermodell fuer GPUs. Es ermoeglicht Entwicklern, die Rechenleistung von NVIDIA-GPUs fuer nicht-grafische Aufgaben wie KI-Training zu nutzen. CUDA ist der De-facto-Standard fuer GPU-Computing in der KI-Forschung.