AI/ML

RLHF (Reinforcement Learning from Human Feedback)

Definition

RLHF ist eine Trainingsmethode, bei der ein LLM durch menschliches Feedback lernt. Menschen bewerten verschiedene Modell-Antworten, und ein Belohnungsmodell trainiert das LLM, bevorzugte Antworten zu generieren. RLHF war entscheidend fuer den Erfolg von ChatGPT.

Beispiel

ChatGPT wurde mit RLHF trainiert, um hilfreiche und sichere Antworten zu priorisieren.