−36 %Nur am 3. Oktober · mit Code EINHEIT36 im WarenkorbZur Aktion →
KI-Technologie

RLHF (Reinforcement Learning from Human Feedback)

Menschen bewerten Antworten eines Sprachmodells, und das Training richtet es stärker an den besser bewerteten aus. Im vereinfachten Bild des Lehrgangs ist das die zweite Stufe des Finetunings, die Ton, Stil und Sicherheitsbewusstsein prägt.

Zuletzt aktualisiert:

Vereinfacht beschreibt der Lehrgang die Entstehung eines Sprachmodells in zwei Phasen. Im Pretraining übt es aus enormen Textmengen nur eine Aufgabe: das nächste Token vorhersagen. Nebenbei lernt es dabei Grammatik, Fakten, Stile und Fachsprachen. Das Ergebnis weiß viel, folgt aber noch keinen Anweisungen, sondern setzt Text fort.

Finetuning in zwei Stufen

Die zweite Phase macht aus dem wissenden Modell ein nützliches. Dieses Finetuning beschreibt der Lehrgang in zwei Stufen. Im Instruction Tuning lernt das Modell an Beispielen, Anweisungen zu befolgen statt einen Text einfach weiterzuschreiben. Danach folgt in diesem Bild RLHF. Als Merksatz: Das Pretraining macht die KI wissend, das Finetuning macht sie nützlich.

Was RLHF genau macht

RLHF steht für Reinforcement Learning from Human Feedback. Menschen bewerten Antworten des Modells, und das Training verschiebt das Modell in Richtung der Antworten, die bevorzugt wurden. Was dabei entsteht, ist vor allem Verhalten: Ton, Stil und Sicherheitsbewusstsein. Was wir als „Persönlichkeit“ eines Modells erleben, prägt laut Lehrgang vor allem diese Stufe.

Für die Praxis heißt das: Ton und Stil sind trainierte Eigenschaften, kein Beleg für Richtigkeit. Ausführlicher behandelt das der Begriff Scheinsicherheit. Wie die Trainingsphasen zusammenhängen, vertieft der Lehrgang Manager für KI-Kompetenzen (IHK).

Beispiele aus der Praxis

Beispiel · ohne Instruction Tuning: Du schreibst „Erkläre mir, wie ein Modell Text in Token zerlegt“. Ein rein vortrainiertes Modell setzt diesen Satz eher fort, statt die Erklärung zu liefern. Erst das Finetuning macht aus der Fortsetzung eine Antwort.

Beispiel · Wirkung von RLHF: Zwei Antworten auf dieselbe Frage, eine knapp und schroff, eine hilfreich und mit klarem Vorbehalt. Bewerten Menschen die zweite durchgängig besser, verschiebt das Training das Modell in diese Richtung. So entsteht der Ton, den du im Chat erlebst.

KI-Begriff erklärt · RLHF (Reinforcement Learning from Human Feedback)

Solche Begriffe sicher anwenden — im IHK-Lehrgang

„RLHF (Reinforcement Learning from Human Feedback)" ist einer von 9 Schlüsselbegriffen, die wir im Manager-Lehrgang in praxisnahen Modulen vertiefen. Hol dir das offizielle IHK-Zertifikat.

Kostenlos testen
Über thekey.academy

thekey.academy ist eine deutsche Online-Lernplattform für IHK-zertifizierte berufliche Weiterbildung — 24 Lehrgänge zu KI, Führung, Resilienz, Marketing und HR. 100 % online, self-paced, mit IHK-Zertifikat.