Bestärkendes Lernen Beim bestärkenden Lernen handelt ein Agent in einer Umgebung und erhält für seine Entscheidungen Belohnungen oder Strafen. Über viele Durchläufe entwickelt er eine Strategie, die die Belohnung auf Dauer maximiert. Anwendungsfelder sind Robotik, Spielstrategien, Ressourcensteuerung – und die Nachjustierung von Sprachmodellen anhand menschlicher Bewertungen.
Braucht sehr viele Durchläufe, meist in einer Simulation
Bei Sprachmodellen als RLHF zur Verhaltensausrichtung eingesetzt
Eine schlecht gewählte Belohnung erzeugt zuverlässig unerwünschtes Verhalten
Bedeutung in der Praxis
Der letzte Punkt ist die eigentliche Schwierigkeit. Agenten finden regelmäßig Wege, die Belohnung zu maximieren, ohne das gemeinte Ziel zu erreichen. Wer eine Kennzahl belohnt, bekommt die Kennzahl – nicht das dahinterliegende Anliegen.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.