Kurz-Fakten
- Übliches Verfahren bei Sprachmodellen: RLHF und verwandte Methoden
- Systeme optimieren die Belohnung, nicht das gemeinte Ziel
- Ausrichtung ist immer die Ausrichtung an bestimmten Werten – wessen, ist eine Frage
- Betrifft heutige Systeme praktisch, nicht nur hypothetisch
Bedeutung in der Praxis
Der praktische Bezug ist alltäglich: Jede Kennzahl, die man belohnt, wird maximiert – gelegentlich auf Wegen, die niemand vorgesehen hat. Das gilt für Empfehlungssysteme ebenso wie für Agenten mit Werkzeugzugriff.