Kurz-Fakten

  • Bezieht eine Folge auf sich selbst statt auf eine zweite Folge
  • Arbeitet mit drei abgeleiteten Größen: Query, Key, Value
  • Aufwand wächst quadratisch mit der Folgenlänge
  • Wird in Transformern mehrfach parallel ausgeführt (Multi-Head)

Bedeutung in der Praxis

Praktisch erklärt Self-Attention, warum Sprachmodelle bei klar formulierten Texten besser arbeiten. Ein Absatz mit eindeutigen Bezügen kostet das Modell weniger Rateanteil – derselbe Grund, aus dem eigenständige Absätze auch für die Übernahme in KI-Antworten wichtig sind.

Verwandte Begriffe