Transformer-Architektur Der Transformer ist eine 2017 vorgestellte Netzarchitektur, die eine Eingabefolge nicht Schritt für Schritt, sondern als Ganzes verarbeitet und dabei über Attention gewichtet, welche Teile füreinander wichtig sind. Weil sich das parallel berechnen lässt, wurde erstmals das Training auf sehr großen Textmengen praktikabel. Nahezu alle heutigen Sprachmodelle bauen darauf auf.
Kurz-Fakten
Vorgestellt 2017 im Aufsatz „Attention Is All You Need"
Ersetzte rekurrente Netze (RNN, LSTM) in fast allen Sprachaufgaben
Der Rechenaufwand der Attention wächst quadratisch mit der Eingabelänge
Bedeutung in der Praxis
Das quadratische Wachstum erklärt, warum lange Kontexte teuer sind und warum Anbieter für sehr große Kontextfenster deutlich mehr verlangen. Es ist keine Preispolitik, sondern Rechenaufwand.
Die Architektur wird auch außerhalb von Text eingesetzt – für Bilder, Audio und Proteinstrukturen. Der Begriff „Sprachmodell" ist historisch, nicht technisch begründet.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.