Tokenisierung Tokenisierung zerlegt Text in kleine Einheiten, sogenannte Token, die ein Sprachmodell verarbeiten kann. Ein Token entspricht meist einem Wortteil, nicht einem ganzen Wort. Weil Preise und Kontextgrenzen in Token gerechnet werden, bestimmt die Zerlegung unmittelbar die Kosten einer Anfrage.
Kurz-Fakten
Deutscher Text braucht je Wort mehr Token als englischer
Faustregel Deutsch: rund 1,5 bis 2 Token je Wort
Zahlen und Sonderzeichen werden häufig ungünstig zerlegt
Jedes Modell hat sein eigenes Vokabular – Tokenzahlen sind nicht übertragbar
Bedeutung in der Praxis
Die ungleiche Zerlegung erklärt einen Kostenunterschied, der viele überrascht: Derselbe Inhalt kostet auf Deutsch spürbar mehr als auf Englisch. Bei großen Mengen lohnt es sich, das in die Rechnung aufzunehmen.
Tokenisierung erklärt auch klassische Schwächen – etwa das Zählen von Buchstaben in einem Wort. Das Modell sieht keine Buchstaben, sondern Wortteile.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.