Embedding Ein Embedding ist die Darstellung eines Textstücks, Bildes oder anderen Objekts als Zahlenfolge, in der Ähnlichkeit als räumliche Nähe abgebildet wird. Inhaltlich verwandte Dinge liegen dicht beieinander, unverwandte weit auseinander. Auf dieser Eigenschaft beruhen semantische Suche, Empfehlungssysteme und die Trefferauswahl in RAG-Systemen.
Kurz-Fakten
Übliche Größen liegen zwischen 384 und 3072 Dimensionen
Ähnlichkeit wird meist über den Kosinus zwischen zwei Vektoren gemessen
Embeddings verschiedener Modelle sind nicht miteinander vergleichbar
Ein Modellwechsel erfordert die Neuberechnung des gesamten Index
Bedeutung in der Praxis
Der letzte Punkt wird regelmäßig übersehen und ist im Betrieb teuer: Wer das Embedding-Modell wechselt, muss den kompletten Bestand neu einlesen. Bei Millionen Dokumenten ist das ein Projekt, kein Konfigurationsschritt.
Embeddings bilden Ähnlichkeit ab, nicht Wahrheit. Zwei Sätze mit gegenteiliger Aussage können sehr nah beieinanderliegen – ein häufiger Grund für schlechte Treffer in RAG-Systemen.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.