Data Labeling Data Labeling ist das Versehen von Rohdaten mit der jeweils richtigen Antwort, damit ein Modell überwacht trainiert werden kann. Es ist in den meisten Projekten der größte Kostenblock und zugleich der Punkt, an dem Qualität entsteht oder verloren geht. Entscheidend ist eine schriftliche Beschriftungsanweisung, an die sich alle Beteiligten halten.
Kurz-Fakten
Ohne schriftliche Anweisung weichen zwei Personen regelmäßig voneinander ab
Die Übereinstimmung zwischen Beschriftenden lässt sich messen
Zweifelsfälle gehören in die Anweisung, nicht ins Bauchgefühl
Modellgestütztes Vorbeschriften spart Zeit, verstärkt aber vorhandene Fehler
Bedeutung in der Praxis
Eine kleine Stichprobe doppelt beschriften zu lassen und die Abweichung zu messen kostet einen halben Tag. Liegt die Übereinstimmung niedrig, ist nicht das Modell das Problem, sondern die Aufgabendefinition.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.