Data Cleaning Data Cleaning ist das Beseitigen von Fehlern und Widersprüchen in einem Datenbestand: Dubletten, unmögliche Werte, uneinheitliche Schreibweisen, fehlende Angaben. Es ist Voraussetzung dafür, dass ein Modell die tatsächlichen Zusammenhänge lernt und nicht die Eigenheiten der Erfassung. Der Aufwand wird regelmäßig unterschätzt.
Ein Ausreißer kann ein Fehler oder der wichtigste Fall sein
Jede Bereinigungsregel gehört dokumentiert und wiederholbar gemacht
Bereinigung erzeugt keine Information, die nicht vorhanden ist
Bedeutung in der Praxis
Ausreißer pauschal zu entfernen ist bequem und in der Betrugserkennung fatal – dort sind genau sie der Untersuchungsgegenstand. Vor dem Löschen gehört die Frage geklärt, ob der Wert falsch oder nur selten ist.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.