Datenvorverarbeitung Datenvorverarbeitung umfasst alle Schritte, die Rohdaten in eine für das Training geeignete Form bringen: Bereinigen, Umgang mit Lücken, Vereinheitlichen von Wertebereichen, Kodieren von Kategorien. Auf sie entfällt der größte Zeitanteil eines Machine-Learning-Projekts. Fehler in dieser Phase lassen sich später durch kein Verfahren ausgleichen.
Kurz-Fakten
Typischer Zeitanteil am Projekt: 60 bis 80 Prozent
Skalierungswerte werden auf der Trainingsmenge berechnet, nicht auf allen Daten
Fehlende Werte zu ersetzen ist eine Annahme, keine neutrale Operation
Jeder Schritt gehört in eine reproduzierbare Verarbeitungskette
Bedeutung in der Praxis
Der zweite Punkt ist die häufigste stille Fehlerquelle. Wer Mittelwert und Streuung über den Gesamtbestand berechnet, hat die Testdaten schon im Training verwendet – die spätere Bewertung ist dann zu optimistisch.
Inhaber von SEO NW in Bertingen. Arbeitet an der Schnittstelle von Suchmaschinenoptimierung und angewandter künstlicher Intelligenz: Prompt Engineering, Retrieval-Augmented Generation und die Frage, unter welchen Bedingungen ein Sprachmodell einen Inhalt übernimmt und der richtigen Quelle zuschreibt.