🧹
Datenaufbereitung
Grundlage
⭐ Schwerpunkt
Über die Leistung
Der größte Teil eines Machine-Learning-Projekts entfällt auf Daten, nicht auf Modelle. Bereinigt werden Dubletten, widersprüchliche Einträge und Lücken; danach werden Wertebereiche vereinheitlicht und die Aufteilung in Trainings-, Validierungs- und Testmenge festgelegt – vor dem ersten Training, nicht danach. Wer die Testmenge nachträglich zuschneidet, misst sich selbst. Grenze: Aufbereitung erzeugt keine Information. Wenn ein Merkmal in den Rohdaten nicht steckt, holt es auch die sauberste Pipeline nicht heraus.
Was dazugehört
Bereinigung
Dublettenprüfung
Skalierung
Umgang mit Lücken
Aufteilung in Trainings- und Testmenge
Kurz gesagt
Der Teil, an dem die meisten Projekte tatsächlich scheitern