Datenaufbereitung

Grundlage · Maschinelles Lernen · Seit 2024

🧹

Datenaufbereitung

Grundlage

Über die Leistung

Der größte Teil eines Machine-Learning-Projekts entfällt auf Daten, nicht auf Modelle. Bereinigt werden Dubletten, widersprüchliche Einträge und Lücken; danach werden Wertebereiche vereinheitlicht und die Aufteilung in Trainings-, Validierungs- und Testmenge festgelegt – vor dem ersten Training, nicht danach. Wer die Testmenge nachträglich zuschneidet, misst sich selbst. Grenze: Aufbereitung erzeugt keine Information. Wenn ein Merkmal in den Rohdaten nicht steckt, holt es auch die sauberste Pipeline nicht heraus.

Was dazugehört

Bereinigung Dublettenprüfung Skalierung Umgang mit Lücken Aufteilung in Trainings- und Testmenge

Kurz gesagt

Der Teil, an dem die meisten Projekte tatsächlich scheitern