Rohdatenaufbereitung ist ein zentraler Bestandteil klassischer ETL-Prozesse und beeinflusst die Qualität jeder nachgelagerten Auswertung. Python wird hierfür häufig eingesetzt, da es flexible Verarbeitungsbibliotheken und eine klare Syntax bietet. Für ETL-Entwickler:innen entsteht dadurch ein pragmatischer Werkzeugkasten für wiederkehrende Aufgaben.
!Kursinhalt
!1. Einlesen und Prüfen von Rohdaten
*Umgang mit CSV-, JSON- und Parquet-Dateien
*Erkennen typischer Qualitätsmängel
*Erste Strukturanalysen mit pandas
!2. Bereinigung und Normalisierung
*Behandlung fehlender Werte
*Vereinheitlichung von Formaten
*Typkonvertierungen im Zusammenhang mit ETL
!3. Transformationen auf Rohdatenebene
*Filterung und Auswahl relevanter Merkmale
*Ableitung neuer Felder aus Bestandsdaten
*Zusammenführen mehrerer Dateien
!4. Übergabe in die weitere Verarbeitung
*Rückschreiben in definierte Ablagen
*Dokumentation durchgeführter Schritte
*Einbindung in übergeordnete Pipelines
!Berufliche Relevanz
*Grundlage für belastbare Transformations- und Ladeschritte
*Unterstützung bei Sonderfällen ohne passenden Standardweg
*Zusammenarbeit mit Verantwortlichen für Quellsysteme