Teilnehmende lernen, warum hochwertige Daten die unverzichtbare Grundlage für alle datenwissenschaftlichen Prozesse darstellen und wie die gezielte Sicherstellung von Data Quality zu präziseren Modellen, aussagekräftigeren Analysen und verlässlicheren Entscheidungen führt.

Inhalte und Ziele
  • Grundlagen der Datenqualität im Data-Science-Prozess
  • Zentrale Qualitätsdimensionen wie Vollständigkeit, Konsistenz, Genauigkeit und Aktualität
  • Erkennen typischer Fehlerquellen in großen und komplexen Datensätzen
  • Methoden zur Behebung von Datenfehlern und zur Datenbereinigung
  • Automatisierte Validierungen und strukturierte Workflows zur Sicherstellung der Data Quality
  • Gezielte Anwendung von SQL- und BI-Tools im Kontext der Datenbereinigung
  • Analyse der Auswirkungen mangelnder Data Quality auf Machine-Learning-Modelle, Modelltraining und Interpretation
  • Strategien zur Risikovermeidung bei schlechter Datenqualität
  • Entwicklung eines umfassenden Verständnisses für datenqualitätsorientiertes Arbeiten im gesamten Data-Science-Prozess vom Rohdatensatz bis zur datengestützten Entscheidung