Überwachung von Datenprozessen legt den Schwerpunkt dezidiert auf Data Engineering-Praktiken zur Sicherstellung durchgängiger Datenqualität, Zuverlässigkeit und Performance von Datenpipelines und komplexen Data Engineering-Lösungen. Der Kurs unterscheidet sich von allgemeinen Data Engineer-Angeboten durch die umfassende Einbettung von Überwachungstechnologien und -strategien in bestehende ETL- und ELT-Pipelines, sowie auf kontinuierliche Kontrolle von Batch Processing, Streaming Data und Cloud Data Warehouse-Architekturen. Sie setzen Data Quality-Metriken um, nutzen Monitoring-Tools wie Airflow, Apache Spark, Kafka oder dbt und optimieren so Echtzeit- und Cloud Data-Flüsse bis ins Produktionsumfeld. Python und SQL stehen als technische Basis im Vordergrund, ergänzt durch gezielte Szenarien für Big Data und Analytics Engineering.

Grundlagen und Kernkonzepte
  • Zielgerichtete Einführung in grundlegende Data Engineering- und Überwachungskonzepte
  • Unterschiede zwischen Data Pipeline, Batch und Streaming Data erkennen und anwenden
  • Einführung in Cloud Data Warehouse, Data-Infrastruktur und Monitoring-Strategien für verschiedene Datenflüsse
  • Spezifische Herausforderungen bei der kontinuierlichen Datenüberwachung
  • Relevanz von Data Quality und deren Messgrößen in Datenprozessen
  • Erweiterung um Sicherheitsaspekte, Compliance und Monitoring-Anforderungen in regulierten Umgebungen

Technische Implementierung und Praxis
  • Aufbau und Integration von Monitoring-Lösungen mit Airflow, Apache Spark und dbt sowie deren Konfiguration für Data Engineering
  • Umsetzung typischer Workflows: Data Pipeline-Überwachung, Eskalationspfade und Fehlerbehandlung
  • Praxisnahe Anwendung von Python und SQL für automatisierte Datenvalidierung und Qualitätschecks
  • Nutzung von Cloud Computing-Services zur Überwachung von Dateninfrastruktur und skalierbaren Datenpipelines
  • Best Practices im Logging, Alerting und Governance für robuste Data Engineer-Prozesse
  • Integration von Realtime- und Batch-Monitoring in Data Warehouse- und Big Data-Projekte

Analyse, Interpretation und Validierung
  • Vertiefende Methoden zur Analyse und Bewertung von Datenqualität innerhalb von Datenpipelines
  • Visualisierung und Reporting von Überwachungsmetriken im Kontext von Data Engineering
  • Systematische Validierung und Interpretation von Analytics Engineering-Ergebnissen in Produktionsumgebungen
  • Überwachung von Data Modeling-Prozessen mit Fokus auf Nachvollziehbarkeit und Compliance
  • Entwicklung belastbarer Best Practices für Data Quality und kontinuierliche Optimierung
  • Ergänzung weiterer Monitoring-Tools für verschiedene Datenquellen und Cloud Data-Umgebungen