Überwachung von Datenprozessen legt den Schwerpunkt dezidiert auf Data Engineering-Praktiken zur Sicherstellung durchgängiger Datenqualität, Zuverlässigkeit und Performance von Datenpipelines und komplexen Data Engineering-Lösungen. Der Kurs unterscheidet sich von allgemeinen Data Engineer-Angeboten durch die umfassende Einbettung von Überwachungstechnologien und -strategien in bestehende ETL- und ELT-Pipelines, sowie auf kontinuierliche Kontrolle von Batch Processing, Streaming Data und Cloud Data Warehouse-Architekturen. Sie setzen Data Quality-Metriken um, nutzen Monitoring-Tools wie Airflow, Apache Spark, Kafka oder dbt und optimieren so Echtzeit- und Cloud Data-Flüsse bis ins Produktionsumfeld. Python und SQL stehen als technische Basis im Vordergrund, ergänzt durch gezielte Szenarien für Big Data und Analytics Engineering.
Grundlagen und Kernkonzepte- Zielgerichtete Einführung in grundlegende Data Engineering- und Überwachungskonzepte
- Unterschiede zwischen Data Pipeline, Batch und Streaming Data erkennen und anwenden
- Einführung in Cloud Data Warehouse, Data-Infrastruktur und Monitoring-Strategien für verschiedene Datenflüsse
- Spezifische Herausforderungen bei der kontinuierlichen Datenüberwachung
- Relevanz von Data Quality und deren Messgrößen in Datenprozessen
- Erweiterung um Sicherheitsaspekte, Compliance und Monitoring-Anforderungen in regulierten Umgebungen
Technische Implementierung und Praxis
- Aufbau und Integration von Monitoring-Lösungen mit Airflow, Apache Spark und dbt sowie deren Konfiguration für Data Engineering
- Umsetzung typischer Workflows: Data Pipeline-Überwachung, Eskalationspfade und Fehlerbehandlung
- Praxisnahe Anwendung von Python und SQL für automatisierte Datenvalidierung und Qualitätschecks
- Nutzung von Cloud Computing-Services zur Überwachung von Dateninfrastruktur und skalierbaren Datenpipelines
- Best Practices im Logging, Alerting und Governance für robuste Data Engineer-Prozesse
- Integration von Realtime- und Batch-Monitoring in Data Warehouse- und Big Data-Projekte
Analyse, Interpretation und Validierung
- Vertiefende Methoden zur Analyse und Bewertung von Datenqualität innerhalb von Datenpipelines
- Visualisierung und Reporting von Überwachungsmetriken im Kontext von Data Engineering
- Systematische Validierung und Interpretation von Analytics Engineering-Ergebnissen in Produktionsumgebungen
- Überwachung von Data Modeling-Prozessen mit Fokus auf Nachvollziehbarkeit und Compliance
- Entwicklung belastbarer Best Practices für Data Quality und kontinuierliche Optimierung
- Ergänzung weiterer Monitoring-Tools für verschiedene Datenquellen und Cloud Data-Umgebungen