Data Integration Strategies eröffnet einen tiefgehenden Einblick in spezialisierte Data Engineering-Prozesse und bringt Ihnen gezielte Techniken zur effizienten Integration vielfältiger Datenquellen mit Data Pipelines, ETL/ELT-Verfahren und Big Data-Technologien näher. Im Gegensatz zu allgemeinen Datenkursen behandelt dieser Kurs gezielt den Aufbau widerstandsfähiger Cloud Data-Architekturen, die Implementierung von Data Warehouses sowie die Orchestrierung komplexer Datenströme mit Apache Spark, Airflow und Kafka. Besonderer Wert wird auf die Automatisierung und Überwachung von Datenflüssen, die Absicherung der Data Quality und die Analyse heterogener Datenstrukturen gelegt - alles direkt umsetzbar mit Python und SQL auf modernsten Cloud Computing-Plattformen. Der Kurs richtet sich an Data Engineers und Analytics Engineering-Interessierte, die im Bereich Datenintegration und Data-Infrastruktur neue Maßstäbe setzen wollen.
Grundlagen und Kernkonzepte- Tiefergehendes Verständnis für moderne Data Engineering-Prinzipien und Begriffsabgrenzungen
- Ausführlicher Vergleich zwischen ETL, ELT, Batch Processing und Streaming Data
- Bedeutung von Cloud Data, Data Warehouse und Cloud Data Warehouse im Kontext der Integration
- Systematische Einbindung von Datenmodellen und Data Modeling in die Gesamtarchitektur
- Rollenspezifische Anforderungen an Data Engineer und Analytics Engineering im Projektalltag
- Zuverlässigkeit, Skalierbarkeit und Anpassungsfähigkeit komplexer Datenpipelines
Technische Implementierung und Praxis
- Praxisorientierte Einführung in Python, SQL, Apache Spark, dbt, Airflow und Kafka
- Implementierung von robusten ETL- und ELT-Prozessen für strukturierte und unstrukturierte Daten
- Einrichtung und Überwachung von Streaming Data-Workflows für kontinuierliche Datenintegration
- Integration von Batch Processing und Performance-Tuning für große Datenvolumina
- Optimierung und Wartung von Cloud Data-Infrastrukturen und Data Warehouses
- Maßnahmen zur Sicherung der Data Quality im produktiven Betrieb von Datenpipelines
- Versionsverwaltung, Deployment und Automatisierung in der Cloud
Analyse, Interpretation und Validierung
- Messbare Bewertung der Data Quality entlang der gesamten Data Pipeline
- Erstellung nachvollziehbarer Analytics Engineering-Berichte auf Grundlage valider Datenintegration
- Erkennung und Management von Biases, Limitationen und Daten-Inkonsistenzen
- Zielgerichtete Kommunikation von Insights zwischen Data Engineer und Stakeholdern
- Anfertigung vollständiger Dokumentationen für Data-Infrastruktur und Datenpipelines
Praxisprojekte, Fallstudien und Vertiefung
- Lösungsstrategien für Data Integration bei unternehmensübergreifenden Big Data-Projekten
- Kombination Cloud Computing-basierter Ansätze und Data Modeling-Methoden in Realprojekten
- Bearbeitung komplexer Datenquellen - von Streaming Data über Batch Processing bis zu Cloud Data Warehouse