Data Transformation at Scale bietet einen tiefgehenden Einblick in den vollständigen Lebenszyklus datengetriebener Prozesse großer Umfänge, mit einem besonderen Fokus auf Data Engineering, Data Pipeline-Design, ETL-Prozesse sowie fortgeschrittene Tools wie Apache Spark, Airflow, dbt und Kafka. Anders als Standardkurse behandelt dieser Kurs den produktionsreifen Einsatz von Cloud Data Warehouse- und Big Data-Lösungen in Verbindung mit Streaming Data-Architekturen für Unternehmen, die hohe Datenvolumina mit komplexen Anforderungen an Datenqualität, Skalierbarkeit und Echtzeit-Analysen in der Cloud verarbeiten müssen. Teilnehmer
- innen lernen, wie Data Engineers robuste, performante Datenpipelines erstellen, Cloud Computing-Optionen evaluieren, strukturierte Transformationsprozesse entwickeln und die Weichen für langfristige, anpassungsfähige Data-Infrastruktur stellen. Im Mittelpunkt stehen dabei reale Data Engineering-Herausforderungen, der Umgang mit Cloud Data Warehouse-Strukturen und die Integration von Analytics Engineering-Methoden für den effizienten Zugriff auf aussagekräftige Daten.
Grundlagen und Kernkonzepte
- Einführung in Data Engineering und Datenpipeline-Architekturen mit Schwerpunkt auf ETL/ELT-Prinzipien
- Detaillierte Vergleiche zwischen Streaming Data- und Batch Processing-Strategien im Data Engineering
- Herausforderungen wie Data Quality, Konsistenz in Big Data-Umgebungen und Aufbau resilienter Data-Infrastruktur
- Aktuelle Anforderungen an Cloud Data, Cloud Computing und deren Verbindung mit lokalen Infrastrukturen
- Einfluss von Datenmodellierung und Analytics Engineering auf den Data Warehouse-Betrieb
- Bedeutung von Compliance, Performance und Skalierbarkeit im Datenkontext
Technische Implementierung und Praxis
- Implementierung von Data Pipelines mit Python, SQL und Apache Spark für skalierbare Big Data-Lösungen
- Verwendung von Apache Airflow, dbt und Kafka zur Steuerung komplexer Workflows
- Aufbau produktiver Datenpipelines im Cloud Data Warehouse und Integration mehrschichtiger ETL-Prozesse
- Monitoring und Sicherstellung der Data Quality, Validierung von Transformationen und Umgang mit Streaming Data
- Techniken zur Skalierung, Cloud Computing-Strategien, Fehlerdiagnose und nachhaltige Datenmodellierung
- Workflow-Verknüpfung mit DevOps-Methoden für kontinuierliche Integration von Datenänderungen
Analyse, Interpretation und Validierung
- Aussagekraft und Gültigkeit von Data Engineering-Ergebnissen mit Analytics Engineering kritisch bewerten
- Visualisierung und Reporting von Datenflüssen in Data Warehouse-Umgebungen
- Statistische Qualitätssicherung und Dokumentation aller Transformationsschritte
- Nachvollziehbarkeit und Compliance in Data Pipelines und Cloud Data-Lösungen
- Umgang mit Bias, Limitationen und Validierungsstrategien im Big Data-Kontext
Praxisprojekte, Fallstudien und Vertiefung
- Authentische Fallstudien zu Distributed Data Pipelines, Cloud Computing und Big Data-Streaming
- Entwicklung und Optimierung von ETL/ELT-Workflows im Zusammenspiel mit Airflow, Apache Spark und dbt