Data Transformation at Scale bietet einen tiefgehenden Einblick in den vollständigen Lebenszyklus datengetriebener Prozesse großer Umfänge, mit einem besonderen Fokus auf Data Engineering, Data Pipeline-Design, ETL-Prozesse sowie fortgeschrittene Tools wie Apache Spark, Airflow, dbt und Kafka. Anders als Standardkurse behandelt dieser Kurs den produktionsreifen Einsatz von Cloud Data Warehouse- und Big Data-Lösungen in Verbindung mit Streaming Data-Architekturen für Unternehmen, die hohe Datenvolumina mit komplexen Anforderungen an Datenqualität, Skalierbarkeit und Echtzeit-Analysen in der Cloud verarbeiten müssen. Teilnehmer

  • innen lernen, wie Data Engineers robuste, performante Datenpipelines erstellen, Cloud Computing-Optionen evaluieren, strukturierte Transformationsprozesse entwickeln und die Weichen für langfristige, anpassungsfähige Data-Infrastruktur stellen. Im Mittelpunkt stehen dabei reale Data Engineering-Herausforderungen, der Umgang mit Cloud Data Warehouse-Strukturen und die Integration von Analytics Engineering-Methoden für den effizienten Zugriff auf aussagekräftige Daten.

Grundlagen und Kernkonzepte
  • Einführung in Data Engineering und Datenpipeline-Architekturen mit Schwerpunkt auf ETL/ELT-Prinzipien
  • Detaillierte Vergleiche zwischen Streaming Data- und Batch Processing-Strategien im Data Engineering
  • Herausforderungen wie Data Quality, Konsistenz in Big Data-Umgebungen und Aufbau resilienter Data-Infrastruktur
  • Aktuelle Anforderungen an Cloud Data, Cloud Computing und deren Verbindung mit lokalen Infrastrukturen
  • Einfluss von Datenmodellierung und Analytics Engineering auf den Data Warehouse-Betrieb
  • Bedeutung von Compliance, Performance und Skalierbarkeit im Datenkontext

Technische Implementierung und Praxis
  • Implementierung von Data Pipelines mit Python, SQL und Apache Spark für skalierbare Big Data-Lösungen
  • Verwendung von Apache Airflow, dbt und Kafka zur Steuerung komplexer Workflows
  • Aufbau produktiver Datenpipelines im Cloud Data Warehouse und Integration mehrschichtiger ETL-Prozesse
  • Monitoring und Sicherstellung der Data Quality, Validierung von Transformationen und Umgang mit Streaming Data
  • Techniken zur Skalierung, Cloud Computing-Strategien, Fehlerdiagnose und nachhaltige Datenmodellierung
  • Workflow-Verknüpfung mit DevOps-Methoden für kontinuierliche Integration von Datenänderungen

Analyse, Interpretation und Validierung
  • Aussagekraft und Gültigkeit von Data Engineering-Ergebnissen mit Analytics Engineering kritisch bewerten
  • Visualisierung und Reporting von Datenflüssen in Data Warehouse-Umgebungen
  • Statistische Qualitätssicherung und Dokumentation aller Transformationsschritte
  • Nachvollziehbarkeit und Compliance in Data Pipelines und Cloud Data-Lösungen
  • Umgang mit Bias, Limitationen und Validierungsstrategien im Big Data-Kontext

Praxisprojekte, Fallstudien und Vertiefung
  • Authentische Fallstudien zu Distributed Data Pipelines, Cloud Computing und Big Data-Streaming
  • Entwicklung und Optimierung von ETL/ELT-Workflows im Zusammenspiel mit Airflow, Apache Spark und dbt