ETL Pipelines bilden in vielen Datenarchitekturen das zentrale Rückgrat zwischen Quellsystemen und auswertbaren Tabellen. Databricks bietet hierfür eine cloudbasierte Plattform, die analytische und produktive Aufgaben verbindet. Der Kurs zeigt, wie Pipelines strukturiert aufgebaut, betrieben und überwacht werden.
!Kursinhalt
!1. Aufbau einer ETL-Pipeline in Databricks
*Notebooks und Jobs als zentrale Bausteine
*Datenquellen und Zieltabellen
*Strukturierung in Schichten
!2. Transformationen mit Spark
*DataFrame-Operationen für ETL-Logik
*Umgang mit großen Datenmengen
*Performante Schreib- und Lesepfade
!3. Orchestrierung und Steuerung
*Job-Definitionen und Abhängigkeiten
*Parameterisierung wiederkehrender Jobs
*Versionierung von Pipelines
!4. Betrieb und Überwachung von Pipelines
*Monitoring und Logging in Databricks
*Fehlerbehandlung und Wiederholbarkeit
*Pflege bei sich ändernden Quellen
!Berufliche Relevanz
*Aufbau belastbarer Datenstrecken in Cloud-Umgebungen
*Brücke zwischen Quellsystemen und Analytics-Schicht
*Methodische Grundlage für Data Engineering Aufgaben