Im Arbeitsalltag von Data-Engineering-Teams nimmt die Batch Verarbeitung weiterhin eine zentrale Rolle ein, weil viele Auswertungen auf periodisch konsolidierten Daten beruhen. Databricks bietet hierfür eine skalierbare Umgebung. Der Kurs zeigt, wie Batch-Jobs entworfen, umgesetzt und betrieben werden.

!Kursinhalt

!1. Konzept der Batch Verarbeitung
*Periodische Lade- und Verarbeitungsfenster
*Abgrenzung zu Streaming
*Typische Anwendungsfälle

!2. Implementierung in Databricks
*Spark-Jobs für Batch-Verarbeitung
*Schreibstrategien wie Overwrite und Append
*Partitionierung großer Tabellen

!3. Steuerung und Skalierung
*Cluster-Konfigurationen für Batch-Workloads
*Geplante Ausführung über Jobs
*Wiederholbare und idempotente Verarbeitung

!4. Pflege und Optimierung
*Performance-Analyse von Batch-Jobs
*Umgang mit fehlgeschlagenen Läufen
*Pflege bei sich ändernden Quellen

!Berufliche Relevanz

*Verlässliche Verarbeitung großer Datenmengen
*Methodische Grundlage für moderne Lakehouse-Architekturen
*Schlüsselrolle in vielen Data-Engineering-Projekten