Echtzeitverarbeitung ist ein zentraler Bestandteil moderner Datenarchitekturen und bildet die Grundlage schneller Entscheidungs- und Reaktionsprozesse. Apache Spark in Azure Databricks stellt dafür ein leistungsfähiges Streaming-Framework bereit. Streaming Engineer gestalten auf dieser Basis verlässliche Verarbeitungsstrecken für fortlaufende Datenströme.
!Kursinhalt
!1. Grundprinzipien der Echtzeitverarbeitung
*Abgrenzung zu Batch-Verarbeitung
*Latenz- und Durchsatzaspekte
*Rolle von Ereignisquellen
!2. Structured Streaming in Spark
*Grundlagen der Streaming-API
*Sink- und Source-Konzepte
*Umgang mit Zeitfenstern
!3. Verarbeitung in Databricks
*Cluster- und Runtime-Auswahl
*Anbindung an Event- und Log-Quellen
*Integration mit Delta Lake
!4. Betrieb und Stabilität
*Checkpointing und Wiederherstellung
*Umgang mit sich ändernden Schemata
*Monitoring laufender Streams
!Berufliche Relevanz
*Grundlage für reaktionsschnelle Datenprozesse
*Zusammenarbeit mit Produkt- und Betriebsteams
*Erweiterung klassischer Batch-Landschaften