SQL-Verarbeitung in Apache Spark beschreibt den Weg, auf dem verteilte Datenmengen über eine an SQL angelehnte Sprache analysiert werden. In Databricks steht dafür Spark SQL in enger Verbindung mit DataFrames. Streaming Engineer nutzen diese Mittel, um Streams auch mit klassischem SQL-Wissen verständlich zu gestalten.
!Kursinhalt
!1. Spark SQL im Überblick
*Beziehung zu DataFrames
*Rolle des Catalogs
*Zusammenspiel mit Delta Lake
!2. SQL-basierte Verarbeitung
*Auswahl- und Aggregationslogik
*Joins über verteilte Datensätze
*Nutzung von Fensterfunktionen
!3. Streaming-Bezug
*SQL auf kontinuierlichen Datenströmen
*Zeitfenster und Wasserzeichen
*Umgang mit Zustand
!4. Betriebliche Aspekte
*Abfrageausführung auf Clustern
*Analyse von Ausführungsplänen
*Laufzeitoptimierungen
!Berufliche Relevanz
*Brücke zwischen klassischer SQL-Welt und Streaming
*Grundlage für verständliche Verarbeitungsmuster
*Unterstützung bei Zusammenarbeit mit Analytics-Rollen