Dieser Kurs vermittelt die Anwendung von Python zur skalierbaren Datenverarbeitung, Generierung von Kennzahlen und Entwicklung praktischer Big Data Workflows.

Python für skalierbare Datenverarbeitung nutzen
  • Große Datensätze bereinigen, strukturieren und analysieren mithilfe von pandas
  • Techniken wie Filtern, Aggregation und Umgang mit fehlenden Werten anwenden
  • Effizientes Arbeiten mit realen Daten durch strukturierte, wiederholbare Workflows

Kennzahlen zur Unterstützung datengesteuerter Erkenntnisse generieren
  • Wichtige statistische Kennzahlen wie Mittelwert, Median und Quartile berechnen
  • Lineare und logistische Regressionsmodelle zur Identifizierung von Mustern und Beziehungen anwenden
  • Boolesches Masking und Gruppierung verwenden, um Daten nach relevanten Kategorien aufzuschlüsseln

Einen praktischen Big Data Workflow entwickeln
  • Daten aus Datenbanken, Web-APIs und anderen Quellen importieren und kombinieren
  • Trends und Verteilungen mithilfe von matplotlib und den Plotting-Tools von pandas visualisieren
  • Konsistente Prozesse für die Aufbereitung und Interpretation von Daten im großen Maßstab erstellen