Dieser Kurs vermittelt die Anwendung von Python zur skalierbaren Datenverarbeitung, Generierung von Kennzahlen und Entwicklung praktischer Big Data Workflows.
Python für skalierbare Datenverarbeitung nutzen- Große Datensätze bereinigen, strukturieren und analysieren mithilfe von pandas
- Techniken wie Filtern, Aggregation und Umgang mit fehlenden Werten anwenden
- Effizientes Arbeiten mit realen Daten durch strukturierte, wiederholbare Workflows
Kennzahlen zur Unterstützung datengesteuerter Erkenntnisse generieren
- Wichtige statistische Kennzahlen wie Mittelwert, Median und Quartile berechnen
- Lineare und logistische Regressionsmodelle zur Identifizierung von Mustern und Beziehungen anwenden
- Boolesches Masking und Gruppierung verwenden, um Daten nach relevanten Kategorien aufzuschlüsseln
Einen praktischen Big Data Workflow entwickeln
- Daten aus Datenbanken, Web-APIs und anderen Quellen importieren und kombinieren
- Trends und Verteilungen mithilfe von matplotlib und den Plotting-Tools von pandas visualisieren
- Konsistente Prozesse für die Aufbereitung und Interpretation von Daten im großen Maßstab erstellen