- Die 5 V von Big Data: Volume, Velocity, Variety, Veracity und Value kennenlernen
- Einteilung von strukturierten, halbstrukturierten und unstrukturierten Daten
- Erforschung der Bedeutung von Big Data in modernen Geschäftsstrategien und der Datenanalyse
Speicherung großer Datenmengen
- Einführung in das Hadoop Distributed File System (HDFS)
- Unterschied zwischen Data Lakes und Data Warehouses für groß angelegte Datenaufbewahrung
- Verwendung von NoSQL-Datenbanken zur effektiven Unterstützung der datenintensiven Analysen
Verteilte Datenverarbeitungs-Frameworks
- Einsatz von Apache Hadoop und MapReduce für parallele Datenverarbeitung
- Nutzung von Apache Spark zur verbesserten Skalierung von Datenanalyse-Abläufen
- Echtzeit-Datenstromverarbeitung mit Apache Kafka
Big Data-Analysetechniken
- Batch-Verarbeitung vs. Stream-Verarbeitung: Strategieauswahl
- Datenanalyse mit Python und SQL auf großen Datenbeständen
- Vorverarbeitung und Datenverwandlung für präzise analytische Ergebnisse
Governance und Sicherheit in der Big Data-Umgebung
- Datenschutzmaßnahmen und Standards wie DSGVO, HIPAA umsetzen
- Zugriffskontrolle und Verschlüsselung sensibler Daten in Analysekontexten
- Verwaltung von Governance-Rahmenwerken zur Qualitätssicherung in der Datenanalyse
Praktische Anwendungen von Big Data
- Einsatz von Datenanalysen auf Big Data in Finanz, E-Commerce und Gesundheit
- Integrationen künstlicher Intelligenz und maschinellem Lernen zur Bereicherung von Big Data Insights
- Entwicklung von robuster Big-Data-Pipelines für skalierbare Analyse-Lösungen