Maschinelles Lernen für die Datenverarbeitung: Datenstrukturen und Datenmodellierung
Die Teilnehmer erwerben fundierte Kenntnisse in den Bereichen Datenstrukturen, Datenmodellierung und maschinelles Lernen (ML) für die Datenverarbeitung und lernen, wie sie die Datenspeicherung, -abfrage und -verarbeitung für umfangreiche ML-Workflows optimieren können. Sie werden sich mit relationalen und verteilten Datenmodellen, Schema-Design, Feature-Engineering und skalierbarer ML-Integration in Big-Data-Umgebungen befassen.
Einführung in maschinelles Lernen und Datenverarbeitung
- Verstehen Sie die Rolle von ML in Data Engineering und Big Data-Workflows.
- Lernen Sie die wichtigsten Konzepte in Bezug auf Datenpipelines, Speicherung und Echtzeit-ML-Verarbeitung kennen.
- Erkunden Sie Techniken zur Verarbeitung strukturierter und unstrukturierter Daten.
- Arbeiten Sie mit Arrays, verknüpften Listen, Hash-Tabellen und baumartigen Strukturen für die Datenspeicherung.
- Implementieren Sie grafische Datenstrukturen für die Netzwerk- und Beziehungsanalyse.
- Erkunden Sie probabilistische Datenstrukturen wie Bloom-Filter und Count-Min-Sketches für eine speichereffiziente Verarbeitung.
- Entwerfen Sie relationale und nicht-relationale Datenmodelle für ML-gesteuerte Anwendungen.
- Lernen Sie Techniken zur Denormalisierung, Indizierung und Partitionierung für die Datenbankoptimierung kennen.
- Optimieren Sie das Schema-Design für leistungsstarkes ML-Training und Inferenz.
- Implementieren Sie die Vorverarbeitung, Bereinigung und Umwandlung von Daten für ML-Modelle.
- Entwickeln Sie Funktionen aus strukturierten und unstrukturierten Datensätzen.
- Optimieren Sie Techniken zur Dimensionsreduktion für große ML-Modelle.
- Arbeiten Sie mit Apache Spark MLlib und Hadoop für die verteilte ML-Verarbeitung.
- Implementieren Sie Echtzeit-ML-Workflows mit Kafka und Spark Streaming.
- Optimieren Sie Batch- und Streaming-Datenpipelines für skalierbare ML-Anwendungen.
- Erkunden Sie Cloud-basierte ML- und Datenmodellierungsdienste wie AWS Redshift, BigQuery ML und Snowflake.
- Optimieren Sie die Speicherung, Indizierung und Leistung von ML-Workflows in Cloud-Datenbanken.
- Automatisieren Sie die Echtzeit-Modellinferenz in Cloud-basierten Umgebungen.
- Entwerfen und implementieren Sie optimierte Datenstrukturen für skalierbare ML-Workflows.
- Entwickeln Sie reale ML-Anwendungen unter Verwendung strukturierter und unstrukturierter Datensätze.
- Optimieren Sie die Datenabfrage und das Feature-Engineering für leistungsstarke ML-Modelle.
Die Teilnehmer lernen, wie Datenstrukturen und Datenmodellierung die Leistung von Machine Learning in Data Engineering-Prozessen beeinflussen.