Maschinelles Lernen für die Datenverarbeitung: Datenstrukturen und Datenmodellierung
Die Teilnehmer erwerben fundierte Kenntnisse in den Bereichen Datenstrukturen, Datenmodellierung und maschinelles Lernen (ML) für die Datenverarbeitung und lernen, wie sie die Datenspeicherung, -abfrage und -verarbeitung für umfangreiche ML-Workflows optimieren können. Sie werden sich mit relationalen und verteilten Datenmodellen, Schema-Design, Feature-Engineering und skalierbarer ML-Integration in Big-Data-Umgebungen befassen.
Einführung in maschinelles Lernen und Datenverarbeitung

  • Verstehen Sie die Rolle von ML in Data Engineering und Big Data-Workflows.
  • Lernen Sie die wichtigsten Konzepte in Bezug auf Datenpipelines, Speicherung und Echtzeit-ML-Verarbeitung kennen.
  • Erkunden Sie Techniken zur Verarbeitung strukturierter und unstrukturierter Daten.
Grundlagen der Datenstrukturen für maschinelles Lernen
  • Arbeiten Sie mit Arrays, verknüpften Listen, Hash-Tabellen und baumartigen Strukturen für die Datenspeicherung.
  • Implementieren Sie grafische Datenstrukturen für die Netzwerk- und Beziehungsanalyse.
  • Erkunden Sie probabilistische Datenstrukturen wie Bloom-Filter und Count-Min-Sketches für eine speichereffiziente Verarbeitung.
Datenmodellierung für Machine-Learning-Pipelines
  • Entwerfen Sie relationale und nicht-relationale Datenmodelle für ML-gesteuerte Anwendungen.
  • Lernen Sie Techniken zur Denormalisierung, Indizierung und Partitionierung für die Datenbankoptimierung kennen.
  • Optimieren Sie das Schema-Design für leistungsstarkes ML-Training und Inferenz.
Feature-Engineering und Datentransformation
  • Implementieren Sie die Vorverarbeitung, Bereinigung und Umwandlung von Daten für ML-Modelle.
  • Entwickeln Sie Funktionen aus strukturierten und unstrukturierten Datensätzen.
  • Optimieren Sie Techniken zur Dimensionsreduktion für große ML-Modelle.
Big-Data-Frameworks für maschinelles Lernen
  • Arbeiten Sie mit Apache Spark MLlib und Hadoop für die verteilte ML-Verarbeitung.
  • Implementieren Sie Echtzeit-ML-Workflows mit Kafka und Spark Streaming.
  • Optimieren Sie Batch- und Streaming-Datenpipelines für skalierbare ML-Anwendungen.
Cloud-basierte Datenmodellierung und ML-Integration
  • Erkunden Sie Cloud-basierte ML- und Datenmodellierungsdienste wie AWS Redshift, BigQuery ML und Snowflake.
  • Optimieren Sie die Speicherung, Indizierung und Leistung von ML-Workflows in Cloud-Datenbanken.
  • Automatisieren Sie die Echtzeit-Modellinferenz in Cloud-basierten Umgebungen.
Praxisprojekte: Datenmodellierung für ML-Pipelines
  • Entwerfen und implementieren Sie optimierte Datenstrukturen für skalierbare ML-Workflows.
  • Entwickeln Sie reale ML-Anwendungen unter Verwendung strukturierter und unstrukturierter Datensätze.
  • Optimieren Sie die Datenabfrage und das Feature-Engineering für leistungsstarke ML-Modelle.

Die Teilnehmer lernen, wie Datenstrukturen und Datenmodellierung die Leistung von Machine Learning in Data Engineering-Prozessen beeinflussen.