Im Arbeitsalltag von Data Scientists und Data Analysts nimmt Data Mining eine zentrale Rolle ein, da es die systematische Entdeckung von Mustern, Zusammenhängen und Anomalien in großen Datensätzen ermöglicht. Über die reine Datenauswertung hinaus liefert Data Mining Erkenntnisse, die als Grundlage für Prognosen, Kundensegmentierungen und Prozessoptimierungen dienen. Das Beherrschen von Algorithmen zur Klassifikation, Clustering und Assoziationsanalyse ist Voraussetzung für den professionellen Einsatz.

Kursinhalt
1. Data-Mining-Prozesse und Vorgehensmodelle
  • CRISP-DM: Phasen und Anwendung im Data-Mining-Prozess
  • Überblick Data-Mining-Aufgaben: Klassifikation, Regression, Clustering, Assoziationsanalyse
  • Datenvorbereitung: Bereinigung, Transformation und Feature-Auswahl

2. Klassifikationsverfahren
  • Entscheidungsbäume: CART, C4.5 und Pruning-Strategien
  • k-Nearest Neighbor (kNN) und Naive Bayes
  • Modellbewertung: Konfusionsmatrix, Präzision, Recall, F1-Score

3. Clustering und unüberwachtes Lernen
  • k-Means und hierarchisches Clustering
  • DBSCAN für dichtebasiertes Clustering
  • Clustervalidierung und Silhouettenanalyse

4. Assoziationsregeln und Musterentdeckung
  • Apriori-Algorithmus und Assoziationsregeln
  • Lift, Konfidenz und Support als Bewertungsmaße
  • Anwendungsfälle: Market Basket Analysis, Empfehlungssysteme

Berufliche Relevanz
  • Data-Mining-Kenntnisse werden in Data-Science-, Analytics- und Business-Intelligence-Positionen eingesetzt
  • Ermöglicht die datengetriebene Entdeckung von Mustern ohne vorab definierte Hypothesen
  • Grundlage für weiterführende Machine-Learning- und Predictive-Analytics-Anwendungen