Statistik bildet die Grundlage vieler Data-Science- und Machine-Learning-Verfahren. Sie beschreibt und bewertet Daten mithilfe von Verteilungen, Lage- und Streuungsmaßen sowie Korrelationen. SQL-Abfragen, Power-Query-Transformationen und Python-Analysen liefern die strukturelle Basis, während statistische Konzepte Muster, Anomalien und Einflussfaktoren sichtbar machen. Statistik unterstützt sowohl die Merkmalsauswahl als auch die Modellbewertung. Ziel ist ein belastbarer analytischer Rahmen für Modellbildung und Validierung.

!Datenbasis und Exploration
*SQL-Abfragen zur Erzeugung strukturierter Analysedatensätze
*Power Query zur Typanpassung und Bereinigung
*EDA in Python zur Verteilungs- und Trendanalyse
*Erkennen fehlender oder fehlerhafter Werte

!Statistische Grundbegriffe
*Lagemaße wie Mittelwert, Median und Quartile
*Streuungsmaße wie Varianz und Standardabweichung
*Korrelationen zur Erkennung potenzieller Einflussfaktoren
*Ausreißerklassifikation für stabile Analysen

!Statistik im Modellkontext
*Überprüfung von Voraussetzungen für Regressionsmodelle
*Interpretation statistischer Metriken wie MSE, R2, Accuracy, F1
*Bewertung der Datenqualität für Feature Engineering
*Trennung in Train/Validation/Test anhand statistischer Analysen

!Dokumentation und Qualität
*Visualisierung statistischer Ergebnisse in Power BI
*Definition konsistenter DAX-Measures für Kennzahlen
*Dokumentation statistischer Annahmen und Entscheidungen
*Versionierung der Analyseprozesse