Grundlagen und Setup
- Installation und Konfiguration der scikit-learn Umgebung
- Überblick über die scikit-learn API-Struktur
- Einführung in den ML-Workflow mit scikit-learn
- Datenstrukturen und Datentypen in scikit-learn
- Integration mit NumPy und Pandas
- Best Practices für reproduzierbare Experimente
- Behandlung von fehlenden Werten
- Encoding kategorischer Variablen
- Skalierung und Normalisierung
- Dimensionsreduktion mit PCA und t-SNE
- Feature Selection und Engineering
- Pipeline-Erstellung für die Datenvorverarbeitung
- Lineare Regression und Regularisierung
- Logistische Regression für Klassifikation
- Support Vector Machines
- Random Forests und Gradient Boosting
- Implementierung von Ensemble-Methoden
- Modellauswahl und Validierung
- K-Means Clustering
- Hierarchisches Clustering
- DBSCAN für Density-Based Clustering
- Gaussian Mixture Models
- Anomalie-Erkennung
- Evaluierung von Clustering-Ergebnissen
- Cross-Validation Strategien
- Grid Search und Random Search
- Hyperparameter-Optimierung
- Bias-Variance Trade-off
- Overfitting und Underfitting
- Model Selection mit scikit-learn
- Metriken für Klassifikation
- Metriken für Regression
- ROC und PR Kurven
- Confusion Matrix Analyse
- Feature Importance Analysis
- Cross-Validation Scores Interpretation
- Modell-Serialisierung
- Deployment-Strategien
- API-Entwicklung mit Flask
- Monitoring von ML-Modellen
- Wartung und Updates
- Performance-Optimierung