NLP: Online mit Python

Kurzüberblick: Der Kurs richtet sich an Einsteiger:innen mit Grundkenntnissen in Python, die Texte systematisch analysieren wollen. Im Mittelpunkt stehen praxisnahe Schritte von der Datenbereinigung über die Merkmalsextraktion bis zur Modellierung. Behandelt werden grundlegende Konzepte von NLP (Natural Language Processing) und deren Umsetzung in Python-Workflows. Teilnehmende lernen, typische Aufgaben wie Klassifikation, Sentimentanalyse und Informationsextraktion zuverlässig zu planen und umzusetzen. Begriffe werden verständlich erklärt, etwa Tokenisierung (Zerlegung von Text in Einheiten), Lemmatisierung (Rückführung aufs Grundwort) und TF-IDF (Termgewichtung). Ziel ist eine solide Basis, um NLP reproduzierbar in Projekten anzuwenden.

Inhaltsübersicht1. Textgrundlagen - Vorverarbeitung und Qualitätssicherung2. NLP - Repräsentation und Merkmalsextraktion3. Modellierung - Klassifikation und Evaluation4. NLP - Anwendungsszenarien und Pipeline-Design
1. Datengrundlage und Vorverarbeitung
  • Textquellen sammeln, Formate vereinheitlichen (CSV, JSON)
  • Bereinigung: Duplikate, Zeichensätze, Sonderzeichen
  • Tokenisierung, Stoppwörter, Lemmatisierung vs. Stemming

2. NLP - Merkmale und Vektorisierung
  • Bag-of-Words und TF-IDF (Term Frequency-Inverse Document Frequency) erklären und anwenden
  • Wort- und Satz-Embeddings (z. B. Word2Vec, Sentence-Vektoren) zweckmäßig einsetzen
  • Feature-Auswahl: N-Gramme, Dokumentlänge, einfache Linguistik-Merkmale

3. Modellierung und Bewertung
  • Basismodelle: Logistische Regression, Naive Bayes, lineare SVM
  • Train/Validation-Split, Kreuzvalidierung, Metriken (Accuracy, Precision, Recall, F1)
  • Fehleranalyse und robuste Baselines definieren

4. NLP - Anwendungsdesign mit Python
  • Pipelines in Python strukturieren: Datenaufnahme→Vorverarbeitung→Modell→Ausgabe
  • Anwendungsfälle: Sentiment, Themenzuordnung, Schlagwort-Extraktion
  • Reproduzierbarkeit durch Skripte, Versionierung und Konfiguration