LLM Evaluation für technische Produkte umfasst eine Reihe spezialisierter Aufgaben, weil Sprachmodelle anders bewertet werden müssen als klassische Software. Wer methodisch evaluiert, schafft eine belastbare Grundlage für Releases. Der Kurs vermittelt den strukturierten Aufbau eines Evaluationssetups.

!Kursinhalt

!1. Bewertungsdimensionen für LLMs
*Korrektheit, Konsistenz und Sicherheit
*Aufgabenspezifische Qualität
*Kosten und Latenz

!2. Aufbau eines Evaluationskatalogs
*Repräsentative Aufgaben
*Anteil sicherheitsrelevanter Tests
*Versionierung der Aufgaben

!3. Bewertungsverfahren
*Manuelle Bewertung mit Leitfaden
*Automatisierte Bewertung über Hilfsmodelle
*Vergleich mehrerer Modelle

!4. Verzahnung mit Produktentwicklung
*Bewertungen als Releasekriterium
*Iteration anhand von Ergebnissen
*Verbindung zur Produktroadmap

!Berufliche Relevanz

*Belastbare Grundlage für Modell- und Promptauswahl
*Reduktion von Risiken in produktiven Anwendungen
*Profilierung im wachsenden Feld der LLM-Bewertung