Performance Tuning für Inferenzsysteme entscheidet zunehmend über Kosten und Wirksamkeit produktiver KI-Anwendungen. Wer hier methodisch vorgeht, kann erhebliche Einsparungen erzielen, ohne die Qualität zu gefährden. Der Kurs zeigt zentrale Hebel für effizientes Tuning.
!Kursinhalt
!1. Analyse der Ausgangssituation
*Latenz, Durchsatz und Kosten
*Profil typischer Anfragen
*Engpässe in der Architektur
!2. Optimierung des Modells selbst
*Quantisierung und Distillation
*Spezialisiertere Modellvarianten
*Pruning und Komprimierung
!3. Optimierung des Inferenzdienstes
*Batchgrößen und Caching
*Auswahl geeigneter Hardware
*Parallelisierung
!4. Beobachtung und Iteration
*Lasttests und Vergleich von Varianten
*Messung der Auswirkungen auf Qualität
*Verzahnung mit Releaseprozessen
!Berufliche Relevanz
*Wirtschaftlicher Betrieb stark genutzter ML-Dienste
*Bessere Reaktionszeiten für Nutzer:innen
*Profilierung in der Schnittstelle ML und Plattform