Infrastructure Monitoring and Alerts verfolgt einen einzigartigen Ansatz: Über die üblichen DevOps-Basics hinaus erhalten Sie hier gezielte Kenntnisse zum Aufbau, Betrieb und zur Automatisierung hochverfügbarer Cloud Infrastructure-Monitoring-Lösungen mit AWS, Azure sowie Kubernetes und Docker. Im Mittelpunkt stehen Infrastructure as Code-Konzepte, insbesondere mit Terraform und Ansible, sowie GitOps-Steuerung, Serverless-Architekturen und Observability. Der Kurs unterscheidet sich deutlich durch die Integration von Monitoring-Spezialthemen wie Logging, Alerting, Metrik-Analysen, Cloud Security, Skalierung und automatisierten Störfall-Workflows, die speziell für Microservices, virtuelle Umgebungen und hybride Clouds entwickelt wurden. Python-basierte Automatisierung und Einführung in SRE-Prinzipien runden das Spektrum ab.

Grundlagen und Kernkonzepte
  • Wirkungsweise von Infrastructure Monitoring im DevOps-Kontext und Bedeutung für Cloud Engineering
  • Unterschiedliche Monitoring-Ansätze für VMs, Microservices und Serverless in verschiedenen Cloud Computing-Umgebungen
  • Einbettung von Infrastructure as Code-Prinzipien, z.B. mittels Terraform und Ansible, speziell für Monitoring-Setups
  • Wichtigkeit von Observability und Logging bei der Absicherung von Cloud Infrastructure und Cloud Security
  • Networking-Grundlagen zur fehlerfreien Anbindung von Überwachungs- und Logging-Lösungen
  • Core-Konzepte Continuous Integration und Continuous Deployment im Monitoring-Szenario
  • Rolle von Virtualization und Containerisierung (Docker, Kubernetes) für skalierbare Monitoring-Lösungen

Technische Implementierung und Praxis
  • Einrichten und Automatisieren von Alerts mit CI/CD, Jenkins, GitOps und modernen Monitoring-Frameworks
  • Anwendung cloudbasierter Tools (AWS CloudWatch, Azure Monitor) für Infrastructure Monitoring sowie automatisiertes Incident- und Alert-Handling per Python
  • Integration von SRE-Methoden zur Fehlerprävention in Cloud Infrastructure
  • Umsetzung von skalierbaren Logging- und Observability-Stacks in Kubernetes-Clustern mit Prometheus, Grafana, ELK
  • Automatisiertes Deployment und Selfhealing-Mechanismen für Monitoring und Security
  • Netzwerküberwachung und Anomaly Detection durch spezialisierte Tools in hybriden oder multi-cloud Umgebungen
  • Sicherheit und Compliance: Umsetzung von Cloud Security-Anforderungen im Monitoring-Design

Analyse, Interpretation und Validierung
  • Analyse und Visualisierung von Monitoring-Datenströmen, Dashboards und Alert-Logiken
  • Erkennung und Bewertung von Incidents, Trends und potenziellen Sicherheitslücken durch Monitoring-Daten
  • Validierung von Skalierungs- und Performance-Kriterien bei laufender Cloud Infrastructure
  • Logging-Musteranalyse und Fehlerdiagnose auf Cloud-, Netzwerk- und Applikationsebene
  • Auswertung von SRE-Metriken sowie Ableitung konkreter Optimierungsmaßnahmen
  • Dokumentation und Auditing von Alert-Regeln für Compliance und Revisionssicherheit