Aufbau fehlertoleranter Systeme legt den Fokus explizit auf die Kombination von DevOps mit hochverfügbaren Cloud Computing-Strukturen und gezieltem Einsatz von Tools wie Kubernetes, Docker, Terraform, und AWS/Azure. Anders als generische DevOps-Kurse steht hier die Entwicklung robuster, ausfallsicherer Architekturen im Mittelpunkt, unterstützt durch Infrastructure as Code und Automatisierung entlang der gesamten CI/CD-Pipeline. Besonderheiten bilden die spezielle Integration von Microservices, Monitoring, Observability und Cloud Security; Schnittstellen zu Serverless-Konzepten und modernes Logging werden anhand realer Produktionsumgebungen demonstriert. Die vermittelten Inhalte sichern nachhaltige Systemstabilität - von der ersten Konzeption über die Migration bis zur reibungslosen Skalierung komplexer Cloud Infrastructure.

Grundlagen und Kernkonzepte
  • Grundlagen DevOps, Cloud Computing sowie Methoden wie Infrastructure as Code und Automation
  • Vergleich AWS, Azure und Hybrid-Cloud-Lösungen für ausfallsichere Cloud Infrastructure
  • Kernunterschiede traditioneller IT-Infrastruktur zu modernen Cloud Engineering-Konzepten
  • Bedeutung von Cloud Security, Virtualization und Networking in DevOps-Umgebungen
  • Rolle von Linux, Containerization und Microservices für Ausfallsicherheit und Flexibilität
  • Einführung in Observability, Monitoring und Logging als Grundpfeiler fehlertoleranter Systeme
  • Bewertung verschiedener SRE-Modelle hinsichtlich Fehlerresistenz und Skalierbarkeit

Technische Implementierung und Praxis
  • Umsetzung mit Kubernetes, Docker, Terraform, Ansible und Jenkins speziell für Stabilität
  • Aufbau resilienter CI/CD-Prozesse - Continuous Integration, Continuous Deployment, GitOps
  • Automatisiertes Scaling, Serverless-Architekturen und Self-Healing-Mechanismen in Cloud Computing-Umgebungen
  • Integration effizienter Monitoring- und Logging-Strategien für frühzeitige Fehlererkennung
  • Maßnahmen zur Cloud Security und Absicherung produktiver Systeme im Betrieb
  • Anbindung an bestehende Netzwerke via Cloud Architecture und Virtualization
  • Typische Fehlerbilder, Netzwerkausfälle, Recovery-Strategien und Testing-Methoden

Analyse, Interpretation und Validierung
  • Logfile-Analyse, Alerting-Konfiguration und Auswertung von Monitoring-Daten
  • Bewertung der Belastbarkeit mittels Chaos Engineering, Failover- und Recovery-Tests
  • Analyse und Visualisierung von Verfügbarkeitsstatistiken und Clouddienst-Performance
  • Erstellung lückenloser Dokumentation zu Infrastructure as Code, Security und Compliance
  • Erkennung kritischer Incidents durch automatisierte Cloud Security-Analysen
  • Interpretation von Betriebsdaten mit Fokus auf kontinuierliche Verbesserungsmaßnahmen
  • Anwendung von Metriken zur Bewertung von SRE-Kennzahlen und Systemstabilität

Praxisprojekte, Fallstudien und Vertiefung
  • Eigenständige Entwicklung fehlertoleranter Systeme auf AWS und Azure
  • Umsetzung realistischer Microservices-Architekturen inklusive Networking und Cloud Security