Aufbau fehlertoleranter Systeme legt den Fokus explizit auf die Kombination von DevOps mit hochverfügbaren Cloud Computing-Strukturen und gezieltem Einsatz von Tools wie Kubernetes, Docker, Terraform, und AWS/Azure. Anders als generische DevOps-Kurse steht hier die Entwicklung robuster, ausfallsicherer Architekturen im Mittelpunkt, unterstützt durch Infrastructure as Code und Automatisierung entlang der gesamten CI/CD-Pipeline. Besonderheiten bilden die spezielle Integration von Microservices, Monitoring, Observability und Cloud Security; Schnittstellen zu Serverless-Konzepten und modernes Logging werden anhand realer Produktionsumgebungen demonstriert. Die vermittelten Inhalte sichern nachhaltige Systemstabilität - von der ersten Konzeption über die Migration bis zur reibungslosen Skalierung komplexer Cloud Infrastructure.
Grundlagen und Kernkonzepte- Grundlagen DevOps, Cloud Computing sowie Methoden wie Infrastructure as Code und Automation
- Vergleich AWS, Azure und Hybrid-Cloud-Lösungen für ausfallsichere Cloud Infrastructure
- Kernunterschiede traditioneller IT-Infrastruktur zu modernen Cloud Engineering-Konzepten
- Bedeutung von Cloud Security, Virtualization und Networking in DevOps-Umgebungen
- Rolle von Linux, Containerization und Microservices für Ausfallsicherheit und Flexibilität
- Einführung in Observability, Monitoring und Logging als Grundpfeiler fehlertoleranter Systeme
- Bewertung verschiedener SRE-Modelle hinsichtlich Fehlerresistenz und Skalierbarkeit
Technische Implementierung und Praxis
- Umsetzung mit Kubernetes, Docker, Terraform, Ansible und Jenkins speziell für Stabilität
- Aufbau resilienter CI/CD-Prozesse - Continuous Integration, Continuous Deployment, GitOps
- Automatisiertes Scaling, Serverless-Architekturen und Self-Healing-Mechanismen in Cloud Computing-Umgebungen
- Integration effizienter Monitoring- und Logging-Strategien für frühzeitige Fehlererkennung
- Maßnahmen zur Cloud Security und Absicherung produktiver Systeme im Betrieb
- Anbindung an bestehende Netzwerke via Cloud Architecture und Virtualization
- Typische Fehlerbilder, Netzwerkausfälle, Recovery-Strategien und Testing-Methoden
Analyse, Interpretation und Validierung
- Logfile-Analyse, Alerting-Konfiguration und Auswertung von Monitoring-Daten
- Bewertung der Belastbarkeit mittels Chaos Engineering, Failover- und Recovery-Tests
- Analyse und Visualisierung von Verfügbarkeitsstatistiken und Clouddienst-Performance
- Erstellung lückenloser Dokumentation zu Infrastructure as Code, Security und Compliance
- Erkennung kritischer Incidents durch automatisierte Cloud Security-Analysen
- Interpretation von Betriebsdaten mit Fokus auf kontinuierliche Verbesserungsmaßnahmen
- Anwendung von Metriken zur Bewertung von SRE-Kennzahlen und Systemstabilität
Praxisprojekte, Fallstudien und Vertiefung
- Eigenständige Entwicklung fehlertoleranter Systeme auf AWS und Azure
- Umsetzung realistischer Microservices-Architekturen inklusive Networking und Cloud Security