Site Reliability Engineer; SRE) München; m/w/d
Verfasst am 2026-09-17
-
IT/Informationstechnik
Systemingenieur, Cloud Computing: IT-Infrastruktur & Betrieb, Site Reliability Ingenieur/in, IT Projekt Manager
Als Site Reliability Engineer bei ventx arbeiten Sie an der Schnittstelle zwischen Entwicklung und Betrieb. Sie verantworten die Zuverlässigkeit, Skalierbarkeit und Performance unserer Kundeninfrastrukturen, die auf Kubernetes und Public Cloud Plattformen basieren.
Ihre Kernaufgaben umfassen den Aufbau und die Automatisierung von Monitoring-Lösungen, die Implementierung von Infrastructure-as-Code-Ansätzen sowie die kontinuierliche Verbesserung von CI/CD-Pipelines. Sie analysieren Störungen, entwickeln Lösungen zur Vermeidung von Wiederholungen und arbeiten eng mit den Entwicklungsteams zusammen.
Wir suchen einen Kandidaten, der bereits Erfahrung im Betrieb von verteilten Systemen mitbringt und Scrum-Methoden anwenden kann. Die Position erfordert Hands-on-Mentalität sowie die Fähigkeit, komplexe technische Sachverhalte verständlich zu kommunizieren.
DeineAufgaben
- Entwicklung und Wartung von Monitoring- und Alerting-Systemen zur Sicherstellung der Systemverfügbarkeit
- Automatisierung von Infrastrukturprozessen mittels Infrastructure as Code
- Betrieb und Optimierung von Kubernetes-Clustern in Cloud-Umgebungen
- Analyse und Behebung von Incidents einschließlich Post-Mortem-Dokumentation
- Implementierung von Backup- und Disaster-Recovery-Strategien
- Zusammenarbeit mit Entwicklungsteams zur Verbesserung der Deployments und Release-Prozesse
- Erstellung und Pflege von Runbooks sowie technischer Dokumentation
- Mindestens 3 Jahre Berufserfahrung als SRE, Dev Ops Engineer oder in vergleichbarer Rolle
- Erfahrung mit Infrastructure as Code (Terraform, Ansible oder Pulumi)
- Fundierte Kenntnisse in Kubernetes (EKS, GKE oder AKS)
- Erfahrung mit Monitoring-Lösungen wie Prometheus, Grafana oder Datadog
- Praktische Erfahrung mit mindestens einer Public Cloud Plattform (AWS, Azure oder GCP)
- Erfahrung mit Git-basierten Workflows und CI/CD-Pipelines (Git Lab CI, Git Hub Actions oder Jenkins)
- Sehr gute Deutschkenntnisse in Wort und Schrift
- Gute Englischkenntnisse in Wort und Schrift
- Zertifizierungen wie CKA, CKAD, AWS Solutions Architect oder Azure Administrator
- Erfahrung mit Service Mesh (Istio, Linkerd oder Consul Connect)
- Kenntnisse in Programmiersprachen wie Python, Go oder Bash-Scripting
- Erfahrung mit Container-Sicherheitstools (Trivy, Falco oder Aqua Security)
- Kenntnisse von Chaos Engineering (Gremlin, Litmus oder Chaos Monkey)
- Erfahrung mit Log-Aggregation (ELK Stack, Loki oder Splunk)
- Kostenlose Kantine
- Kostenlose Getränke
- Essenszuschuss und Snacks
- Massagen
- Zuschuss zu Mitarbeiteraktivitäten
- Wunschhardware
- Hervorragende Arbeitsplatzausstattung
- Chill-Out Area
- Wasch- und Bügelservice
- Dusche
Hybrides Arbeiten: bis zu 50% Remote, der Rest vor Ort.
(Wenn dieser Job tatsächlich in Ihrem Zuständigkeitsbereich liegt, verwenden Sie möglicherweise einen Proxy oder VPN, um auf diese Seite zuzugreifen. Um weiterzukommen, sollten Sie Ihre Verbindung zu einem anderen Mobilgerät oder PC wechseln).