System Engineer/Site Reliability Engineer; m/w/d
Verfasst am 2026-09-14
-
IT/Informationstechnik
Systemingenieur, Cloud Computing: IT-Infrastruktur & Betrieb, Site Reliability Ingenieur/in
Location: Aschheim
Du bist interessiert an der Stelle als System Engineer/Site Reliability Engineer (m/w/d) bei Atruvia AG
?
Bitte beachte, dass für diese Stelle eine Arbeitserlaubnis für Deutschland erforderlich ist.
Sprache:
Deutsch
- Fließend (C1), Englisch
- Konversationssicher (B1-B2)
- Du hast ein abgeschlossenes Studium der Informatik sowie mehrjährige einschlägige Berufserfahrung oder eine vergleichbare Qualifikation.
- Du besitzt praktische Erfahrung im stabilen Betrieb, in der Skalierung und in der Fehleranalyse produktionskritischer Anwendungen.
- Du bringst fundierte Kenntnisse in SRE-/Dev Ops-Methoden, Observability, Monitoring, Incident Response, SLIs, SLOs, Error Budgets und Toil Reduction mit und hast Erfahrung in der Zusammenarbeit mit agilen Entwicklungsteams.
- Du hast praktische Erfahrung mit Google Cloud Platform und Google Kubernetes Engine oder bringst fundierte Erfahrung mit Kubernetes in produktionskritischen Cloud-Umgebungen mit.
- Du verfügst über Kenntnisse in Automatisierung, Infrastructure as Code und Script- oder Programmiersprachen wie Bash, Python, Go, Node.js oder vergleichbaren Technologien sowie über Erfahrung mit Git.
- Du kannst Entwicklungsteams methodisch und technisch beraten, komplexe Zusammenhänge verständlich erklären und auch in kritischen Situationen strukturiert handeln.
- Du verstehst SRE nicht nur als Tooling- oder Betriebsrolle, sondern als Ansatz, um Entwicklungsteams zu befähigen und Services nachhaltig zuverlässiger zu machen.
- Du zeichnest dich durch Teamfähigkeit, analytisches Denken, Kommunikationsstärke, Eigeninitiative und eine selbständige Arbeitsweise aus.
- Du bist für die Einführung und Weiterentwicklung von SRE-/Dev Ops-Praktiken verantwortlich und berätst Entwicklungsteams auf dem Weg zu stabilen, produktionsreifen Services.
- Du stellst die Systemstabilität durch Observability, Monitoring, Alerting und Kapazitätsbetrachtungen sicher, z.
B. mit Prometheus, Grafana oder Dynatrace. - Du unterstützt den zuverlässigen Betrieb cloudnativer Anwendungen auf Kubernetes, insbesondere im Umfeld von Google Cloud Platform und Google Kubernetes Engine.
- Du analysierst Störungen im 2nd-/3rd-Level-Support, unterstützt die Incident Response und etablierst gemeinsam mit dem Team blameless Post-Mortem-Analysen, um systematisch aus Incidents zu lernen und nachhaltige Verbesserungen abzuleiten.
- Du arbeitest mit dem Team an der Optimierung von Betriebsprozessen, Runbooks, Automatisierungen und Standards zur Reduktion von Toil sowie zur Steigerung von Verfügbarkeit und Kundenzufriedenheit.
- Du berücksichtigst betriebliche Security- und Compliance-Anforderungen im Rahmen von Production Readiness, Zugriffen, Runbooks und Incident-Prozessen.
Atruvia ist stolz darauf, Teil der Genossenschaftlichen Finanz Gruppe zu sein. Diese Zugehörigkeit unterscheidet den Digitalisierungspartner klar von anderen Unternehmen. Denn in einer Genossenschaft zählt jede Stimme. Alle tragen Verantwortung. Dafür braucht es ein stabiles Wertefundament.
Bei Atruvia bedeutet das: füreinander da sein, offen, respektvoll und ehrlich miteinander umgehen, eigenverantwortlich handeln und ergebnisorientierte Entscheidungen treffen.
Über das UnternehmenWir sind der Digitalisierungspartner in der Genossenschaftlichen Finanz Gruppe. Mit Banking und Informationstechnologie kennen wir uns bestens aus. Unsere speziell auf Banken zugeschnittenen IT-Lösungen und
-Leistungen reichen vom Rechenzentrumsbetrieb über unser Bankverfahren bis hin zur App-Entwicklung. Dabei nutzen wir zukunftsweisende Technologien wie Smart Data und schreiben Prozessoptimierung und Regulatorik groß.
(Wenn dieser Job tatsächlich in Ihrem Zuständigkeitsbereich liegt, verwenden Sie möglicherweise einen Proxy oder VPN, um auf diese Seite zuzugreifen. Um weiterzukommen, sollten Sie Ihre Verbindung zu einem anderen Mobilgerät oder PC wechseln).