Team Lead - Site Reliability Engineering (all genders
Verfasst am 2026-08-16
-
IT/Informationstechnik
Cloud Computing: IT-Infrastruktur & Betrieb, Systemingenieur, Site Reliability Ingenieur/in
IntroductionFACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Aktuell modernisieren wir unser Hosting konsequent in Richtung Kubernetes auf Harvester – als on-prem Hybrid mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Team Lead Site Reliability Engineering (all genders) verantwortest du Reliability, Skalierbarkeit und Kosten unserer Hosting-Umgebungen, treibst diese Transformation end-to-end voran und führst das Team, das sie umsetzt.
Deine Aufgaben Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management. Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran:
Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery. Du baust eine produktionsreife k8s-Plattform auf:
Lifecycle, Upgrades, RBAC, Secrets, Git Ops (Argo CD / Flux), Observability und Policy-Guardrails. Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur. Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt.
Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel. Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur. Du machst AI zum festen Bestandteil unserer Operations:
Diagnose, Automatisierung, Monitoring und Insight.
Aufgaben
- Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management.
- Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran:
Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery. - Du baust eine produktionsreife k8s-Plattform auf:
Lifecycle, Upgrades, RBAC, Secrets, Git Ops (Argo CD / Flux), Observability und Policy-Guardrails. - Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur.
- Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt.
- Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel.
- Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur.
- Du machst AI zum festen Bestandteil unserer Operations:
Diagnose, Automatisierung, Monitoring und Insight.
- Fundierter Hintergrund in Infrastructure oder Platform Engineering über On-Premise und Cloud hinweg.
- Hands-on Tiefe mit Kubernetes in Produktion:
Cluster-Lifecycle, Upgrades, Networking, Storage, RBAC, Observability, Git Ops-Delivery. - Nachweislich starke Führungserfahrung, exzellente Kommunikation und Stakeholder-Management.
- Idealerweise praktische Erfahrung mit Harvester oder vergleichbaren HCI-/Virtualisierungsplattformen (Kube Virt, vSphere/ESXi, Open Stack).
- Erfahrung mit einer echten Migration von Bare Metal / klassischen VMs auf eine k8s-basierte Plattform – inklusive stateful Workloads, Storage-Migration, Cutover und Rollback.
- Sicherer Umgang mit Kubernetes Operators (Custom Controllers / CRDs), idealerweise für stateful Systeme wie Search, Datenbanken oder Streaming.
- Solides Verständnis von Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und deren Zusammenspiel mit Kapazitätsplanung.
- Erfahrung mit On-Prem-Hybrid-Architekturen und…
Um nach Stellen zu suchen, sie anzusehen und sich zu bewerben, die Bewerbungen aus Ihrem Standort oder Land akzeptieren, klicken Sie hier, um eine Suche zu starten: