×
Hier anmelden um sich kostenlos auf Stellen zu bewerben oder Stellenanzeigen aufzugeben. X

Team Lead - Site Reliability Engineering (all genders

in 10115, Berlin, Berlin, Deutschland
Unternehmen: United States Digital Space LLC
Vollzeit position
Verfasst am 2026-08-16
Berufliche Spezialisierung:
  • IT/Informationstechnik
    Cloud Computing: IT-Infrastruktur & Betrieb, Systemingenieur, Site Reliability Ingenieur/in
Gehalts-/Lohnspanne oder Branchenbenchmark: 110000 - 160000 EUR pro Jahr EUR 110000.00 160000.00 YEAR
Stellenbeschreibung
Stellenbezeichnung: Team Lead - Site Reliability Engineering (all genders)

IntroductionFACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Aktuell modernisieren wir unser Hosting konsequent in Richtung Kubernetes auf Harvester – als on-prem Hybrid mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Team Lead Site Reliability Engineering (all genders) verantwortest du Reliability, Skalierbarkeit und Kosten unserer Hosting-Umgebungen, treibst diese Transformation end-to-end voran und führst das Team, das sie umsetzt.

Deine Aufgaben Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management. Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran:
Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery. Du baust eine produktionsreife k8s-Plattform auf:
Lifecycle, Upgrades, RBAC, Secrets, Git Ops (Argo CD / Flux), Observability und Policy-Guardrails. Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur. Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt.

Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel. Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur. Du machst AI zum festen Bestandteil unserer Operations:
Diagnose, Automatisierung, Monitoring und Insight.

Deine

Aufgaben
  • Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management.
  • Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran:
    Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery.
  • Du baust eine produktionsreife k8s-Plattform auf:
    Lifecycle, Upgrades, RBAC, Secrets, Git Ops (Argo CD / Flux), Observability und Policy-Guardrails.
  • Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur.
  • Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt.
  • Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel.
  • Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur.
  • Du machst AI zum festen Bestandteil unserer Operations:
    Diagnose, Automatisierung, Monitoring und Insight.
Dein Profil
  • Fundierter Hintergrund in Infrastructure oder Platform Engineering über On-Premise und Cloud hinweg.
  • Hands-on Tiefe mit Kubernetes in Produktion:
    Cluster-Lifecycle, Upgrades, Networking, Storage, RBAC, Observability, Git Ops-Delivery.
  • Nachweislich starke Führungserfahrung, exzellente Kommunikation und Stakeholder-Management.
  • Idealerweise praktische Erfahrung mit Harvester oder vergleichbaren HCI-/Virtualisierungsplattformen (Kube Virt, vSphere/ESXi, Open Stack).
  • Erfahrung mit einer echten Migration von Bare Metal / klassischen VMs auf eine k8s-basierte Plattform – inklusive stateful Workloads, Storage-Migration, Cutover und Rollback.
  • Sicherer Umgang mit Kubernetes Operators (Custom Controllers / CRDs), idealerweise für stateful Systeme wie Search, Datenbanken oder Streaming.
  • Solides Verständnis von Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und deren Zusammenspiel mit Kapazitätsplanung.
  • Erfahrung mit On-Prem-Hybrid-Architekturen und…
Bitte beachten Sie, dass derzeit keine Bewerbungen aus Ihrem Zuständigkeitsbereich für diese Stelle über diese Jobseite akzeptiert werden. Die Präferenzen der Kandidaten liegen im Ermessen des Arbeitgebers oder des Personalvermittlers und werden ausschließlich von diesen bestimmt.
Um nach Stellen zu suchen, sie anzusehen und sich zu bewerben, die Bewerbungen aus Ihrem Standort oder Land akzeptieren, klicken Sie hier, um eine Suche zu starten:
 
 
 
Suchen Sie hier nach weiteren Stellen:
(nach Beruf, Fähigkeit)
Standort
Suchradius erweitern (Meilen)
0
200
Filter
Mindest-Bildungsgrad für die Stelle
Mindest-Berufserfahrung für die Stelle
Veröffentlicht in den letzten:
Gehalt