×
Register Here to Apply for Jobs or Post Jobs. X

Líder de Observabilidad y SER

Job in Lima, Allen County, Ohio, 45807, USA
Listing for: Stefanini-Latam
Full Time position
Listed on 2026-07-31
Job specializations:
  • IT/Tech
    SRE/Site Reliability
Salary/Wage Range or Industry Benchmark: 120000 - 180000 USD Yearly USD 120000.00 180000.00 YEAR
Job Description & How to Apply Below

En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co‑creando un futuro mejor.

Estrategia de observabilidad
  • Definir la estrategia corporativa de Observabilidad.
  • Diseñar y mantener el modelo de observabilidad tecnológica.
  • Establecer estándares para la gestión de:
  • Registros.
  • Eventos.
  • Definir lineamientos para la instrumentación de aplicaciones y plataformas.
  • Asegurar la visibilidad de servicios críticos, aplicaciones, APIs, infraestructura y componentes Cloud.
  • Establecer criterios de monitoreo para ambientes productivos y no productivos.
  • Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.
SRE y confiabilidad
  • Definir y gobernar prácticas de Ingeniería de Confiabilidad del Sitio.
  • Establecer SLI, SLO y Presupuestos de Error.
  • Definir objetivos de disponibilidad, rendimiento y confiabilidad.
  • Liderar la identificación y reducción de riesgos operativos.
  • Promover la automatización de tareas repetitivas y manuales.
  • Diseñar prácticas para mejorar la resiliencia de las aplicaciones.
  • Gestionar la capacidad, disponibilidad y rendimiento de los servicios.
  • Definir estándares para la operación de aplicaciones críticas.
  • Trabaje con los equipos de desarrollo para incorporar confiabilidad desde el diseño.
  • Impulsar la adopción de principios de ingeniería de confiabilidad en la organización.
Gestión de incidentes y problemas
  • Liderar la gestión técnica de incidentes críticos.
  • Coordinar la atención de incidentes de alto impacto.
  • Participar en el Manejo de Incidentes.
  • Gestionar postmortems sin enfoque punitivo.
  • Liderar el Manejo de Problemas Técnico.
  • Identificar problemas recurrentes y definir planes de eliminación.
  • Dar seguimiento a las acciones correctivas y preventivas.
  • Evaluar tendencias de incidentes, degradaciones y fallas.
  • Coordinador con Mesa de Ayuda, Operaciones, Desarrollo, Infraestructura, Cloud y proveedores.
  • Participar en el Emergency Change Gate.
  • Asegurar la documentación y trazabilidad de los incidentes relevantes.
Monitoreo y gestion de alertas
  • Diseñar y gobernar tableros operativos y ejecutivos.
  • Definir alertas inteligentes y accionables.
  • Reduzca el ruido y la duplicidad de alertas.
  • Establecer niveles de criticidad y prioridades.
  • Definir procedimientos de respuesta ante eventos.
  • Monitorear disponibilidad, latencia, errores, capacidad y rendimiento.
  • Implementar prácticas de monitoreo proactivo.
  • Promover el uso de automatización para detección y resolución.
  • Asegurar que las alertas estén vinculadas con procedimientos operativos claros.
Plataformas y herramientas
  • Liderar la evolución de las plataformas de observabilidad.
  • Definir estándares de uso para Dynatrace, Datadog, Grafana y Prometheus.
  • Promover la adopción de Open Telemetry.
  • Establecer criterios de gestión de logs mediante ELK, Splunk, Azure Monitor y Azure Log Analytics.
  • Integrar herramientas de observabilidad con plataformas Cloud, Kubernetes y Dev Ops.
  • Coordinador de instrumentación de aplicaciones y servicios.
  • Definir la estrategia de almacenamiento, retención y consulta de registros.
  • Evaluar nuevas herramientas y tecnologías de monitoreo.
  • Asegurar la interoperabilidad entre las diferentes herramientas de observabilidad.
Liderazgo y mejora continua
  • Liderar el equipo de Observabilidad y SRE.
  • Definir objetivos, prioridades y planes de trabajo del equipo.
  • Desarrollar capacidades técnicas y metodológicas.
  • Impulsar una cultura Dev Ops y SRE.
  • Promover la colaboración entre desarrollo, operaciones y soporte.
  • Establecer prácticas de mejora continua.
  • Presentar resultados, riesgos y oportunidades a la dirección.
  • Definir planos para mejorar la madurez de observabilidad y confiabilidad.
  • Identificar oportunidades de automatización y reducción de esfuerzo operativo.
Experiencia general
  • Más de 7 años de experiencia profesional en tecnología, operaciones, infraestructura, Cloud, Dev Ops, observabilidad o confiabilidad.
  • Experiencia en ambientes de alta criticidad y alta disponibilidad.
Experiencia específica
  • Más de 3 años liderando equipos o iniciativas SRE.
  • Experiencia comprobada en:
  • Alta disponibilidad.
  • Gestión de incidentes.
  • Gestión de problemas.
  • Análisis de la causa raíz.
  • Observabilidad.
  • Monitoreo de aplicaciones y…
To View & Apply for jobs on this site that accept applications from your location or country, tap the button below to make a Search.
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
 
 
 
Search for further Jobs Here:
(Try combinations for better Results! Or enter less keywords for broader Results)
Location
Increase/decrease your Search Radius (miles)
0
200
Filters
Education Level
Experience Level (years)
Posted in last:
Salary