More jobs:
Líder de Observabilidad y SER
Job in
Lima, Allen County, Ohio, 45807, USA
Listed on 2026-07-31
Listing for:
Stefanini-Latam
Full Time
position Listed on 2026-07-31
Job specializations:
-
IT/Tech
SRE/Site Reliability
Job Description & How to Apply Below
En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co‑creando un futuro mejor.
Estrategia de observabilidad- Definir la estrategia corporativa de Observabilidad.
- Diseñar y mantener el modelo de observabilidad tecnológica.
- Establecer estándares para la gestión de:
- Registros.
- Eventos.
- Definir lineamientos para la instrumentación de aplicaciones y plataformas.
- Asegurar la visibilidad de servicios críticos, aplicaciones, APIs, infraestructura y componentes Cloud.
- Establecer criterios de monitoreo para ambientes productivos y no productivos.
- Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.
- Definir y gobernar prácticas de Ingeniería de Confiabilidad del Sitio.
- Establecer SLI, SLO y Presupuestos de Error.
- Definir objetivos de disponibilidad, rendimiento y confiabilidad.
- Liderar la identificación y reducción de riesgos operativos.
- Promover la automatización de tareas repetitivas y manuales.
- Diseñar prácticas para mejorar la resiliencia de las aplicaciones.
- Gestionar la capacidad, disponibilidad y rendimiento de los servicios.
- Definir estándares para la operación de aplicaciones críticas.
- Trabaje con los equipos de desarrollo para incorporar confiabilidad desde el diseño.
- Impulsar la adopción de principios de ingeniería de confiabilidad en la organización.
- Liderar la gestión técnica de incidentes críticos.
- Coordinar la atención de incidentes de alto impacto.
- Participar en el Manejo de Incidentes.
- Gestionar postmortems sin enfoque punitivo.
- Liderar el Manejo de Problemas Técnico.
- Identificar problemas recurrentes y definir planes de eliminación.
- Dar seguimiento a las acciones correctivas y preventivas.
- Evaluar tendencias de incidentes, degradaciones y fallas.
- Coordinador con Mesa de Ayuda, Operaciones, Desarrollo, Infraestructura, Cloud y proveedores.
- Participar en el Emergency Change Gate.
- Asegurar la documentación y trazabilidad de los incidentes relevantes.
- Diseñar y gobernar tableros operativos y ejecutivos.
- Definir alertas inteligentes y accionables.
- Reduzca el ruido y la duplicidad de alertas.
- Establecer niveles de criticidad y prioridades.
- Definir procedimientos de respuesta ante eventos.
- Monitorear disponibilidad, latencia, errores, capacidad y rendimiento.
- Implementar prácticas de monitoreo proactivo.
- Promover el uso de automatización para detección y resolución.
- Asegurar que las alertas estén vinculadas con procedimientos operativos claros.
- Liderar la evolución de las plataformas de observabilidad.
- Definir estándares de uso para Dynatrace, Datadog, Grafana y Prometheus.
- Promover la adopción de Open Telemetry.
- Establecer criterios de gestión de logs mediante ELK, Splunk, Azure Monitor y Azure Log Analytics.
- Integrar herramientas de observabilidad con plataformas Cloud, Kubernetes y Dev Ops.
- Coordinador de instrumentación de aplicaciones y servicios.
- Definir la estrategia de almacenamiento, retención y consulta de registros.
- Evaluar nuevas herramientas y tecnologías de monitoreo.
- Asegurar la interoperabilidad entre las diferentes herramientas de observabilidad.
- Liderar el equipo de Observabilidad y SRE.
- Definir objetivos, prioridades y planes de trabajo del equipo.
- Desarrollar capacidades técnicas y metodológicas.
- Impulsar una cultura Dev Ops y SRE.
- Promover la colaboración entre desarrollo, operaciones y soporte.
- Establecer prácticas de mejora continua.
- Presentar resultados, riesgos y oportunidades a la dirección.
- Definir planos para mejorar la madurez de observabilidad y confiabilidad.
- Identificar oportunidades de automatización y reducción de esfuerzo operativo.
- Más de 7 años de experiencia profesional en tecnología, operaciones, infraestructura, Cloud, Dev Ops, observabilidad o confiabilidad.
- Experiencia en ambientes de alta criticidad y alta disponibilidad.
- Más de 3 años liderando equipos o iniciativas SRE.
- Experiencia comprobada en:
- Alta disponibilidad.
- Gestión de incidentes.
- Gestión de problemas.
- Análisis de la causa raíz.
- Observabilidad.
- Monitoreo de aplicaciones y…
To View & Apply for jobs on this site that accept applications from your location or country, tap the button below to make a Search.
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
Search for further Jobs Here:
×