SRE (Site Reliability Engineer
Job in
Agawam, Hampden County, Massachusetts, 01001, USA
Listed on 2026-08-08
Listing for:
Babel
Full Time
position Listed on 2026-08-08
Job specializations:
-
IT/Tech
SRE/Site Reliability, Cloud Computing: Infrastructure & Operations, Unix/Linux
Job Description & How to Apply Below
Site Reliability Engineering (SRE) Leader
Liderar la estrategia de Site Reliability Engineering (SRE) para las aplicaciones de Centroamérica, garantizando altos niveles de disponibilidad, confiabilidad, rendimiento y eficiencia operativa, con especial enfoque en las aplicaciones Next Gen desplegadas en WCNP.
Este rol impulsará la adopción de prácticas Dev Ops, SRE y Fin Ops, promoviendo la automatización, la observabilidad, la gestión proactiva de incidentes y la optimización de costos en la nube, asegurando plataformas estables, escalables y alineadas con los objetivos del negocio.
Responsabilidades
- Definir, implementar y monitorear SLOs, SLIs y Error Budgets para servicios críticos.
- Diseñar y mantener la estrategia de observabilidad mediante métricas, logs, dashboards y alertas.
- Monitorear la disponibilidad, rendimiento y estabilidad de las aplicaciones desplegadas en WCNP.
- Liderar iniciativas de Fin Ops para optimizar el consumo y costos de la nube.
- Apoyar la migración, incorporación y estabilización de aplicaciones en entornos Kubernetes.
- Garantizar la confiabilidad de los despliegues mediante pipelines de CI/CD y procesos automatizados.
- Automatizar tareas operativas utilizando Python, Bash, Ansible u otras herramientas para reducir el trabajo manual (toil).
- Liderar la atención de incidentes críticos, realizar análisis de causa raíz (RCA) y asegurar la implementación de acciones correctivas y preventivas.
- Definir y dar seguimiento a indicadores como MTTR, disponibilidad, métricas DORA y recurrencia de incidentes.
- Promover buenas prácticas de SRE, Dev Ops y Observabilidad, brindando acompañamiento técnico al equipo.
Tech Stack
Indispensable
- Kubernetes y tecnologías de contenedores.
- WCNP o plataformas basadas en Kubernetes.
- Grafana, Prometheus y herramientas de observabilidad.
- Herramientas de gestión y análisis de logs.
- Python y/o Bash.
- Concord, Looper o herramientas equivalentes de CI/CD.
- Azure y/o Google Cloud Platform (GCP).
- Git.
- SLOs, SLIs, Error Budgets, gestión de incidentes y RCA.
- Herramientas de IA aplicadas a operaciones, análisis de logs y automatización.
Deseable
- Terraform.
- Ansible.
- Open Telemetry.
- Herramientas de Fin Ops.
- Plataformas de trazabilidad distribuida.
- Métricas DORA.
- Chaos Engineering y pruebas de resiliencia.
Requisitos
- Bachillerato universitario en Ingeniería en Sistemas, Computación o carreras afines.
- Inglés fluido (B2+/C1), con capacidad para participar en reuniones técnicas, colaborar con equipos globales y comprender documentación especializada.
- 5 años o más de experiencia en infraestructura, operaciones, Dev Ops, Cloud o confiabilidad de aplicaciones.
- 3 años o más de experiencia en roles de Site Reliability Engineering (SRE), Dev Ops, Platform Engineering o Cloud Engineering.
- Experiencia comprobada con Kubernetes y tecnologías de contenedores.
- Experiencia implementando soluciones de observabilidad, monitoreo y alertamiento.
- Experiencia con automatización y gestión de pipelines CI/CD.
- Experiencia en gestión de incidentes críticos, análisis de causa raíz (RCA) y mejora continua.
- Deseable experiencia en iniciativas de Fin Ops y optimización de costos en la nube.
To View & Apply for jobs on this site that accept applications from your location or country, tap the button below to make a Search.
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
Search for further Jobs Here:
×