×
Register Here to Apply for Jobs or Post Jobs. X

Site Reliability Expert

Job in Montreal, Montréal, Province de Québec, Canada
Listing for: Valtech
Full Time position
Listed on 2026-09-04
Job specializations:
  • IT/Tech
    Cloud Computing: Infrastructure & Operations, SRE/Site Reliability, IT Support, Systems Engineer
Salary/Wage Range or Industry Benchmark: 120000 - 170000 CAD Yearly CAD 120000.00 170000.00 YEAR
Job Description & How to Apply Below
Location: Montreal

Opportunité À Valtech, vous trouverez un environnement propice à l'apprentissage continu, à l'impact concret et à la croissance professionnelle. Que vous développiez de nouvelles solutions digitales, remettiez en question les idées reçues ou construisiez la prochaine génération d'expériences client, votre travail contribuera à transformer les secteurs d'activité.

Nous sommes fiers de:
Notre travail et l'innovation que nous encourageons. Nos valeurs: "share, dare, care". Une culture d'entreprise qui favorise la créativité, la diversité et l'autonomie. Notre structure mondiale sans frontières, qui permet une collaboration fluide. La maîtrise de l'anglais est requise, car le rôle implique des communications régulières avec des clients et des collègues situés à l'extérieur du Québec.

À propos du poste

Nous recherchons un(e) Expert(e) en Fiabilité des Sites (SRE) expérimenté(e) pour piloter les initiatives d'observabilité, de fiabilité et d'excellence opérationnelle au sein d'environnements cloud natifs complexes. Ce rôle va bien au-delà de l'administration d'une plateforme d'observabilité et nécessite une solide expertise en Site Reliability Engineering (SRE), combinée à une expérience approfondie des opérations en production, de l'automatisation et des pratiques de fiabilité à grande échelle.

La personne idéale possède une expertise technique reconnue, est capable de définir des standards d'observabilité, d'accompagner les équipes produit et d'améliorer continuellement la fiabilité et la performance des plateformes.

Responsabilités principales
  • Définir et mettre en œuvre la stratégie d'observabilité ainsi que les standards et modèles de gouvernance associés.
  • Concevoir, déployer et maintenir les solutions de surveillance, d'alerte et de visualisation à l'aide de Dynatrace ou d'outils équivalents.
  • Mettre en place et promouvoir les meilleures pratiques SRE, notamment les SLI, SLO, Error Budgets et les mécanismes d'alerte basés sur les symptômes.
  • Collaborer avec les équipes de développement et de produit afin d'améliorer la fiabilité, la performance et la résilience des systèmes.
  • Définir les standards liés au tagging, à la gouvernance, à l'attribution des responsabilités, aux tableaux de bord et à la gestion des alertes.
  • Accompagner et former les équipes n'ayant pas d'expertise spécifique en observabilité.
  • Piloter des chantiers techniques, gérer les priorités et assurer la livraison des travaux dans les délais et budgets définis.
  • Analyser et résoudre des incidents complexes dans des architectures distribuées basées sur des microservices.
  • Promouvoir une culture d'amélioration continue, de documentation et d'excellence opérationnelle.
  • Collaborer efficacement avec des équipes distribuées dans un contexte international.
Qualifications requises
  • Site Reliability Engineering et Observabilité
  • Expérience significative en Site Reliability Engineering (SRE) dans des environnements de production complexes.
  • Solide maîtrise des concepts suivants :
    Service Level Indicators (SLI), Service Level Objectives (SLO), Error Budgets, Alerting basé sur les symptômes.
  • Expertise démontrée avec une plateforme d'observabilité telle que :
    Dynatrace, Datadog, New Relic, App Dynamics.
  • Expérience pratique avec :
    Application Performance Monitoring (APM), Real User Monitoring (RUM), Instrumentation et agents de monitoring, Gestion des alertes, Contrôle d'accès basé sur les rôles (RBAC), Gestion des SLO, Gouvernance et standards de tagging.
  • Cloud et systèmes distribués:
    Bonne connaissance d'Open Telemetry (OTEL) et du traçage distribué. Expérience dans des architectures composables basées sur des microservices. Expérience pratique en environnement de production avec : AWS, Kubernetes.
  • Automatisation et Dev Ops:
    Expérience en automatisation d'infrastructure et d'opérations. Maîtrise de :
    Terraform, Bash, Python. Expérience avec Git Lab CI ou tout autre outil de gestion de pipelines et workflows CI/CD.
  • Leadership et collaboration:
    Capacité démontrée à diriger un chantier technique de bout en bout. Expérience dans des environnements opérationnels et Agile complexes. Excellentes compétences en communication en français et en anglais, à l'oral comme à…
Note that applications are not being accepted from your jurisdiction for this job currently via this jobsite. Candidate preferences are the decision of the Employer or Recruiting Agent, and are controlled by them alone.
To Search, View & Apply for jobs on this site that accept applications from your location or country, tap here to make a Search:
 
 
 
Search for further Jobs Here:
(Try combinations for better Results! Or enter less keywords for broader Results)
Location
Increase/decrease your Search Radius (miles)
0
200
Filters
Education Level
Experience Level (years)
Posted in last:
Salary