Chez Tecsys, le logiciel que nous livrons permet aux hôpitaux, pharmacies et distributeurs d'avoir ce dont ils ont besoin, quand ils en ont besoin. Chaque rôle ici contribue à ce résultat.
Pourquoi ce rôle est important
En tant que ingénieur fiabilité des infrastructures, vous vous joindrez à notre Centre des opérations réseau et de sécurité (NOC), une équipe au cœur de la fiabilité des plateformes pour les environnements SaaS critiques. Vous aiderez à maintenir, optimiser et assurer la fiabilité et la performance des systèmes qui alimentent notre infrastructure infonuagique sur AWS et Kubernetes, avec un fort accent sur l’automatisation, l’observabilité et l’amélioration continue.
Ce poste combine l’ingénierie de la fiabilité avec la gestion des incidents, vous donnant une véritable responsabilité sur la disponibilité, la performance et l’innovation. Vous ferez partie d’une équipe hautement qualifiée qui valorise la résolution créative de problèmes, l’excellence opérationnelle et l’amélioration continue grâce à l’automatisation et à l’ingénierie de la résilience.
Ce à quoi vous participerez
Tecsys est reconnue par des organisations essentielles des secteurs de la santé et de la distribution pour soutenir des chaînes d'approvisionnement résilientes, efficaces et sécurisées. Nous sommes un fournisseur mondial de logiciels infonuagiques propulsés par l'Intelligence artificielle (IA), coté à la Bourse de Toronto (TSX: TCS).
Trois valeurs guident notre façon de travailler. Nous gagnons la confiance au quotidien en valorisant le client et en agissant avec intégrité. Nous nous entraidons en reconnaissant les forces individuelles et en travaillant en équipe. Et nous explorons avec audace en restant curieux et en nous adaptant pour réussir.
Vous vous joindrez à une culture axée sur la curiosité, l'apprentissage continu et des gens qui repoussent les limites du possible.
Ce que vous ferez
- Collaborer avec d’autres équipes d’ingénierie pour soutenir les services avant leur mise en service à travers des activités telles que la consultation en conception de systèmes, le développement de plateformes et de cadres logiciels, la planification des capacités et les revues de lancement.
- Innover continuellement en identifiant les points faibles, en proposant des solutions créatives et en menant des initiatives qui simplifient, font évoluer et renforcent la plateforme.
- Maintenir les services une fois qu’ils sont en ligne en mesurant et en surveillant la disponibilité, la latence et l’état général du système.
- Assurer une observabilité optimisée : améliorer et élargir la surveillance et l’alerte à l’aide de Datadog; définir les SLO/SLI et créer des tableaux de bord exploitables qui génèrent des résultats de fiabilité.
- Développer et favoriser l’automatisation : améliorer les outils internes, les cadres IaC et les pipelines (Terraform, Git Lab CI/CD) afin de réduire les interventions manuelles et permettre des systèmes d’auto-réparation.
- Faire évoluer les systèmes de façon durable par l’automatisation et en favorisant des changements qui améliorent la fiabilité et la rapidité.
- Mettre en pratique une gestion durable des incidents et des analyses post-incident sans reproche. Diriger les examens post-incident (RCA) et identifier les correctifs à long terme qui améliorent la stabilité, la fiabilité et l’expérience des développeurs.
- Mettre en œuvre la surveillance, la journalisation, l’alerte et le signalement des SLA.
- Créer et maintenir une documentation technique.
- Mettre en œuvre, maintenir et faire évoluer les meilleures pratiques SRE.
- Agir comme commandant d’incident lors des incidents; coordonner la réponse interéquipes, gérer les communications et assurer une restauration rapide des services.
Autres exigences :
- Rotation en…
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).