Informations importantes :- Ce rôle hybride basé à notre bureau de SAP Montréal requiert 3 présences au bureau par semaine.
- Les candidats doivent avoir le droit de travailler légalement au Canada au moment de la soumission de la candidature. Ce poste n'est pas admissible au parrainage par l'employeur (p. ex., LMIA ou autre soutien à l'immigration).
Ce que vous ferezEn tant qu'ingénieur en fiabilité des sites, vous aurez l'opportunité d'exploiter et de prendre en charge des services critiques pour SAP et ses clients. Dans le cadre de votre travail quotidien, vous surveillerez de manière proactive le comportement du service et identifierez les opportunités d'améliorations. Vous participerez au développement d'outils de surveillance et de dépannage des services Cloud basés sur les dernières technologies open source et technologies SAP, en suivant les principes de l'ingénierie de fiabilité des sites
Responsabilités
- Agir en tant qu'expert technique lors d'incidents de nos services en production, investiguer et résoudre les incidents à un niveau technique approfondi.
- Mener des analyses de cause première (RCA) et faire le suivi sur les possibilités d'améliorations afin de prévenir que les problèmes se reproduisent.
- Effectuer des investigations approfondis et des analyses de journaux d'événements pour identifier et résoudre des problèmes complexes conformément aux promesses de niveau de service (SLA).
- Concevoir des solutions logicielles pour améliorer la fiabilité et la stabilité des services.
- Améliorer la surveillance de l'infrastructure et de la plateforme en amassant des métriques système (4 signaux en or) et implanter des outils pour aider à la récupération des services.
- Intégrer et collaborer étroitement avec les équipes de développement et travailler avec elles pour implémenter les améliorations identifiées lors des post-mortem.
- Rester à l'affut des nouvelles technologies et se tenir à jour techniquement.
- Créer et maintenir une documentation technique.
- Définir, promouvoir et appliquer les meilleures pratiques de l'ingénierie de fiabilité des sites.
- Être sur appel (rotation) afin de réagir aux alertes et prévenir les incidents majeurs. Le temps sur appel bénéficie d'un régime de compensation spécial. Nous pratiquons l'approche " suivi du soleil "
Ce que vous apportezCompétences et aptitudes requises
- Expérience avec Kubernetes et bonne compréhension des technologies de conteneurisation.
- Compréhension des architectures cloud modernes (une expérience avec des plateformes cloud telles que AWS, Azure, GCP est un plus).
- Expérience avec les systèmes d'exploitation Unix/Linux.
- Compétences en Scripting, CI/CD (ArgoCD, Concourse, Github Actions sont un plus) - enthousiasme pour l'automatisation - faire en sorte que les ordinateurs effectuent le travail à votre place.
- Expérience dans l'utilisation d'outils d'ingénierie assistés par l'intelligence Artificielle (p. ex. Claude Code CLI, GitHub Copilot ou équivalents) pour améliorer l'investigation de problème, l'automatisation, la documentation, l'analyse de cause première (RCA) et l'efficacité opérationnelle.
- 2 ans ou plus d'expérience dans un rôle de SRE
- Travailler efficacement dans des situations d'urgence. Affinité pour analyser et résoudre rapidement les problèmes au sein d'une équipe mondiale.
- Excellente esprit d'équipe, passionné par son travail, motivé et dynamique.
- Excellentes compétences en communication - précis et basées sur des faits.
- Maîtrise l'anglais, français de base.
Compétences et aptitudes supplémentaires donnant un avantage
- Expérience de programmation avec Python, Go, Bash.
- Certifications CKA/CKAD/CKS.
- Expérience avec les outils modernes de surveillance, de journalisation et d'alerte (Grafana, Prometheus, Kibana, Loki, Splunk On-Call, Dynatrace).
- Meilleures pratiques de sécurité pour le développement et l'opération d'applications Cloud.
- Participation à des projets open-source.
#LI-GL1
Réquisition: 458700 Secteur de travail: Software-Development Operations Déplacement escompté: 0 - 10% Statuts de carrière: Professional Type d'emploi: Regular Full Time Emplacements Supplémentaires: #LI-Hybrid
Réquisition: 458700
Date: 14 août 2026
Secteur de travail: Software-Development Operations
Statuts de carrière: Professional
Type d'emploi: Regular Full Time
Déplacement escompté: 0 - 10%
Lieu: