Ingénieure SRE / Site Reliability Engineer

mthree Recruiting Portal

$90K — $110K *
Information Technology
Less than 5 years of experience
Job Overview by Ladders

Qualifications

  • Bachelor's degree in Computer Science or equivalent experience.
  • Proficiency in scripting languages such as Python, Bash, or Perl; experience with at least one higher-level programming language is desired.
  • Familiarity with three-tier architecture and relevant databases like IBM DB2 and MongoDB.
  • Experience with DevOps tools including Git, Jenkins, and Docker, as well as data streaming technologies like Apache Spark and Kafka.
  • Hands-on experience with monitoring and observability tools such as Grafana and Dynatrace.
  • Solid understanding of contemporary software architectures, including microservices and load balancing.
  • Prior experience managing large-scale online systems is strongly preferred.

Responsibilities

  • Collaborate with engineering teams to design, build, and maintain reliable systems.
  • Troubleshoot issues spanning hardware, software, applications, and the network stack.
  • Identify and implement automation opportunities for deployment and service management.
  • Proactively address reliability risks within systems.
  • Work across global teams in a follow-the-sun support model.
  • Participate in on-call duties and coordinate with specialists in different time zones.

Benefits

  • Opportunity to work in a dynamic and fast-paced environment.
  • Engage with cutting-edge technology and tools in the finance sector.
  • Collaborative team culture that values input from all members.
  • Growth potential in both technical skills and personal development.
Full Job Description
**English version below**

Doit être local à Montréal

Vous souhaitez travailler dans le domaine de la technologie au sein d'une banque d'investissement?

Nous recherchons une personne pour rejoindre une équipe dynamique en tant qu'Ingénieure Fiabilité de Site (Site Reliability Engineer) pour l'un de nos clients. Le Site Reliability Engineering (SRE) est une discipline orientée production, axée sur l'amélioration de la disponibilité des services systèmes, de l'observabilité, de l'évolutivité, de la performance et de la fiabilité des produits technologiques, en appliquant de solides principes d'ingénierie logicielle et en adoptant les technologies et outils les plus récents.

Nous serions ravis de vous rencontrer si vous :
  • Vous intéressez aux systèmes distribués et au travail sur des services hautement évolutifs, fiables et à grande échelle.
  • Aimez évoluer dans un environnement dynamique et n'avez pas peur de changer les choses pour les améliorer.
  • Appréciez les nouveaux défis technologiques et la résolution de problèmes complexes.
  • Croyez qu'une équipe qui collabore efficacement est véritablement plus intelligente que la personne la plus brillante qui la compose.
  • Aspirez à évoluer en tant que personne, coéquipier• e et ingénieur• e.
  • Faites preuve de détermination, de motivation et d'un profond sens des responsabilités.


Responsabilités :
  • Travailler en étroite collaboration avec les équipes d'ingénierie et de développement pour concevoir, construire et maintenir des systèmes, tout en les conseillant sur le choix des produits, la conception des schémas et l'optimisation des requêtes.
  • Diagnostiquer et résoudre des problèmes à travers l'ensemble de la stack : matériel, logiciel, application et réseau.
  • Identifier et piloter les opportunités d'amélioration de l'automatisation de nos plateformes ; définir et créer des automatisations pour le déploiement, la gestion et la visibilité de nos services.
  • Identifier de manière proactive les risques liés à la fiabilité des systèmes et y remédier.
  • Travailler aux côtés des membres des équipes mondiales et régionales existantes selon un modèle de suivi en continu ("follow-the-sun").
  • Participer à la rotation d'astreintes ainsi qu'aux appels périodiques avec des spécialistes situés dans d'autres fuseaux horaires.


Compétences requises
  • Formation en informatique équivalente à un Baccalauréat universitaire (B.Sc.). Une expérience pratique significative peut être considérée comme équivalente.
  • Une expérience en automatisation est particulièrement appréciée, notamment à travers l'utilisation de langages de script tels que Python, Bash ou Perl. La maîtrise d'au moins un langage de programmation de plus haut niveau est souhaitée.
  • Expérience du support d'architectures trois tiers (three-tier architecture), incluant une exposition aux environnements UNIX/Linux ainsi qu'à des bases de données telles que IBM DB2, Sybase, MongoDB, Greenplum, ou équivalentes.
  • Expérience avec les outils de gestion du code source et des artefacts, les outils de build et les pipelines CI/CD, notamment Git, Artifactory, Jenkins et Docker, ainsi qu'avec les technologies de traitement et de diffusion de données telles que Apache Spark et Kafka.
  • Expérience pratique des outils d'entreprise de supervision et d'observabilité tels que Grafana, Dynatrace et AppDynamics.
  • Bonne compréhension des architectures logicielles et systèmes modernes, notamment en matière de répartition de charge (load balancing), files d'attente (queueing), mise en cache (caching), systèmes distribués, microservices et gestion des scénarios de défaillance.
  • Solide maîtrise des concepts liés aux systèmes d'exploitation, notamment les processus, la gestion de la mémoire et la pile réseau (network stack), ainsi qu'une capacité à analyser et résoudre les incidents qui en découlent.
  • Une expérience pratique de l'exploitation et du support de systèmes en ligne à grande échelle constitue un atout majeur.
  • Expérience avec les solutions Luna HSM (Hardware Security Module) et l'outil CTM


**English Translation**

**Must be local to Montreal**

Want to work in technology at an investment bank?

We are looking for someone to be a part of a dynamic team as a Site Reliability Engineer for one of our clients. Systems Reliability Engineering (SRE) is a production-oriented discipline focused on improving system service availability, observability, scalability, performance, and reliability for technology products by applying sound software engineering principles and adopting the latest technology and tooling.

We would like to talk to you if you:
  • Are interested in distributed systems and working with high scale scalable and reliable services.
  • Like to work in a fast-moving environment and you aren't afraid to change things to make them better.
  • Enjoy new technological challenges and solving hard problems.
  • Believe that a team working well together is truly smarter than the single smartest person on that team.
  • Aspire to grow as a person, as a teammate, and as an engineer.
  • Have Grit, drive and a deep feeling of ownership.

Responsibilities:
  • Working closely with engineering/development teams to design, build, and maintain systems and help them decide on products to use, schema design and query tuning.
  • Troubleshoot issues across the entire stack: hardware, software, application and network.
  • Identifying and drive opportunities to improve automation for our platforms; scope and create automation for deployment, management and visibility of our services.
  • Proactively identifying and addressing systems reliability risks.
  • Working alongside existing global and regional team members on a follow-the-sun basis.
  • Participate in on-call rotation and periodic conference calls with other specialists from other time zones.

Skills Required:
  • Background in Computer Science equivalent to a B.Sc. Equivalent practical experience is a reasonable substitute.
  • Automation-related experience is particularly valued using scripting languages such as python, bash, Perl. One higher level language is desired.
  • Experience on supporting three tier architecture which includes exposure to UNIX, Linux platforms and databases such IBM DB2, Sybase, Mongo, GreenPlum etc.
  • Experience with source code and binary repositories, build tools, and CI/CD (Git, Artifactory, Jenkins, Docker) etc and data streaming technologies like Spark, Kafka etc.
  • Hands on experience on enterprise tools set such as Grafana, Dynatrace, AppDynamics etc.
  • Awareness of, and ability to reason about modern software & systems architectures, including load-balancing, queueing, caching, distributed systems failure modes, micro services etc
  • Deep understanding of operating system level concepts such as processes, memory allocation, and the network stack; understanding of how applications are affected by the above, and ability to debug same.
  • Generally speaking, practical experience running large scale online systems is always an advantage.
  • Luna HSM experience and CTM Experience

Similar Jobs

More Jobs at mthree Recruiting Portal

More Information Technology Jobs

Find similar Ingénieure SRE / Site Reliability Engineer jobs: