Ericsson

Ingénieur(e) IA Générative - Hébergement De Modèles LLM

Ericsson$110K — $130K *
Technical Services
5 - 7 years of experience
Job Overview by Ladders

Qualifications

  • Experience designing and operating GPU clusters for ML workloads.
  • Familiarity with Ray or similar frameworks and NVIDIA AI stack.
  • Skills in developing model serving APIs with optimization techniques.
  • Deep knowledge of Docker, Kubernetes, and Helm for orchestration.
  • Experience with model optimization and distributed training.
  • Proficient in at least two programming languages, e.g., Python or C++.
  • Knowledge of observability tools and security for multi-tenant applications.

Responsibilities

  • Design, deploy and operate GPU infrastructure for training and inference.
  • Lead the architecture and implementation of the platform using Ray and NVIDIA tools.
  • Build and maintain model serving layers and optimize API performance.
  • Create a secure marketplace for managing models and user access.
  • Implement orchestration for complex workflows and developer APIs.
  • Enhance developer experience through CLI tools and provisioning aids.
  • Integrate with MLOps pipelines and ensure observability of models.

Benefits

  • Comprehensive benefits package tailored to individual needs and goals.
  • Opportunities for professional development and mentorship.
  • Collaborative environment with interdisciplinary teams.
Full Job Description
Vos missions
• Concevoir, déployer et exploiter l'infrastructure de clusters GPU (multi-serveurs, multi-locataires) dédiée à l'entraînement et à l'inférence : provisionnement, ordonnancement, mise à l'échelle automatique (autoscaling), planification des capacités et arbitrages coût/performance.
• Définir l'architecture et piloter la mise en œuvre de la plateforme en appuyant l'écosystème sur Ray (outil principal) et sur les intégrations requises avec la suite NVIDIA (Triton, NCCL, CUDA, etc.).
• Développer et maintenir les couches de service des modèles et les API (points de terminaison compatibles OpenAI), optimiser le traitement par lots (batching) et la latence, effectuer la quantification et l'optimisation des noyaux (kernels) pour maximiser le débit et respecter les SLO.
• Créer et administrer un environnement d'hébergement et un catalogue (marketplace) sécurisés et auditables pour modèles ouverts et propriétaires (isolation des locataires, gestion des accès, licences et mécanismes de facturation).
• Mettre en place des environnements d'exécution pour plateformes d'agents (agentic platform runtimes : orchestration serveur, exécution en bac à sable, orchestration de flux de travail complexes multi-étapes) ainsi que les API développeurs associées.
• Façonner l'expérience développeur : interfaces en ligne de commande (CLI), SDK, modèles de projets et accélérateurs de déploiement à destination des équipes applicatives et des responsables de modèles.
• Intégrer la plateforme aux pipelines MLOps (CI/CD pour modèles), aux catalogues de jeux de données et de versions, aux dispositifs de traçabilité et gouvernance, ainsi qu'à l'observabilité globale (métriques, traces, journaux).
• Appliquer les exigences SRE/SecOps : gestion des incidents, guides d'exploitation (runbooks), métrologie/alerte, tests de chaos et dimensionnement prédictif des capacités.
• Évoluer avec aisance dans des environnements multi-technologies et multi-plateformes IT.
• Collaborer avec les équipes d'ingénierie des données, de sécurité, juridiques et produit afin de garantir la conformité (résidence des données, contrôle des exportations, sécurité) et la mise en œuvre de garde-fous éthiques.
• Mentorat technique, animation des revues de conception et contribution à la feuille de route stratégique ainsi qu'aux cahiers d'exploitation (playbooks).

Profil Recherché (Qualifications Minimales

  • Solide expérience en production dans la conception et l'exploitation de clusters GPU et de charges de travail ML distribuées (entraînement ou inférence) sur des fermes multi-serveurs.
  • Pratique concrète de Ray (modèle tâche/acteur, Ray Serve) ou de cadres de calcul distribué équivalents ; maîtrise attendue de la suite NVIDIA AI (Triton, CUDA, NCCL).
  • Expérience probante dans le développement de services d'inférence et d'API pour modèles (compatibles OpenAI ou propriétaires), incluant l'ingénierie de débit/latence, le traitement par lots (batching) et le passage à l'échelle.
  • Connaissance approfondie de la conteneurisation et de l'orchestration : Docker, Kubernetes, Helm ; expérience opérationnelle des charges GPU sur Kubernetes (device plugins, MIG).
  • Maîtrise des techniques d'optimisation de modèles : quantification, élagage (pruning), parallélisme de tenseurs, parallélisme de pipeline, précision mixte.
  • Solides compétences en ingénierie système et réseau (stockage/E-S, interconnexions GPU, optimisation RDMA/NCCL) et maîtrise des primitives d'entraînement distribué.
  • Compétences affirmées en développement logiciel dans au moins deux des langages suivants : Python, Go ou C++ ; expérience dans le développement d'outils CLI et de SDK.
  • Pratique des architectures d'observabilité et de télémétrie (Prometheus, Grafana, ELK/EFK, OpenTelemetry) ainsi que du suivi analytique des coûts et des consommations.
  • Maîtrise des principes de sécurité et d'isolation pour environnements multi-locataires, de la gestion des secrets et du contrôle d'accès.
  • Expérience avérée dans la conduite de services critiques en production (SLO/SLI/SLA), la gestion d'incidents et la planification capacitaire.
  • Excellentes capacités de communication et de travail en équipe interdisciplinaire (infrastructure, data, ML, produit).

Opérations et Fiabilité
  • Appliquer et faire évoluer les pratiques SRE/DevOps/SecOps (pipelines CI/CD, surveillance continue avec boucles de rétroaction, observabilité globale et écosystèmes Infrastructure-as-Code basés sur GitOps) afin de garantir le maintien des services dans l'état cible.
  • Qualifier et résoudre les dysfonctionnements des outils internes et de la plateforme, en apportant un support réactif et une communication claire lors des incidents critiques.

Leadership technique et accompagnement
  • Agir en tant que référent• e technique et mentor auprès des ingénieur• es juniors, en faisant rayonner les meilleures pratiques d'ingénierie, de conception et d'exploitation.
  • Piloter et optimiser en continu le parcours d'intégration des développeurs sur la plateforme, rédiger une documentation technique claire et à jour, et échanger activement avec la communauté d'utilisateurs pour recueillir leurs retours.
  • Définir et suivre les indicateurs de productivité des développeurs (ex. temps de compilation, délais de validation des PR, métriques DORA/SPACE) afin d'identifier et de résorber proactivement les points de friction.


Atouts appréciés / Éléments différenciateurs

  • Expérience dans la conception de marketplaces de modèles, la mise en place de systèmes de facturation ou la gestion de quotas et facturations multi-locataires.
  • Pratique des frameworks d'agents autonomes (agentic frameworks), des pipelines RLHF ou des couches d'orchestration pour le raisonnement multi-tours (multi-turn reasoning).
  • Connaissance des frameworks spécialisés dans le service d'inférence : Triton, KServe, TorchServe.
  • Expérience pratique de la virtualisation GPU (MIG), des ordonnanceurs Kubernetes et des problématiques d'approvisionnement matériel ou micrologiciel (firmware).
  • Maîtrise de l'intégration des passerelles API compatibles OpenAI, de la limitation de débit (rate limiting), de la gestion de versions des modèles et des stratégies de déploiement A/B.
  • Connaissance approfondie des exigences réglementaires liées aux modèles d'IA (résidence des données, contrôles à l'exportation).


What you will do

  • Design, deploy and operate GPU cluster infrastructure (multi server, multi tenant) for both training and inference: provisioning, scheduling, autoscaling, capacity planning and cost/perf tradeoffs.
  • Lead platform architecture and implementation using Ray (primary) and integrations with NVIDIA stacks (Triton, NCCL, CUDA, etc.) as required.
  • Build and maintain model serving and API layers (OpenAI compatible endpoints), batching/latency optimizations, quantization and kernel tuning to maximize throughput and SLOs.
  • Create and operate a secure, auditable marketplace and hosting layer for open and proprietary models, including tenant isolation, access control, licensing and billing hooks.
  • Implement agent/agentic platform runtimes (server orchestration, sandboxing, orchestration of multi step workflows) and developer APIs to enable autonomous/on-demand agents.
  • Provide developer experience: CLI clients, SDKs, templates and deployment accelerators for model owners and application teams.
  • Integrate platform with MLOps pipelines (CI/CD for models), dataset/version catalogs, lineage and governance, and observability for models and infra (metrics, traces, logs).
  • Apply SRE/SecOps practices: incident management, runbooks, monitoring/alerting, chaos testing, and capacity/predictable scaling.
  • Capable to work on multi-technologies and IT platforms.
  • Collaborate with data engineering, security, legal and product to ensure compliance (data residency, export controls, model safety) and model ethics guardrails.
  • Mentor engineers, lead design reviews, and contribute to long term roadmap and operational playbooks.


Required (minimum) qualifications

  • Strong production experience designing/operating GPU clusters and distributed ML workloads (training or inference) on multi server farms.
  • Hands on experience with Ray (task/actor model, Ray Serve), or similar distributed compute frameworks; familiarity with NVIDIA AI stack (Triton, CUDA, NCCL) is expected.
  • Proven experience building model serving/APIs (OpenAI compatible or custom), including latency/throughput engineering, batching, and scaling.
  • Deep knowledge of containerization and orchestration: Docker, Kubernetes, Helm; experience running GPU workloads on k8s (device plugins, MIG).
  • Experience with model optimization techniques: quantization, pruning, tensor parallelism, pipeline parallelism, mixed precision.
  • Strong systems and networking skills (storage/IO, GPU interconnects, RDMA/NCCL tuning), and experience with distributed training primitives.
  • Solid software engineering skills in at least two of: Python, Go, or C++; experience building CLI/SDK tooling.
  • Practical experience with observability and telemetry stacks (Prometheus, Grafana, ELK/EFK, OpenTelemetry) and cost/usage monitoring.
  • Knowledge of security/isolation for multi tenant workloads, secrets management, and access control.
  • Track record of operating production services (SLOs/SLIs/SLA), incident response and capacity planning.
  • Excellent collaboration and communication skills; ability to work across infra, data, ML and product teams.

Operations & Reliability:
  • Apply and evolve SRE/DevOps/SecOps practices, including CI/CD pipelines, feedback-loop-based monitoring, end-to-end observability, and GitOps-based Infrastructure-as-Code (IaC) ecosystems to maintain the desired state of services.
  • Triage and troubleshoot internal tooling and platform issues, providing attentive support and clear communication during critical incidents.

Technical Leadership & Mentorship:
  • Act as a technical leader and mentor for junior engineers, fostering best practices in engineering, design, and operations.
  • Own and continuously improve the developer onboarding lifecycle on the platform, create clear and up-to-date technical documentation, and engage with the user community to gather feedback.
  • Establish and track developer productivity metrics (e.g., build times, PR cycle times, DORA/SPACE metrics) to proactively identify and address friction points.


Preferred / differentiators

  • Experience building model marketplaces, billing integration, or tenant billing/quotas.
  • Prior work with agentic frameworks, RLHF pipelines, or orchestration layers for multi turn reasoning.
  • Familiarity with inference serving frameworks: Triton, KServe, TorchServe
  • Experience with GPU virtualization (MIG), cluster schedulers (Kubernetes) and hardware procurement/firmware considerations.
  • Experience integrating OpenAI compatible API gateways and rate limiting, model versioning and A/B rollout strategies.
  • Background in compliance/regulatory requirements for models (data residency, export controls).


Puisque ce rôle nécessite d'interagir avec d'autres entités d'Ericsson à l'échelle mondiale ainsi qu'avec des collègues et intervenant.es dans d'autres provinces canadiennes, la connaissance du français et de l'anglais est exigée pour ce poste.

AVIS DE NON-RESPONSABILITÉ : Les énoncés ci-dessus visent à décrire la nature générale et le niveau de travail effectué par les employés occupant ce poste. Il ne s'agit pas d'une liste exhaustive de toutes les responsabilités, fonctions et compétences requises pour ce poste, et vous pourriez être amené à effectuer des tâches supplémentaires selon les tâches.

Pays et ville principaux : Canada (CA), Montreal (Country/ City)

Détails du poste : ICT Engineer

Rémunération et avantages sociaux chez Ericsson

Chez Ericsson, nous savons que nos employés sont la clé de notre succès. Nous offrons un forfait compétitif pour répondre à vos besoins et objectifs individuels.

Votre salaire

Le salaire offert dépend de divers facteurs, y compris, mais sans s'y l

About Ericsson

Ericsson is a multinational telecommunications company headquartered in Stockholm, Sweden. The company was founded in 1876 by Lars Magnus Ericsson and has since grown to become one of the largest telecommunications companies in the world. Ericsson provides a range of products and services including network equipment, software, and services for telecommunications operators. The company operates in over 180 countries and has over 100,000 employees. Ericsson is known for its innovation in the telecommunications industry and has been awarded numerous patents for its inventions. The company is also committed to sustainability and has set ambitious goals to reduce its environmental impact.
Learn more about Ericsson
Size
101,067 employees
Market Cap
$19.6 billion
Industry
Net Income
$17.4 billion
Founded
1876
5 Year Trend
+1.1%
Revenue
$232.3 billion
NASDAQ

Similar Jobs

More Jobs at Ericsson

More Technical Services Jobs

Find similar Ingénieur(e) IA Générative - Hébergement De Modèles LLM jobs: