yoinka

Ingénieur(e) IA Générative - Hébergement De Modèles LLM

Ericsson

Montreal,Quebec,CanadaMid
Sign in to applyVerified 2h ago
Location
Montreal,Quebec,Canada
Work model
On-Site
Level
Mid
Posted
4d ago

Skills

CI/CDDockerHelmKubernetesMLOpsPython

About this role

Faites Carrière Avec Nous 
 À l'heure actuelle, Ericsson Canada Inc. n'offre pas d'aide à l'immigration ni de parrainage pour ce poste, que ce soit maintenant ou à l'avenir.   Vos missions •    Concevoir, déployer et exploiter l'infrastructure de clusters GPU (multi-serveurs, multi-locataires) dédiée à l'entraînement et à l'inférence : provisionnement, ordonnancement, mise à l'échelle automatique (autoscaling), planification des capacités et arbitrages coût/performance. •    Définir l'architecture et piloter la mise en œuvre de la plateforme en appuyant l'écosystème sur Ray (outil principal) et sur les intégrations requises avec la suite NVIDIA (Triton, NCCL, CUDA, etc.). •    Développer et maintenir les couches de service des modèles et les API (points de terminaison compatibles OpenAI), optimiser le traitement par lots (batching) et la latence, effectuer la quantification et l'optimisation des noyaux (kernels) pour maximiser le débit et respecter les SLO. •    Créer et administrer un environnement d'hébergement et un catalogue (marketplace) sécurisés et auditables pour modèles ouverts et propriétaires (isolation des locataires, gestion des accès, licences et mécanismes de facturation). •    Mettre en place des environnements d'exécution pour plateformes d'agents (agentic platform runtimes : orchestration serveur, exécution en bac à sable, orchestration de flux de travail complexes multi-étapes) ainsi que les API développeurs associées. •    Façonner l'expérience développeur : interfaces en ligne de commande (CLI), SDK, modèles de projets et accélérateurs de déploiement à destination des équipes applicatives et des responsables de modèles. •    Intégrer la plateforme aux pipelines MLOps (CI/CD pour modèles), aux catalogues de jeux de données et de versions, aux dispositifs de traçabilité et gouvernance, ainsi qu'à l'observabilité globale (métriques, traces, journaux). •    Appliquer les exigences SRE/SecOps : gestion des incidents, guides d'exploitation (runbooks), métrologie/alerte, tests de chaos et dimensionnement prédictif des capacités. •    Évoluer avec aisance dans des environnements multi-technologies et multi-plateformes IT. •    Collaborer avec les équipes d'ingénierie des données, de sécurité, juridiques et produit afin de garantir la conformité (résidence des données, contrôle des exportations, sécurité) et la mise en œuvre de garde-fous éthiques. •    Mentorat technique, animation des revues de conception et contribution à la feuille de route stratégique ainsi qu'aux cahiers d'exploitation (playbooks). Rejoignez Nos Équipes 
 Profil Recherché (Qualifications Minimales   Solide expérience en production dans la conception et l'exploitation de clusters GPU et de charges de travail ML distribuées (entraînement ou inférence) sur des fermes multi-serveurs. Pratique concrète de Ray (modèle tâche/acteur, Ray Serve) ou de cadres de calcul distribué équivalents ; maîtrise attendue de la suite NVIDIA AI (Triton, CUDA, NCCL). Expérience probante dans le développement de services d'inférence et d'API pour modèles (compatibles OpenAI ou propriétaires), incluant l'ingénierie de débit/latence, le traitement par lots ( batching ) et le passage à l'échelle. Connaissance approfondie de la conteneurisation et de l'orchestration : Docker, Kubernetes, Helm ; expérience opérationnelle des charges GPU sur Kubernetes ( device plugins , MIG). Maîtrise des techniques d'optimisation de modèles : quantification, élagage ( pruning ), parallélisme de tenseurs, parallélisme de pipeline, précision mixte. Solides compétences en ingénierie système et réseau (stockage/E-S, interconnexions GPU, optimisation RDMA/NCCL) et maîtrise des primitives d'entraînement distribué. Compétences affirmées en développement logiciel dans au moins deux des langages suivants : Python, Go ou C++ ;

Listing verified 2h ago. Applications go through the company's official careers site.

← Back to Yoinka

Ingénieur(e) IA Générative - Hébergement De Modèles LLM at Ericsson, Montreal,Quebec,Canada | Yoinka