Back to job search
DRW logo
DRWVerified Job Source

Spécialiste CHP

French posting
  • Montréal, QC
  • On-site
  • Posted Aug 19, 2026
  • 1 position

Opens an external site

Sign in to save this job
Employment type
Full-time
Experience level
Senior · 5+ years
Minimum education
Bachelor’s degree
Posting language
French
Working hours
40 hours per week

Job summary

The specialist will deploy, maintain, and optimize GPU infrastructure for large-scale LLM inference workloads, including provisioning and configuring GPU server fleets. Key tasks involve designing distributed serving solutions, managing GPU-enabled Kubernetes clusters, and configuring necessary network infrastructure for inter-node communication.

Job details

DRW est une société de négoce diversifiée avec plus de 3 décennies d'expérience qui réunit une technologie sophistiquée et des personnes exceptionnelles pour opérer sur les marchés du monde entier. Nous valorisons l'autonomie et la capacité à pivoter rapidement pour saisir les opportunités, c'est pourquoi nous opérons en utilisant notre propre capital et en négociant à nos propres risques. Basée à Chicago et disposant de bureaux aux États-Unis, au Canada, en Europe et en Asie, nous négocions diverses catégories d'actifs, notamment les titres à revenu fixe, les FNB, les actions, les devises, les matières premières et l'énergie sur les principaux marchés mondiaux. Nous avons également tiré parti de notre expertise et de notre technologie pour nous développer dans trois stratégies non traditionnelles : l'immobilier, le capital-risque et les crypto-actifs. Nous opérons avec respect, curiosité et ouverture d'esprit. Les personnes qui s'épanouissent ici partagent notre conviction que ce n'est pas seulement ce que nous faisons qui compte - c'est la façon dont nous le faisons. DRW est un lieu d'attentes élevées, d'intégrité, d'innovation et de volonté de remettre en question le consensus. Nous recherchons un spécialiste CHP pour rejoindre notre équipe IA et stratégies systématiques multi-actifs. Cette équipe conçoit et exploite une infrastructure GPU qui alimente des charges de travail en IA et en apprentissage automatique. Vous travaillerez sur l’ensemble de la pile d’infrastructure, du matériel bare metal jusqu’au déploiement de modèles, en combinant ingénierie des systèmes, optimisation des performances et automatisation de l’infrastructure afin de résoudre des problèmes complexes à l’intersection du matériel, des réseaux et des systèmes distribués. Responsabilités : Déployer, maintenir et optimiser l’infrastructure GPU pour des charges de travail d’inférence LLM à grande échelle, incluant le provisionnement, la configuration et le déploiement de flottes de serveurs GPU. Concevoir et mettre en œuvre des solutions de serving distribuées pour des déploiements de modèles multi-nœuds et multi-GPU. Gérer des clusters Kubernetes avec support GPU pour des charges de travail LLM et ML. Configurer l’infrastructure réseau, incluant les load balancers, pare-feu et la communication inter-nœuds pour les clusters GPU. Mettre en œuvre et optimiser des solutions de stockage pour les poids des modèles et les caches d’inférence. Diagnostiquer les goulets d’étranglement en matière de performance à tous les niveaux : matériel, pilotes, réseau et couche applicative. Rechercher et évaluer les nouvelles technologies GPU, les frameworks de serving de modèles et les optimisations d’infrastructure. Collaborer avec les ingénieurs ML pour profiler les performances des modèles et mettre en œuvre des techniques d’accélération de l’inférence. Améliorer la fiabilité via la supervision, les alertes, la planification de capacité et la gestion des incidents. Exigences : Licence ou maîtrise en informatique, ingénierie des systèmes ou domaine connexe. Plus de 5 ans d’expérience en DevOps, SRE ou ingénierie d’infrastructure. Solide expérience avec l’infrastructure GPU, les frameworks de serving de modèles (vLLM, SGLang) et la gestion des pilotes GPU. Expérience pratique dans l’optimisation de charges de travail en "deep learning" (inférence ou entraînement) sur des clusters GPU. Connaissance approfondie des systèmes Linux, incluant la configuration réseau, l’optimisation du stockage et l’orchestration Kubernetes. Expérience avec des outils d’infrastructure as code (Ansible, Terraform ou équivalent). Bonne compréhension des systèmes distribués, des protocoles réseau (TCP/IP, HTTP/2) et du load balancing. Maîtrise de Python et des scripts Bash pour l’automatisation. Expérience avec des outils de monitoring et d’observabilité (Prometheus, Grafana ou équivalent). Si tu veux, je peux aussi adapter la traduction pour qu’elle soit plus simple ou plus naturelle pour une offre au Québec (ex : termes locaux, ton plus marketing, etc.). Ce que DRW Montréal a à vous offrir: Reconnue comme l'un des meilleurs employeurs au Canada depuis 8 ans Engagement en faveur de la formation et du développement continus Un ensemble d'avantages et de bénéfices à la pointe de l'industrie Centré sur le bien-être des employés et l'équilibre entre vie professionnelle et vie privée Initiatives communautaires, programme de volontariat et possibilités de redonner Découvrez tous nos avantages à: https://drw.com/fr/work-at-drw/avantages-montreal Pour plus d'informations sur les activités de traitement de DRW et sur l'utilisation que nous faisons des données des postulants, veuillez lire notre Politique de confidentialité ici https://drw.com/fr/politique-de-confidentialite/. Résidents de la Californie, veuillez consulter l’avis de confidentialité de la Californie pour obtenir des informations sur certains droits légaux ici https://drw.com/fr/politique-de-confidentialite-californie. * Le masculin est utilisé sans discrimination dans le seul but d’alléger le texte. [#LI-KS1]

What you’ll do

The specialist will deploy, maintain, and optimize GPU infrastructure for large-scale LLM inference workloads, including provisioning and configuring GPU server fleets. Key tasks involve designing distributed serving solutions, managing GPU-enabled Kubernetes clusters, and configuring necessary network infrastructure for inter-node communication.

Requirements

Candidates must possess a Bachelor's or Master's degree in Computer Science or a related field, along with over 5 years of experience in DevOps, SRE, or infrastructure engineering. Essential requirements include strong experience with GPU infrastructure, model serving frameworks (like vLLM, SGLang), deep learning workload optimization, and proficiency in Linux systems and automation tools like Python and Ansible.

Benefits

  • Training and continuous development
  • Industry-leading benefits package
  • Focus on employee well-being and work-life balance
  • Community initiatives
  • Volunteer program

Listed skills

  • Kubernetes · Preferred
  • Linux · Preferred
  • Terraform · Preferred
  • Python · Preferred

Other relevant skills

Identified from the job description. Confirm important requirements above.

  • GPU Infrastructure
  • LLM Inference
  • Kubernetes
  • System Engineering
  • Performance Optimization
  • Distributed Serving
  • Network Configuration
  • Storage Optimization
  • vLLM
  • SGLang
  • Linux
  • Ansible
  • Terraform
  • Python
  • Bash
  • Prometheus

Job areas

  • Technology
  • Engineering
  • Software
  • Data & Analytics

More jobs from DRW

See all jobs from DRW