- Accueil
- Offres d'emploi
- Île-de-France
- Paris
- Ingénieur Système HPC / GPU / SLURM F/H
| DATE DE PUBLICATION | 29/07/2026 | TYPE DE CONTRAT | CDD | |
| RECRUTEUR | SORBONNE UNIVERSITE | CATÉGORIE | B | |
| LIEUX DE TRAVAIL |
Paris-5e-Arrondissement | SALAIRE |
Non communiqué | |
| CODE POSTAL |
75005 | VALABLE JUSQU'AU |
27/09/2026 |
Poste
Choisir Sorbonne Université, c'est rejoindre une université engagée sur les enjeux de développement durable, de diversité, d'égalité, d'innovation, de diffusion des savoirs, d'ouverture sur le monde et de qualité de vie au travail de ses personnels. Labelisée HR Excellence in Research par la Commission européenne depuis 2021, Sorbonne Université porte une stratégie ambitieuse au service de l'ensemble de sa communauté de recherche.
Université pluridisciplinaire de recherche intensive de rang mondial, elle s'attache à répondre aux enjeux scientifiques du 21e siècle et à transmettre les connaissances issues de ses laboratoires et de ses équipes de recherche.
Déployant ses formations auprès de 55 000 étudiantes et étudiants dont 4000 doctorantes et doctorants et 12300 étudiantes et étudiants étrangers, elle regroupe plus de 3300 enseignantes et enseignants, enseignantes-chercheuses et enseignants-chercheurs, chercheuses et chercheurs, près de 4 000 enseignants-chercheurs et enseignants partenaires, environ 3 000 personnels de bibliothèque, administratifs, technique, sociaux et de santé (BIATSS) et 2000 IATSS partenaires. Son budget est de plus de 700 M€.
Située au coeur de Paris, elle présente une organisation avec des directions inter-facultaires et trois facultés de « Lettres », « Santé » et « Sciences et Ingénierie » et est présente dans plus de 30 sites en Ile-de-France et en régions.
Fonctions : Ingénieur.e Système HPC / GPU / SLURM
Catégorie : B
Corps : TECH
BAP : E
CDD de 12 mois.
Missions principales :
1. Administration système
- Déploiement et maintenance des noeuds de calcul GPU sous Debian
- Déploiement et maintenance de noeuds proxmox, vm et docker
- Gestion des mises à jour système, des pilotes NVIDIA et des librairies CUDA
- Configuration et optimisation du réseau haute performance (bonding, VLAN)
- Mise en oeuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS)
- Automatisation des déploiements via Ansible
2. Administration SLURM
- Installation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd)
- Définition des partitions, QOS, comptes et limites de ressources
- Intégration des GPU NVIDIA dans les ressources SLURM (GRES)
- Surveillance des jobs, diagnostics et interventions sur les noeuds en défaut
- Rédaction et mise à jour des procédures SLURM à destination des utilisateurs
3. Support utilisateurs et opérateurs
- Support de niveau 2/3 pour les utilisateurs de la plateforme HPC
- Accompagnement des utilisateurs sur l'optimisation de leurs soumissions SLURM
- Participation aux réunions techniques et rédaction des comptes-rendus
- Rédaction de la documentation technique et des runbooks
4. Supervision et performance
- Mise en place et maintenance des outils de supervision (Prometheus, Grafana)
- Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink)
- Optimisation des politiques d'ordonnancement selon la charge de la plateforme
- Gestion des incidents et participation aux astreintes selon planning
Profil
Compétences techniques indispensables :
- Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseau
- Expérience confirmée sur SLURM : configuration, partitions, GRES GPU, accounting
- Bonne connaissance de l'écosystème NVIDIA : drivers, CUDA, NVML, DCGM
- Maîtrise des outils d'automatisation : Ansible, Bash, Python
- Expérience sur les réseaux : Bonding, Vlan, routage
Compétences appréciées :
- Connaissance de systèmes de fichiers distribués : Ceph, cephfs
- Pratique de la supervision avec Prometheus, Grafana, Alertmanager
- Notions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL)
- Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC)
- Connaissances en gestion de version : Git, GitLab CI
Qualités personnelles :
- Rigueur, méthode et sens de la documentation
- Autonomie et capacité à gérer les priorités en environnement de production
- Bon relationnel et goût pour le travail en équipe
- Curiosité technique et veille active sur l'écosystème HPC/GPU
Employeur
Choisir Sorbonne Université, c’est rejoindre une université engagée sur les enjeux de développement durable, de diversité, d’égalité, d’innovation, de diffusion des savoirs, d’ouverture sur le monde et de qualité de vie au travail de ses personnels.
Université pluridisciplinaire de recherche intensive de rang mondial, elle s’attache à répondre aux enjeux scientifiques du 21e siècle et à transmettre les connaissances issues de ses laboratoires et de ses équipes de recherche.
Déployant ses formations auprès de 55 000 étudiantes et étudiants dont 4000 doctorantes et doctorants et 12300 étudiantes et étudiants étrangers, elle regroupe plus de 3300 enseignantes et enseignants, enseignantes-chercheuses et enseignants-chercheurs, chercheuses et chercheurs, près de 4 000 enseignants-chercheurs et enseignants partenaires, environ 3 000 personnels de bibliothèque, administratifs, technique, sociaux et de santé (BIATSS) et 2000 IATSS partenaires. Son budget est de plus de 700 M€.
Située au cœur de Paris, elle présente une organisation avec des directions interfacultaires et trois facultés de « Lettres », « Santé » et « Sciences et Ingénierie » et est présente dans plus de 27 sites en Ile-de-France et en régions.
Offres d’emploi similaires à Ingénieur Système HPC / GPU / SLURM F/H

Assistant support du projet Système d'Information de la formation continue F/H
Contractuel, CDD | 24/07/2026 | SORBONNE UNIVERSITE

Chargé de l'assistance fonctionnelle et de paramétrage SIE F/H
CDD | 29/06/2026 | SORBONNE UNIVERSITE

Ingénieur expert en ingénierie logicielle pour les projets FUTURE-OBS et ATLASea H/F
Contractuel, CDD | 25/06/2026 | SORBONNE UNIVERSITE