Cluster HPC Slurm
Conception, planification et mise en œuvre du premier et unique cluster Slurm de la HEIA-FR / iCoSys pour ordonnancer les GPU NVIDIA (GH200, A40, A6000) utilisés par de nombreux data scientists. J'ai configuré tout l'environnement CUDA et le NVIDIA Container Toolkit, et mêlé des GPU physiques à des GPU virtuels (vGPU) tournant dans des VMs sur un cluster vSphere, avec du cloud bursting depuis ces VMs. La stack est déployée automatiquement, surveillée finement, et les utilisateurs accèdent à trois espaces de stockage différents.