Emploi
De la source partenaire
Ingénieur Support Technique (L2) - Calcul
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Non
- Entreprise
- Mistral.ai
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
À propos de Mistral
Mistral fournit des solutions d'IA complètes : des modèles de pointe aux outils de développement, applications et calcul. Nous collaborons avec des entreprises qui s'attaquent aux problèmes les plus difficiles dans des secteurs à enjeux élevés tels que la finance, l'industrie manufacturière, la défense, la santé et le secteur public, en co-créant des systèmes d'IA personnalisés qu'elles peuvent exécuter selon leurs conditions.
Nous sommes une équipe dynamique et collaborative passionnée par l’IA et son potentiel à transformer la société. Notre main-d’œuvre diversifiée s’épanouit dans des environnements compétitifs et s’engage à stimuler l’innovation. Nos équipes sont réparties entre l'Europe, l'Amérique du Nord, l'Asie et le Moyen-Orient. Nous sommes créatifs, modestes et avons l'esprit d'équipe.
Mistral AI construit une nouvelle équipe de support informatique pour garantir la fiabilité, les performances et l'évolutivité de nos clusters GPU dans un environnement Kubernetes. En tant que l'un des membres fondateurs de cette équipe, vous jouerez un rôle central dans l'élaboration de ses processus, de ses normes et de sa culture.
Dans ce rôle de support hybride L1/L2, vous serez le premier point de contact pour les clients et les équipes internes, fournissant des conseils techniques, un dépannage et une résolution des problèmes pour les demandes liées au calcul. Vous servirez également de point d’escalade pour les problèmes complexes, en tirant parti de votre connaissance approfondie des systèmes, de votre expertise Kubernetes et de vos compétences en débogage opérationnel pour garantir le bon fonctionnement de nos charges de travail d’IA à grande échelle.
Il s'agit d'un rôle axé sur le support qui allie l'administration système, la communication avec le client et l'expertise en matière d'infrastructure informatique. Bien que le codage ne soit pas l’objectif principal, la connaissance de Go pour le débogage et l’automatisation est un plus.
Principales responsabilités
Point de contact du premier client
• Agir en tant que premier interlocuteur pour les clients et les équipes internes, en fournissant des réponses rapides et efficaces aux demandes liées au calcul.
• Trier et hiérarchiser les demandes entrantes, en veillant à ce que les SLA soient respectés pour l'accusé de réception, la première réponse et la résolution.
• Rassemblez et analysez les détails du problème initial (par exemple, journaux, messages d'erreur, métriques système) pour diagnostiquer efficacement les problèmes.
• Fournir des conseils clairs et exploitables aux clients et aux utilisateurs internes, y compris des solutions de contournement temporaires le cas échéant.
Assistance technique
• Servir de point d'escalade L2 pour les problèmes liés à Linux, Kubernetes et à l'infrastructure de calcul, en fournissant un dépannage technique approfondi pour :
• Charges de travail GPU/TPU (par exemple, erreurs CUDA, fuites de mémoire, échecs de tâches).
• Clusters Kubernetes (par exemple, pannes de pods, pannes de nœuds, mauvaises configurations du réseau).
• Environnements nus et cloud (par exemple, AWS EC2, machines virtuelles GCP, clusters HPC).
• Diagnostiquer et résoudre les goulots d'étranglement des performances, les pannes matérielles et les conflits de ressources dans les systèmes distribués.
• Analysez les métriques, les journaux et les traces du système (par exemple, dmesg, journalctl, nvidia-smi, Prometheus, Grafana) pour identifier les causes profondes des problèmes.
• Participer à des rotations de garde pour fournir une assistance 24h/24 et 7j/7 pour les systèmes informatiques critiques.
• Agréable : optimisez les configurations système (par exemple, paramètres du noyau, réglage du système de fichiers, paramètres réseau) pour le calcul haute performance (HPC) et les charges de travail d'IA.
Kubernetes et conteneurisation
• Déboguer les clusters Kubernetes en mettant l'accent sur :
• Problèmes de pods et de nœuds (par exemple, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Mise en réseau et stockage (par exemple, plugins CNI, PersistentVolumes, StorageClasses).
• Gestion des ressources (par exemple, demandes/limites, classes QOS, affinité de nœud).
• Résoudre les problèmes d'exécution des conteneurs (Docker, containersd) tels que les échecs d'extraction d'images, la conformité OCI ou les erreurs d'exécution.
• Collaborer avec les équipes SRE pour comprendre et améliorer les outils IaC (Terraform, Ansible) et Go existants.
Documentation et amélioration des processus
• Créer et maintenir des runbooks, des playbooks et une documentation interne pour les problèmes de calcul courants (par exemple, débogage GPU, dépannage Kubernetes).
• Contribuer aux autopsies avec des suivis concrets pour prévenir les incidents récurrents.
• Former les équipes internes aux meilleures pratiques en matière d'infrastructure de calcul et de débogage.
• Aider à définir et affiner les processus de support en tant que membre fondateur de la nouvelle équipe Compute Support.
Ce que nous recherchons
Compétences et expérience requises
• Plus de 5 ans d'expérience dans l'administration système, le support technique ou les opérations d'infrastructure, avec un fort accent sur les environnements gourmands en calcul (bare metal, cloud, HPC ou virtualisation).
• Expertise approfondie de Linux/Unix :
• Débogage des problèmes au niveau du noyau (par exemple, tueur de MOO, goulots d'étranglement d'E/S, limitation du processeur).
• Optimisation des performances (par exemple, sysctl, ulimit, optimisations du système de fichiers).
• Dépannage réseau (par exemple, iptables, tcpdump, DNS, NFS, SSH).
• Gestion du stockage (par exemple, LVM, RAID, NVMe, stockage local GPU).
• Une expérience pratique de Kubernetes est obligatoire :
• Débogage des pods, des nœuds et des clusters (par exemple, kubectlscribe, kubectl logs, crictl).
• Mise en réseau et stockage (par exemple, plugins CNI, PersistentVolumes).
• Gestion des ressources (par exemple, demandes/limites, classes QOS).
• Familiarité avec la conteneurisation (Docker, containersd) et connaissance de base de l'IaC. Maîtrise des outils de surveillance (Prometheus, Grafana, ELK, OpenTelemetry).
• Compétences de base en script/automatisation (de préférence Go, mais Bash ou Python sont acceptables pour les tâches ponctuelles).
• Une expérience avec des environnements bare metal, de virtualisation ou HPC (par exemple, Fluidstack, Coreweave, Vast) est un atout majeur.
• Excellentes compétences en résolution de problèmes et en communication, avec la capacité d'expliquer les problèmes techniques clairement et patiemment aux parties prenantes techniques et non techniques.
• Esprit axé sur le client et passion pour la résolution efficace des problèmes et l'amélioration de la fiabilité du système.
• Capacité à travailler selon des rotations de garde et à gérer des situations sous pression avec une approche structurée et calme.
• Engagement à respecter des SLA stricts pour la reconnaissance des problèmes, le tri et la première réponse.…
Source : Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Mistral fournit des solutions d'IA complètes : des modèles de pointe aux outils de développement, applications et calcul. Nous collaborons avec des entreprises qui s'attaquent aux problèmes les plus difficiles dans des secteurs à enjeux élevés tels que la finance, l'industrie manufacturière, la défense, la santé et le secteur public, en co-créant des systèmes d'IA personnalisés qu'elles peuvent exécuter selon leurs conditions.
Nous sommes une équipe dynamique et collaborative passionnée par l’IA et son potentiel à transformer la société. Notre main-d’œuvre diversifiée s’épanouit dans des environnements compétitifs et s’engage à stimuler l’innovation. Nos équipes sont réparties entre l'Europe, l'Amérique du Nord, l'Asie et le Moyen-Orient. Nous sommes créatifs, modestes et avons l'esprit d'équipe.
Mistral AI construit une nouvelle équipe de support informatique pour garantir la fiabilité, les performances et l'évolutivité de nos clusters GPU dans un environnement Kubernetes. En tant que l'un des membres fondateurs de cette équipe, vous jouerez un rôle central dans l'élaboration de ses processus, de ses normes et de sa culture.
Dans ce rôle de support hybride L1/L2, vous serez le premier point de contact pour les clients et les équipes internes, fournissant des conseils techniques, un dépannage et une résolution des problèmes pour les demandes liées au calcul. Vous servirez également de point d’escalade pour les problèmes complexes, en tirant parti de votre connaissance approfondie des systèmes, de votre expertise Kubernetes et de vos compétences en débogage opérationnel pour garantir le bon fonctionnement de nos charges de travail d’IA à grande échelle.
Il s'agit d'un rôle axé sur le support qui allie l'administration système, la communication avec le client et l'expertise en matière d'infrastructure informatique. Bien que le codage ne soit pas l’objectif principal, la connaissance de Go pour le débogage et l’automatisation est un plus.
Principales responsabilités
Point de contact du premier client
• Agir en tant que premier interlocuteur pour les clients et les équipes internes, en fournissant des réponses rapides et efficaces aux demandes liées au calcul.
• Trier et hiérarchiser les demandes entrantes, en veillant à ce que les SLA soient respectés pour l'accusé de réception, la première réponse et la résolution.
• Rassemblez et analysez les détails du problème initial (par exemple, journaux, messages d'erreur, métriques système) pour diagnostiquer efficacement les problèmes.
• Fournir des conseils clairs et exploitables aux clients et aux utilisateurs internes, y compris des solutions de contournement temporaires le cas échéant.
Assistance technique
• Servir de point d'escalade L2 pour les problèmes liés à Linux, Kubernetes et à l'infrastructure de calcul, en fournissant un dépannage technique approfondi pour :
• Charges de travail GPU/TPU (par exemple, erreurs CUDA, fuites de mémoire, échecs de tâches).
• Clusters Kubernetes (par exemple, pannes de pods, pannes de nœuds, mauvaises configurations du réseau).
• Environnements nus et cloud (par exemple, AWS EC2, machines virtuelles GCP, clusters HPC).
• Diagnostiquer et résoudre les goulots d'étranglement des performances, les pannes matérielles et les conflits de ressources dans les systèmes distribués.
• Analysez les métriques, les journaux et les traces du système (par exemple, dmesg, journalctl, nvidia-smi, Prometheus, Grafana) pour identifier les causes profondes des problèmes.
• Participer à des rotations de garde pour fournir une assistance 24h/24 et 7j/7 pour les systèmes informatiques critiques.
• Agréable : optimisez les configurations système (par exemple, paramètres du noyau, réglage du système de fichiers, paramètres réseau) pour le calcul haute performance (HPC) et les charges de travail d'IA.
Kubernetes et conteneurisation
• Déboguer les clusters Kubernetes en mettant l'accent sur :
• Problèmes de pods et de nœuds (par exemple, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Mise en réseau et stockage (par exemple, plugins CNI, PersistentVolumes, StorageClasses).
• Gestion des ressources (par exemple, demandes/limites, classes QOS, affinité de nœud).
• Résoudre les problèmes d'exécution des conteneurs (Docker, containersd) tels que les échecs d'extraction d'images, la conformité OCI ou les erreurs d'exécution.
• Collaborer avec les équipes SRE pour comprendre et améliorer les outils IaC (Terraform, Ansible) et Go existants.
Documentation et amélioration des processus
• Créer et maintenir des runbooks, des playbooks et une documentation interne pour les problèmes de calcul courants (par exemple, débogage GPU, dépannage Kubernetes).
• Contribuer aux autopsies avec des suivis concrets pour prévenir les incidents récurrents.
• Former les équipes internes aux meilleures pratiques en matière d'infrastructure de calcul et de débogage.
• Aider à définir et affiner les processus de support en tant que membre fondateur de la nouvelle équipe Compute Support.
Ce que nous recherchons
Compétences et expérience requises
• Plus de 5 ans d'expérience dans l'administration système, le support technique ou les opérations d'infrastructure, avec un fort accent sur les environnements gourmands en calcul (bare metal, cloud, HPC ou virtualisation).
• Expertise approfondie de Linux/Unix :
• Débogage des problèmes au niveau du noyau (par exemple, tueur de MOO, goulots d'étranglement d'E/S, limitation du processeur).
• Optimisation des performances (par exemple, sysctl, ulimit, optimisations du système de fichiers).
• Dépannage réseau (par exemple, iptables, tcpdump, DNS, NFS, SSH).
• Gestion du stockage (par exemple, LVM, RAID, NVMe, stockage local GPU).
• Une expérience pratique de Kubernetes est obligatoire :
• Débogage des pods, des nœuds et des clusters (par exemple, kubectlscribe, kubectl logs, crictl).
• Mise en réseau et stockage (par exemple, plugins CNI, PersistentVolumes).
• Gestion des ressources (par exemple, demandes/limites, classes QOS).
• Familiarité avec la conteneurisation (Docker, containersd) et connaissance de base de l'IaC. Maîtrise des outils de surveillance (Prometheus, Grafana, ELK, OpenTelemetry).
• Compétences de base en script/automatisation (de préférence Go, mais Bash ou Python sont acceptables pour les tâches ponctuelles).
• Une expérience avec des environnements bare metal, de virtualisation ou HPC (par exemple, Fluidstack, Coreweave, Vast) est un atout majeur.
• Excellentes compétences en résolution de problèmes et en communication, avec la capacité d'expliquer les problèmes techniques clairement et patiemment aux parties prenantes techniques et non techniques.
• Esprit axé sur le client et passion pour la résolution efficace des problèmes et l'amélioration de la fiabilité du système.
• Capacité à travailler selon des rotations de garde et à gérer des situations sous pression avec une approche structurée et calme.
• Engagement à respecter des SLA stricts pour la reconnaissance des problèmes, le tri et la première réponse.…
Source : Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Mistral.ai
Emplacement
Paris, France
Annonce fournie par Mistral.ai.