Emploi
De la source partenaire
Ingénieur ML, Infrastructure
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Non
- Entreprise
- Prior Labs
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
Qui nous sommes
Les modèles de fondation ont transformé le texte et les images. Les données structurées – le format de données le plus important et le plus conséquent au monde – sont restées intactes jusqu'à présent. Ce que les LLM ont fait pour le langage, nous le faisons pour les tableaux.
Nous avons été les pionniers des modèles de base tabulaires : TabPFN v2 était un article de couverture de Nature, a dépassé plus de 3,5 millions de téléchargements et plus de 7 500 étoiles GitHub, et fonctionne en production depuis la détection des maladies pulmonaires avec Oxford Cancer Analytics jusqu'à la prévention des pannes de train avec Hitachi. Les problèmes les plus difficiles – millions de lignes, inférence en temps réel, modalités entièrement nouvelles – sont toujours ouverts et personne d’autre n’y travaille à ce niveau.
Nous sommes une petite équipe très sélective de plus de 40 personnes issues de Google, DeepMind, Meta, Apple, Amazon, Jane Street et CERN, dirigée par Frank Hutter, Noah Hollmann et Sauraj Gambhir, et conseillée par Bernhard Schölkopf et Yann LeCun, lauréat du prix Turing.
En juillet 2026, moins de 18 mois après notre pré-amorçage de 9 millions d'euros, nous avons rejoint SAP en tant que laboratoire d'IA de pointe indépendant - mêmes modèles d'équipe, de mission et de pondération ouverte, désormais soutenus par plus d'un milliard d'euros sur quatre ans.
À propos du rôle
Nous dépensons des dizaines de millions par an en calcul GPU pour former des modèles de base tabulaires. Ce n’est pas un objectif, c’est ce que nous appliquons aujourd’hui, et cela augmente. La personne qui possède cette infrastructure prend des décisions valant des millions de dollars : architecture du cluster, efficacité de la planification, stratégie des fournisseurs, sélection du matériel. Un mauvais appel coûte six chiffres.
Aujourd'hui, nous exécutons Slurm sur GCP sur plusieurs clusters. Nous nous adaptons à une infrastructure multicluster et multifournisseur et évaluons les nouvelles générations de matériel au fur et à mesure de leur mise en ligne. Vous possédez la pile complète, depuis les opérations de cluster et l'optimisation des coûts jusqu'aux performances de formation distribuées et à la couche d'outils qui permet aux chercheurs d'avancer rapidement. Vous travaillez directement avec l'équipe de recherche et comprenez suffisamment bien ce qu'elle fait pour prendre des décisions en matière d'infrastructure qui les aident réellement. Et ce n’est pas un pur rôle de support. Nous opérons dans un environnement ouvert. Si vous avez la prochaine architecture tabulaire SOTA dans votre manche, allez-y et entraînez-la.
Ce sur quoi vous travaillerez :
• Posséder et faire évoluer une infrastructure GPU multicluster. Slurm sur GCP aujourd'hui, multi-fournisseurs et nouveau matériel demain. Architecture, planification, fiabilité, optimisation des coûts
• Piloter l'utilisation du GPU et le débit de formation : profilage, optimisation de la mémoire, goulots d'étranglement de communication, débogage au niveau système de la formation distribuée sur de grandes séries.
• Concevoir la prochaine génération de notre infrastructure : orchestration multicluster, nouvelles générations de GPU, diversification des fournisseurs, planification des capacités face aux demandes de calcul croissantes.
• Créer la couche de productivité des développeurs : pipelines CI, suivi des expériences, registre de modèles, traitement des données et outils internes qui maintiennent une vitesse d'itération de recherche élevée.
• Posséder le budget de calcul. Vous comprenez le coût par FLOP selon les fournisseurs et le matériel, et vous détestez le gaspillage de calcul
Pile technologique : Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Vous pourriez être un bon candidat si vous avez :
• 3 ans et plus dans la création et l'exploitation d'une infrastructure GPU de production ou de systèmes de formation distribués à grande échelle. Dans un grand laboratoire d'IA, une startup de ML bien financée ou un environnement HPC
• Expérience pratique approfondie de Slurm et de la gestion de clusters. Vous avez débogué les échecs de planification, optimisé l'utilisation des charges de travail GPU multi-locataires et exploité une infrastructure où les temps d'arrêt ont un coût réel.
• Réflexion système de niveau expert : bande passante mémoire, profilage GPU. Vous raisonnez sur le matériel, pas sur les configurations
• Python fort et maîtrise réelle des composants internes de PyTorch. Assez pour profiler une exécution de formation et déterminer si le goulot d'étranglement est dû au chargement des données, à la communication ou au calcul.
• Antécédents de prise de décisions en matière d'infrastructure qui ont amélioré de manière mesurable le débit de formation ou la rentabilité.
• Solides compétences en outils d'IA. Vous utilisez couramment Claude Code, Cursor ou similaire pour avancer rapidement sans sacrifier la qualité.
Bonus :
• Expérience de fonctionnement avec des dépenses GPU à l'échelle de plusieurs dizaines de millions
• Expérience d'infrastructure multi-cloud ou hybride HPC/cloud
• Expérience avec Triton, CUDA ou noyau personnalisé
• Expérience de l'évolution d'un cluster unique vers une orchestration multicluster
• Outils de suivi des expériences de création en arrière-plan, de registre de modèles ou de pipeline ML
La vie dans les laboratoires antérieurs
Vous travaillerez aux côtés de chercheurs et de constructeurs qui mettent la barre très haut - dans la qualité de leur travail et dans la manière dont ils travaillent les uns avec les autres. Nous avançons vite et prenons quand même le temps de bien faire les choses.
Nos équipes sont basées à Berlin, Fribourg et New York. Lorsque vous travaillez sur quelque chose d'aussi dur que TabPFN, il est important d'être dans la même pièce. Mais les gens formidables viennent de partout et, dans des cas exceptionnels, nous sommes ouverts au travail à distance, ce qui signifie généralement des déplacements fréquents dans l'un de nos bureaux. Où que vous soyez basé, toute l'entreprise se réunit régulièrement hors site pour construire et célébrer ensemble.
Nos engagements
Les meilleurs produits et équipes sont construits par des personnes ayant des perspectives et des parcours très variés. Nous acceptons les candidatures de toutes identités et de tous horizons - surtout si vous vous êtes déjà senti découragé en « ne cochant pas toutes les cases » - et offrons l'égalité des chances quels que soient votre sexe, votre orientation sexuelle, votre origine, votre handicap ou tout autre trait qui fait de vous ce que vous êtes.
Nous nous soucions de la façon dont vos données sont traitées - consultez notre page Confidentialité des données de recrutement
Trouvez plus d'emplois anglophones en Allemagne sur Arbeitnow
Source : Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Les modèles de fondation ont transformé le texte et les images. Les données structurées – le format de données le plus important et le plus conséquent au monde – sont restées intactes jusqu'à présent. Ce que les LLM ont fait pour le langage, nous le faisons pour les tableaux.
Nous avons été les pionniers des modèles de base tabulaires : TabPFN v2 était un article de couverture de Nature, a dépassé plus de 3,5 millions de téléchargements et plus de 7 500 étoiles GitHub, et fonctionne en production depuis la détection des maladies pulmonaires avec Oxford Cancer Analytics jusqu'à la prévention des pannes de train avec Hitachi. Les problèmes les plus difficiles – millions de lignes, inférence en temps réel, modalités entièrement nouvelles – sont toujours ouverts et personne d’autre n’y travaille à ce niveau.
Nous sommes une petite équipe très sélective de plus de 40 personnes issues de Google, DeepMind, Meta, Apple, Amazon, Jane Street et CERN, dirigée par Frank Hutter, Noah Hollmann et Sauraj Gambhir, et conseillée par Bernhard Schölkopf et Yann LeCun, lauréat du prix Turing.
En juillet 2026, moins de 18 mois après notre pré-amorçage de 9 millions d'euros, nous avons rejoint SAP en tant que laboratoire d'IA de pointe indépendant - mêmes modèles d'équipe, de mission et de pondération ouverte, désormais soutenus par plus d'un milliard d'euros sur quatre ans.
À propos du rôle
Nous dépensons des dizaines de millions par an en calcul GPU pour former des modèles de base tabulaires. Ce n’est pas un objectif, c’est ce que nous appliquons aujourd’hui, et cela augmente. La personne qui possède cette infrastructure prend des décisions valant des millions de dollars : architecture du cluster, efficacité de la planification, stratégie des fournisseurs, sélection du matériel. Un mauvais appel coûte six chiffres.
Aujourd'hui, nous exécutons Slurm sur GCP sur plusieurs clusters. Nous nous adaptons à une infrastructure multicluster et multifournisseur et évaluons les nouvelles générations de matériel au fur et à mesure de leur mise en ligne. Vous possédez la pile complète, depuis les opérations de cluster et l'optimisation des coûts jusqu'aux performances de formation distribuées et à la couche d'outils qui permet aux chercheurs d'avancer rapidement. Vous travaillez directement avec l'équipe de recherche et comprenez suffisamment bien ce qu'elle fait pour prendre des décisions en matière d'infrastructure qui les aident réellement. Et ce n’est pas un pur rôle de support. Nous opérons dans un environnement ouvert. Si vous avez la prochaine architecture tabulaire SOTA dans votre manche, allez-y et entraînez-la.
Ce sur quoi vous travaillerez :
• Posséder et faire évoluer une infrastructure GPU multicluster. Slurm sur GCP aujourd'hui, multi-fournisseurs et nouveau matériel demain. Architecture, planification, fiabilité, optimisation des coûts
• Piloter l'utilisation du GPU et le débit de formation : profilage, optimisation de la mémoire, goulots d'étranglement de communication, débogage au niveau système de la formation distribuée sur de grandes séries.
• Concevoir la prochaine génération de notre infrastructure : orchestration multicluster, nouvelles générations de GPU, diversification des fournisseurs, planification des capacités face aux demandes de calcul croissantes.
• Créer la couche de productivité des développeurs : pipelines CI, suivi des expériences, registre de modèles, traitement des données et outils internes qui maintiennent une vitesse d'itération de recherche élevée.
• Posséder le budget de calcul. Vous comprenez le coût par FLOP selon les fournisseurs et le matériel, et vous détestez le gaspillage de calcul
Pile technologique : Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Vous pourriez être un bon candidat si vous avez :
• 3 ans et plus dans la création et l'exploitation d'une infrastructure GPU de production ou de systèmes de formation distribués à grande échelle. Dans un grand laboratoire d'IA, une startup de ML bien financée ou un environnement HPC
• Expérience pratique approfondie de Slurm et de la gestion de clusters. Vous avez débogué les échecs de planification, optimisé l'utilisation des charges de travail GPU multi-locataires et exploité une infrastructure où les temps d'arrêt ont un coût réel.
• Réflexion système de niveau expert : bande passante mémoire, profilage GPU. Vous raisonnez sur le matériel, pas sur les configurations
• Python fort et maîtrise réelle des composants internes de PyTorch. Assez pour profiler une exécution de formation et déterminer si le goulot d'étranglement est dû au chargement des données, à la communication ou au calcul.
• Antécédents de prise de décisions en matière d'infrastructure qui ont amélioré de manière mesurable le débit de formation ou la rentabilité.
• Solides compétences en outils d'IA. Vous utilisez couramment Claude Code, Cursor ou similaire pour avancer rapidement sans sacrifier la qualité.
Bonus :
• Expérience de fonctionnement avec des dépenses GPU à l'échelle de plusieurs dizaines de millions
• Expérience d'infrastructure multi-cloud ou hybride HPC/cloud
• Expérience avec Triton, CUDA ou noyau personnalisé
• Expérience de l'évolution d'un cluster unique vers une orchestration multicluster
• Outils de suivi des expériences de création en arrière-plan, de registre de modèles ou de pipeline ML
La vie dans les laboratoires antérieurs
Vous travaillerez aux côtés de chercheurs et de constructeurs qui mettent la barre très haut - dans la qualité de leur travail et dans la manière dont ils travaillent les uns avec les autres. Nous avançons vite et prenons quand même le temps de bien faire les choses.
Nos équipes sont basées à Berlin, Fribourg et New York. Lorsque vous travaillez sur quelque chose d'aussi dur que TabPFN, il est important d'être dans la même pièce. Mais les gens formidables viennent de partout et, dans des cas exceptionnels, nous sommes ouverts au travail à distance, ce qui signifie généralement des déplacements fréquents dans l'un de nos bureaux. Où que vous soyez basé, toute l'entreprise se réunit régulièrement hors site pour construire et célébrer ensemble.
Nos engagements
Les meilleurs produits et équipes sont construits par des personnes ayant des perspectives et des parcours très variés. Nous acceptons les candidatures de toutes identités et de tous horizons - surtout si vous vous êtes déjà senti découragé en « ne cochant pas toutes les cases » - et offrons l'égalité des chances quels que soient votre sexe, votre orientation sexuelle, votre origine, votre handicap ou tout autre trait qui fait de vous ce que vous êtes.
Nous nous soucions de la façon dont vos données sont traitées - consultez notre page Confidentialité des données de recrutement
Trouvez plus d'emplois anglophones en Allemagne sur Arbeitnow
Source : Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Prior Labs
Emplacement
Berlin, Allemagne
Annonce fournie par Prior Labs.