Emploi
De la source partenaire
Ingénieur d'inférence déployé vers l'avant
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Non
- Entreprise
- Tensordyne
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
À propos de Tensordyne
Tensordyne développe une nouvelle classe de systèmes d'inférence d'IA conçus pour un déploiement hautes performances et économe en énergie des charges de travail d'IA générative les plus exigeantes au monde.
Notre plate-forme combine du silicium spécialement conçu, de nouvelles mathématiques d'IA, un réseau optimisé et une architecture de mémoire dans un système étroitement intégré spécialement conçu pour l'inférence d'IA à grande échelle. Nous travaillons avec des hyperscalers, des Neoclouds, des développeurs de modèles frontières, des entreprises et des partenaires d'infrastructure opérant à la pointe de l'IA.
Alors que Tensordyne passe du développement de systèmes à la mise en place du silicium, à la validation client, aux déploiements bêta et au déploiement en production, nous construisons l'organisation technique client qui se situera directement entre nos équipes d'ingénierie et les entreprises déployant la plate-forme.
Résumé du rôle
Nous recherchons un ingénieur d'inférence déployé vers l'avant qui combine une expertise approfondie des systèmes d'IA avec un fort instinct client. Cette personne sera responsable du cheminement depuis une charge de travail client ou une demande de modèle jusqu'à un résultat technique et, si nécessaire, vers un modèle optimisé fonctionnant avec succès sur le matériel et les logiciels Tensordyne.
Ce rôle se situe à l'intersection de l'architecture du modèle, des performances d'inférence, de l'optimisation des systèmes, des outils de développement et du déploiement client. Vous travaillerez directement avec l'ingénierie tout en faisant également office de pont technique entre le produit, BizDev, les ventes et les clients.
Ce que tu feras
• Transformez les charges de travail des clients en réponses rapides et crédibles en matière de performances grâce au profilage et à l'analyse comparative. Définissez des KPI pertinents, comparez-les aux références concurrentes et maintenez notre méthodologie d'évaluation à jour avec des références externes.
• Activation et optimisation des modèles : convertissez et affichez les modèles clients sur la pile Tensordyne, validez la qualité numérique, identifiez les goulots d'étranglement en matière de performances et travaillez avec les équipes du compilateur, de l'exécution, du noyau et du système pour améliorer les résultats.
• Déploiement/ingénierie avancée : travailler directement avec les clients et les partenaires sur les PoC techniques, l'intégration, le déploiement et le débogage ; traduire les exigences en critères d'acceptation mesurables pour la qualité, la latence, le débit et d'autres KPI pertinents.
• Suivez la précision du profilage sur le matériel en comparant continuellement les résultats de profilage/simulation avec les déploiements matériels réels, expliquez les lacunes matérielles et signalez aux équipes propriétaires les fonctionnalités manquantes dans le compilateur, le SDK, le serveur d'inférence, la gestion du cache KV ou les systèmes adjacents.
• Transformez les apprentissages répétés spécifiques au client en outils, documentations, tests de référence ou améliorations de produits réutilisables.
Qualifications de base
• Forte expérience pratique avec les modèles d'IA et les systèmes d'inférence, en particulier les LLM denses et MoE (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM), et les modèles VLM, vocaux et de diffusion.
• Solides compétences Python et PyTorch et capacité à comprendre et modifier le code du modèle.
• Expérience du profilage, de l'analyse comparative ou de l'optimisation de l'inférence de modèle et du raisonnement sur la latence, le débit, la mémoire et l'utilisation.
• Solides compétences en résolution de problèmes et en communication, avec la capacité de résoudre des problèmes techniques ambigus au-delà des limites de l'équipe.
• Maîtrise de l'utilisation d'outils de développement basés sur l'IA (par exemple, Claude Code, Cursor).
Des atouts forts
• Expérience avec les piles de service et de déploiement LLM telles que vLLM, SGLang ou des systèmes similaires.
• Expérience de travail direct avec des clients ou des partenaires techniques externes.
• Expérience dans la mise en place de modèles sur de nouveaux accélérateurs ou sur du matériel non standard, y compris le débogage des performances au-delà des limites du framework/runtime/hardware.
• Expérience pratique des techniques ou des environnements d'inférence de production tels que la quantification, l'inférence distribuée ou Kubernetes.
• Expérience de navigation et de contribution aux bases de code Rust.
Valeurs Tensordyne
• Voyez grand. Poursuivre des objectifs techniques et commerciaux ambitieux.
• Viser l'excellence. La qualité compte dans tout ce que nous construisons et livrons.
• Possédez-le et faites-le. Assumer vos responsabilités et générer des résultats.
• Travailler avec intégrité. Soyez direct, transparent et respectueux.
• Gagnez en équipe. Rendez les gens autour de vous plus efficaces.
• Valorisez différentes perspectives. Les équipes les plus solides remettent en question les hypothèses et apportent une expérience diversifiée aux problèmes difficiles.
Tensordyne est un employeur garantissant l'égalité des chances. Nous pensons que les équipes diversifiées sont mieux équipées pour résoudre des problèmes complexes et créer une technologie exceptionnelle. Tous les candidats qualifiés seront pris en considération pour un emploi sans égard à l'âge, à la couleur, à l'identité ou à l'expression de genre, à l'état civil, à l'origine nationale, au handicap, au statut d'ancien combattant protégé, à la race, à la religion, à la grossesse, à l'orientation sexuelle ou à toute autre caractéristique protégée par les lois, réglementations et ordonnances applicables.
Note aux agences de recrutement : veuillez ne pas contacter les employés ou les dirigeants de Tensordyne au sujet de ce rôle. Nous n'acceptons pas les CV d'agence non sollicités et ne sommes pas responsables des frais associés aux soumissions non sollicitées.
Trouvez plus d'emplois anglophones en Allemagne sur Arbeitnow
Source : Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-481912)
Tensordyne développe une nouvelle classe de systèmes d'inférence d'IA conçus pour un déploiement hautes performances et économe en énergie des charges de travail d'IA générative les plus exigeantes au monde.
Notre plate-forme combine du silicium spécialement conçu, de nouvelles mathématiques d'IA, un réseau optimisé et une architecture de mémoire dans un système étroitement intégré spécialement conçu pour l'inférence d'IA à grande échelle. Nous travaillons avec des hyperscalers, des Neoclouds, des développeurs de modèles frontières, des entreprises et des partenaires d'infrastructure opérant à la pointe de l'IA.
Alors que Tensordyne passe du développement de systèmes à la mise en place du silicium, à la validation client, aux déploiements bêta et au déploiement en production, nous construisons l'organisation technique client qui se situera directement entre nos équipes d'ingénierie et les entreprises déployant la plate-forme.
Résumé du rôle
Nous recherchons un ingénieur d'inférence déployé vers l'avant qui combine une expertise approfondie des systèmes d'IA avec un fort instinct client. Cette personne sera responsable du cheminement depuis une charge de travail client ou une demande de modèle jusqu'à un résultat technique et, si nécessaire, vers un modèle optimisé fonctionnant avec succès sur le matériel et les logiciels Tensordyne.
Ce rôle se situe à l'intersection de l'architecture du modèle, des performances d'inférence, de l'optimisation des systèmes, des outils de développement et du déploiement client. Vous travaillerez directement avec l'ingénierie tout en faisant également office de pont technique entre le produit, BizDev, les ventes et les clients.
Ce que tu feras
• Transformez les charges de travail des clients en réponses rapides et crédibles en matière de performances grâce au profilage et à l'analyse comparative. Définissez des KPI pertinents, comparez-les aux références concurrentes et maintenez notre méthodologie d'évaluation à jour avec des références externes.
• Activation et optimisation des modèles : convertissez et affichez les modèles clients sur la pile Tensordyne, validez la qualité numérique, identifiez les goulots d'étranglement en matière de performances et travaillez avec les équipes du compilateur, de l'exécution, du noyau et du système pour améliorer les résultats.
• Déploiement/ingénierie avancée : travailler directement avec les clients et les partenaires sur les PoC techniques, l'intégration, le déploiement et le débogage ; traduire les exigences en critères d'acceptation mesurables pour la qualité, la latence, le débit et d'autres KPI pertinents.
• Suivez la précision du profilage sur le matériel en comparant continuellement les résultats de profilage/simulation avec les déploiements matériels réels, expliquez les lacunes matérielles et signalez aux équipes propriétaires les fonctionnalités manquantes dans le compilateur, le SDK, le serveur d'inférence, la gestion du cache KV ou les systèmes adjacents.
• Transformez les apprentissages répétés spécifiques au client en outils, documentations, tests de référence ou améliorations de produits réutilisables.
Qualifications de base
• Forte expérience pratique avec les modèles d'IA et les systèmes d'inférence, en particulier les LLM denses et MoE (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM), et les modèles VLM, vocaux et de diffusion.
• Solides compétences Python et PyTorch et capacité à comprendre et modifier le code du modèle.
• Expérience du profilage, de l'analyse comparative ou de l'optimisation de l'inférence de modèle et du raisonnement sur la latence, le débit, la mémoire et l'utilisation.
• Solides compétences en résolution de problèmes et en communication, avec la capacité de résoudre des problèmes techniques ambigus au-delà des limites de l'équipe.
• Maîtrise de l'utilisation d'outils de développement basés sur l'IA (par exemple, Claude Code, Cursor).
Des atouts forts
• Expérience avec les piles de service et de déploiement LLM telles que vLLM, SGLang ou des systèmes similaires.
• Expérience de travail direct avec des clients ou des partenaires techniques externes.
• Expérience dans la mise en place de modèles sur de nouveaux accélérateurs ou sur du matériel non standard, y compris le débogage des performances au-delà des limites du framework/runtime/hardware.
• Expérience pratique des techniques ou des environnements d'inférence de production tels que la quantification, l'inférence distribuée ou Kubernetes.
• Expérience de navigation et de contribution aux bases de code Rust.
Valeurs Tensordyne
• Voyez grand. Poursuivre des objectifs techniques et commerciaux ambitieux.
• Viser l'excellence. La qualité compte dans tout ce que nous construisons et livrons.
• Possédez-le et faites-le. Assumer vos responsabilités et générer des résultats.
• Travailler avec intégrité. Soyez direct, transparent et respectueux.
• Gagnez en équipe. Rendez les gens autour de vous plus efficaces.
• Valorisez différentes perspectives. Les équipes les plus solides remettent en question les hypothèses et apportent une expérience diversifiée aux problèmes difficiles.
Tensordyne est un employeur garantissant l'égalité des chances. Nous pensons que les équipes diversifiées sont mieux équipées pour résoudre des problèmes complexes et créer une technologie exceptionnelle. Tous les candidats qualifiés seront pris en considération pour un emploi sans égard à l'âge, à la couleur, à l'identité ou à l'expression de genre, à l'état civil, à l'origine nationale, au handicap, au statut d'ancien combattant protégé, à la race, à la religion, à la grossesse, à l'orientation sexuelle ou à toute autre caractéristique protégée par les lois, réglementations et ordonnances applicables.
Note aux agences de recrutement : veuillez ne pas contacter les employés ou les dirigeants de Tensordyne au sujet de ce rôle. Nous n'acceptons pas les CV d'agence non sollicités et ne sommes pas responsables des frais associés aux soumissions non sollicitées.
Trouvez plus d'emplois anglophones en Allemagne sur Arbeitnow
Source : Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-481912)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Tensordyne
Emplacement
Munich, Allemagne
Annonce fournie par Tensordyne.