Emploi
De la source partenaire
Ingénieur de recherche en IA (optimisation du noyau et de l'inférence)
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Non
- Entreprise
- Jobgether
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
Ce poste est répertorié au nom d'une entreprise partenaire, qui gère toutes les candidatures et les prochaines étapes. Notre partenaire recherche un ingénieur de recherche en IA (optimisation du noyau et de l'inférence) basé au Royaume-Uni.
Vous travaillerez à l'intersection de la recherche sur l'IA, de l'ingénierie des systèmes et de l'inférence de modèles hautes performances.
Votre objectif sera de développer et d'optimiser des architectures de service de modèles pour les systèmes d'IA avancés dans une gamme d'environnements matériels.
Vous releverez les défis liés à la latence, au débit, à l'efficacité de la mémoire et à l'évolutivité, y compris le déploiement sur des appareils mobiles et périphériques aux ressources limitées.
Ce rôle combine recherche pratique et ingénierie de bas niveau, vous donnant la possibilité de développer de nouvelles stratégies d'inférence et de nouveaux noyaux GPU.
Vous travaillerez avec des architectures complexes couvrant le texte, l'image, l'audio, les modèles de diffusion et les transformateurs de vision.
Votre travail impliquera des analyses comparatives rigoureuses, des tests de production et une optimisation itérative pour traduire la recherche en améliorations mesurables des performances.
Vous collaborerez avec des équipes interfonctionnelles dans un environnement distant hautement technique visant à repousser les limites des systèmes d'IA efficaces.
Responsabilités
• Concevoir et déployer des architectures avancées de service de modèles optimisées pour un débit élevé, une faible latence et une utilisation efficace de la mémoire.
• Développer des pipelines d'inférence capables de fonctionner efficacement dans divers environnements, y compris les appareils mobiles aux ressources limitées et les plates-formes de périphérie.
• Établissez des objectifs de performances clairs couvrant la latence de réponse, la vitesse de génération des jetons, le débit, l'empreinte mémoire et la fiabilité.
• Créez et exécutez des tests d'inférence contrôlés dans des environnements de simulation et de production, en suivant la latence, le débit, la consommation de mémoire et les taux d'erreur.
• Créer et maintenir des ensembles de données représentatifs et des scénarios de simulation pour évaluer les performances du modèle dans des conditions réelles et de ressources limitées.
• Identifiez les goulots d'étranglement en matière de calcul et de mémoire dans les pipelines d'inférence et mettez en œuvre des solutions impliquant le traitement par lots, la mise en réseau, la gestion de la mémoire et d'autres optimisations au niveau du système.
• Développer des noyaux GPU personnalisés et des shaders de calcul pour le matériel mobile, y compris des solutions écrites en Metal Shading Language (MSL).
• Appliquer des techniques avancées d'optimisation d'inférence telles que l'élagage, la quantification, Flash Attention, la mise en cache KV et le décodage spéculatif.
• Concevoir et optimiser des systèmes d'inférence distribués à l'aide d'approches telles que le parallélisme tenseur, le parallélisme pipeline et le parallélisme expert pour les charges de travail GPU à grande échelle.
• Travailler avec des équipes d'ingénierie et de recherche interfonctionnelles pour intégrer des cadres d'inférence optimisés dans les applications de production et de périphériques de pointe.
• Définir des méthodologies d'évaluation, documenter les résultats expérimentaux, comparer les performances par rapport aux références établies et affiner continuellement les stratégies d'optimisation.
• Surveiller les performances de production et utiliser des recherches empiriques pour identifier les opportunités d'améliorations supplémentaires en termes d'évolutivité, d'efficacité et de fiabilité.
Exigences :
• Diplôme en informatique ou dans un domaine technique connexe ; un doctorat en PNL, en apprentissage automatique ou dans une discipline connexe est très pertinent, en particulier avec de solides antécédents en recherche sur l'IA et des publications lors de conférences de premier plan.
• Expertise éprouvée en Metal Shading Language (MSL), y compris la possibilité d'écrire des shaders de calcul personnalisés à partir de zéro.
• Expérience démontrée de l'optimisation du noyau de bas niveau et de l'optimisation des inférences sur des appareils mobiles ou autres appareils à ressources limitées.
• Expérience en matière d'améliorations mesurables de la latence d'inférence, du débit et de l'empreinte mémoire pour les applications spécifiques à un domaine.
• Compréhension approfondie des architectures modernes de service de modèles, des moteurs d'inférence et des techniques d'optimisation pour le déploiement d'IA hautes performances.
• Solide expérience dans l'écriture de noyaux GPU pour les appareils mobiles tels que les smartphones.
• Expérience pratique dans le développement et le déploiement de pipelines d'inférence de bout en bout, de l'optimisation de modèles à l'intégration de production sur du matériel contraint.
• Forte capacité à appliquer la recherche empirique et l'expérimentation systématique pour résoudre les problèmes de latence, de calcul et de mémoire.
• Expérience dans la conception de cadres d'évaluation et d'analyse comparative robustes pour les systèmes d'inférence.
• Connaissance des techniques d'inférence distribuée, notamment le parallélisme tenseur, le parallélisme pipeline et le parallélisme expert pour les clusters GPU à grande échelle.
• Compréhension approfondie des fondements mathématiques et de l'architecture des modèles de diffusion et des transformateurs de vision.
• Familiarité avec les techniques modernes d'optimisation d'inférence, notamment l'élagage, la quantification, Flash Attention, l'optimisation du cache KV et le décodage spéculatif tel que EAGLE.
• Solides capacités d'analyse et de résolution de problèmes, avec une capacité à enquêter sur les goulots d'étranglement des systèmes complexes et à transformer les résultats de la recherche en solutions d'ingénierie pratiques.
• Excellentes compétences en communication en anglais et capacité à collaborer efficacement avec des équipes techniques distribuées et interfonctionnelles.
Avantages:
• Possibilité de travailler sur des systèmes d'IA avancés couvrant le service de modèles, l'optimisation de l'inférence, l'informatique mobile, le déploiement en périphérie et l'inférence distribuée à grande échelle.
• Environnement de travail à distance avec une équipe internationale.
• Exposition à la recherche de pointe sur l'IA et aux défis pratiques d'ingénierie des systèmes.
• Possibilité de contribuer à une infrastructure critique en termes de performances où les améliorations peuvent avoir un impact mesurable sur les applications d'IA du monde réel.
• Environnement collaboratif combinant expérimentation axée sur la recherche et ingénierie pratique.
• Possibilité de travailler avec des architectures de modèles avancées, notamment des modèles de diffusion, des transformateurs de vision et des systèmes multimodaux.…
Source : Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-uk-187924)
Vous travaillerez à l'intersection de la recherche sur l'IA, de l'ingénierie des systèmes et de l'inférence de modèles hautes performances.
Votre objectif sera de développer et d'optimiser des architectures de service de modèles pour les systèmes d'IA avancés dans une gamme d'environnements matériels.
Vous releverez les défis liés à la latence, au débit, à l'efficacité de la mémoire et à l'évolutivité, y compris le déploiement sur des appareils mobiles et périphériques aux ressources limitées.
Ce rôle combine recherche pratique et ingénierie de bas niveau, vous donnant la possibilité de développer de nouvelles stratégies d'inférence et de nouveaux noyaux GPU.
Vous travaillerez avec des architectures complexes couvrant le texte, l'image, l'audio, les modèles de diffusion et les transformateurs de vision.
Votre travail impliquera des analyses comparatives rigoureuses, des tests de production et une optimisation itérative pour traduire la recherche en améliorations mesurables des performances.
Vous collaborerez avec des équipes interfonctionnelles dans un environnement distant hautement technique visant à repousser les limites des systèmes d'IA efficaces.
Responsabilités
• Concevoir et déployer des architectures avancées de service de modèles optimisées pour un débit élevé, une faible latence et une utilisation efficace de la mémoire.
• Développer des pipelines d'inférence capables de fonctionner efficacement dans divers environnements, y compris les appareils mobiles aux ressources limitées et les plates-formes de périphérie.
• Établissez des objectifs de performances clairs couvrant la latence de réponse, la vitesse de génération des jetons, le débit, l'empreinte mémoire et la fiabilité.
• Créez et exécutez des tests d'inférence contrôlés dans des environnements de simulation et de production, en suivant la latence, le débit, la consommation de mémoire et les taux d'erreur.
• Créer et maintenir des ensembles de données représentatifs et des scénarios de simulation pour évaluer les performances du modèle dans des conditions réelles et de ressources limitées.
• Identifiez les goulots d'étranglement en matière de calcul et de mémoire dans les pipelines d'inférence et mettez en œuvre des solutions impliquant le traitement par lots, la mise en réseau, la gestion de la mémoire et d'autres optimisations au niveau du système.
• Développer des noyaux GPU personnalisés et des shaders de calcul pour le matériel mobile, y compris des solutions écrites en Metal Shading Language (MSL).
• Appliquer des techniques avancées d'optimisation d'inférence telles que l'élagage, la quantification, Flash Attention, la mise en cache KV et le décodage spéculatif.
• Concevoir et optimiser des systèmes d'inférence distribués à l'aide d'approches telles que le parallélisme tenseur, le parallélisme pipeline et le parallélisme expert pour les charges de travail GPU à grande échelle.
• Travailler avec des équipes d'ingénierie et de recherche interfonctionnelles pour intégrer des cadres d'inférence optimisés dans les applications de production et de périphériques de pointe.
• Définir des méthodologies d'évaluation, documenter les résultats expérimentaux, comparer les performances par rapport aux références établies et affiner continuellement les stratégies d'optimisation.
• Surveiller les performances de production et utiliser des recherches empiriques pour identifier les opportunités d'améliorations supplémentaires en termes d'évolutivité, d'efficacité et de fiabilité.
Exigences :
• Diplôme en informatique ou dans un domaine technique connexe ; un doctorat en PNL, en apprentissage automatique ou dans une discipline connexe est très pertinent, en particulier avec de solides antécédents en recherche sur l'IA et des publications lors de conférences de premier plan.
• Expertise éprouvée en Metal Shading Language (MSL), y compris la possibilité d'écrire des shaders de calcul personnalisés à partir de zéro.
• Expérience démontrée de l'optimisation du noyau de bas niveau et de l'optimisation des inférences sur des appareils mobiles ou autres appareils à ressources limitées.
• Expérience en matière d'améliorations mesurables de la latence d'inférence, du débit et de l'empreinte mémoire pour les applications spécifiques à un domaine.
• Compréhension approfondie des architectures modernes de service de modèles, des moteurs d'inférence et des techniques d'optimisation pour le déploiement d'IA hautes performances.
• Solide expérience dans l'écriture de noyaux GPU pour les appareils mobiles tels que les smartphones.
• Expérience pratique dans le développement et le déploiement de pipelines d'inférence de bout en bout, de l'optimisation de modèles à l'intégration de production sur du matériel contraint.
• Forte capacité à appliquer la recherche empirique et l'expérimentation systématique pour résoudre les problèmes de latence, de calcul et de mémoire.
• Expérience dans la conception de cadres d'évaluation et d'analyse comparative robustes pour les systèmes d'inférence.
• Connaissance des techniques d'inférence distribuée, notamment le parallélisme tenseur, le parallélisme pipeline et le parallélisme expert pour les clusters GPU à grande échelle.
• Compréhension approfondie des fondements mathématiques et de l'architecture des modèles de diffusion et des transformateurs de vision.
• Familiarité avec les techniques modernes d'optimisation d'inférence, notamment l'élagage, la quantification, Flash Attention, l'optimisation du cache KV et le décodage spéculatif tel que EAGLE.
• Solides capacités d'analyse et de résolution de problèmes, avec une capacité à enquêter sur les goulots d'étranglement des systèmes complexes et à transformer les résultats de la recherche en solutions d'ingénierie pratiques.
• Excellentes compétences en communication en anglais et capacité à collaborer efficacement avec des équipes techniques distribuées et interfonctionnelles.
Avantages:
• Possibilité de travailler sur des systèmes d'IA avancés couvrant le service de modèles, l'optimisation de l'inférence, l'informatique mobile, le déploiement en périphérie et l'inférence distribuée à grande échelle.
• Environnement de travail à distance avec une équipe internationale.
• Exposition à la recherche de pointe sur l'IA et aux défis pratiques d'ingénierie des systèmes.
• Possibilité de contribuer à une infrastructure critique en termes de performances où les améliorations peuvent avoir un impact mesurable sur les applications d'IA du monde réel.
• Environnement collaboratif combinant expérimentation axée sur la recherche et ingénierie pratique.
• Possibilité de travailler avec des architectures de modèles avancées, notamment des modèles de diffusion, des transformateurs de vision et des systèmes multimodaux.…
Source : Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-uk-187924)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Jobgether
Annonce fournie par Jobgether.