Emploi
De la source partenaire
Ingénieur de compilateur agent
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Non
- Entreprise
- Kog
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
À PROPOS DE KOG
Kog construit une pile d'inférence co-conçue pour les agents d'IA en temps réel sur des GPU de centre de données standard, couvrant l'architecture de modèle, le moteur d'inférence, les compilateurs et les noyaux GPU de bas niveau.
Du côté du modèle, nous avons développé Laneformer 2B et Delayed Tensor Parallelism (DTP), une architecture Transformer qui chevauche la communication avec des calculs utiles et un streaming de poids.
Du côté des systèmes, le moteur d'inférence Kog exécute cette pile sur des GPU de centre de données AMD et NVIDIA standard.
Kog génère 3 500 jetons/s par requête sur 8 GPU AMD MI300X et 2 100 jetons/s par requête sur 8 GPU NVIDIA H200, en FP16 à la taille de lot 1, avec quantification et décodage spéculatif désactivés.
Notre prochain projet majeur est AGCO, notre compilateur agent. AGCO est conçu pour optimiser les LLM sur différents GPU et cibles d'optimisation, y compris une inférence très rapide.
L'équipe compte 10 personnes, dont 9 ingénieurs et chercheurs et 4 docteurs.
Testez-le sur Playground.kog.ai. Lisez les détails techniques sur le blog Kog Labs.
SUR CE QUE VOUS TRAVAILLEZ
Vous travaillerez directement sur AGCO.
L'objectif est de créer un système capable d'explorer les moyens d'optimiser l'exécution du LLM, de générer des modifications, de les compiler, de vérifier leur exactitude, de les exécuter sur du matériel réel, de mesurer les résultats et d'utiliser ces commentaires pour guider la prochaine optimisation.
Vous contribuerez à des domaines tels que :
• Compilateur et conception IR pour représenter et transformer les calculs LLM.
• Passes d'optimisation, abaissement et génération de code.
• Méthodes de recherche pour explorer différentes mises en œuvre et stratégies d'exécution.
• Vérification et contrôle de l'exactitude des modifications générées.
• Exécution GPU, profilage et optimisation des performances.
• Inférence LLM à travers les opérateurs, la mémoire, le parallélisme et la communication.
• Boucles d'optimisation qui relient les modifications générées aux mesures sur de vrais GPU.
Une direction que nous explorons combine un IR, un vérificateur, un compilateur et un optimiseur de recherche. Nous prévoyons de commencer par des problèmes ciblés, de construire des prototypes fonctionnels et d'étendre le système à partir de ce que nous avons appris.
Votre domaine principal dépendra de votre expérience, de vos compétences et de vos intérêts. Vous pouvez vous concentrer davantage sur les compilateurs, les systèmes GPU ou l'inférence LLM tout en travaillant en étroite collaboration avec des personnes de l'ensemble de la pile.
CE QUE NOUS RECHERCHONS
Nous recherchons des ingénieurs possédant une expertise technique approfondie et un travail original dans au moins un domaine pertinent pour AGCO.
L'expérience pertinente comprend :
• Ingénierie du compilateur, y compris les passes d'optimisation, les IR, l'abaissement, la génération de code, LLVM ou MLIR.
• Programmation GPU avec CUDA, HIP, Metal, Vulkan ou technologies similaires.
• Travail sur les performances du GPU impliquant les noyaux, la mémoire, la synchronisation, le profilage ou le comportement du matériel.
• Moteurs d'inférence LLM et optimisation des performances.
• Attention, MoE, parallélisme, communication ou autres éléments au niveau système de l'exécution du LLM.
• Vérification formelle, vérification d'équivalence, SAT/SMT ou méthodes associées.
• Des systèmes qui génèrent, recherchent, testent, évaluent ou optimisent automatiquement le code.
Nous nous soucions de ce que vous avez personnellement construit et des décisions techniques qui se cachent derrière. Les candidats forts peuvent expliquer le problème, leur approche, les alternatives qu’ils ont explorées et comment ils ont mesuré le résultat.
Nous examinons le travail technique au cours du processus. Il peut s'agir d'un code public, d'une contribution en amont, d'un article, d'une thèse, d'un projet technique ou d'un texte détaillé basé sur un travail que vous pouvez partager.
CE QUE NOUS PROPOSONS
Vous rejoindrez une petite équipe de consolidation d'AGCO en tant qu'élément central de la technologie Kog.
• Travaillez à l'intersection des compilateurs, des systèmes GPU et de l'inférence LLM.
• Accès direct aux ingénieurs travaillant sur l'ensemble de la pile d'inférence.
• Une boucle rapide depuis une idée d'optimisation jusqu'à la compilation, l'exécution, la vérification et la mesure sur de vrais GPU.
• L'opportunité d'approfondir votre domaine technique le plus fort tout en vous développant dans les autres parties de la pile.
• Forte appropriation des décisions techniques et des systèmes qui façonneront la manière dont Kog optimise l'inférence LLM.
Ce poste est basé à Paris et nous recherchons des candidats capables de s'installer à Paris et de travailler en étroite collaboration avec l'équipe.
Trouvez un emploi en France sur Arbeitnow
Source : Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Kog construit une pile d'inférence co-conçue pour les agents d'IA en temps réel sur des GPU de centre de données standard, couvrant l'architecture de modèle, le moteur d'inférence, les compilateurs et les noyaux GPU de bas niveau.
Du côté du modèle, nous avons développé Laneformer 2B et Delayed Tensor Parallelism (DTP), une architecture Transformer qui chevauche la communication avec des calculs utiles et un streaming de poids.
Du côté des systèmes, le moteur d'inférence Kog exécute cette pile sur des GPU de centre de données AMD et NVIDIA standard.
Kog génère 3 500 jetons/s par requête sur 8 GPU AMD MI300X et 2 100 jetons/s par requête sur 8 GPU NVIDIA H200, en FP16 à la taille de lot 1, avec quantification et décodage spéculatif désactivés.
Notre prochain projet majeur est AGCO, notre compilateur agent. AGCO est conçu pour optimiser les LLM sur différents GPU et cibles d'optimisation, y compris une inférence très rapide.
L'équipe compte 10 personnes, dont 9 ingénieurs et chercheurs et 4 docteurs.
Testez-le sur Playground.kog.ai. Lisez les détails techniques sur le blog Kog Labs.
SUR CE QUE VOUS TRAVAILLEZ
Vous travaillerez directement sur AGCO.
L'objectif est de créer un système capable d'explorer les moyens d'optimiser l'exécution du LLM, de générer des modifications, de les compiler, de vérifier leur exactitude, de les exécuter sur du matériel réel, de mesurer les résultats et d'utiliser ces commentaires pour guider la prochaine optimisation.
Vous contribuerez à des domaines tels que :
• Compilateur et conception IR pour représenter et transformer les calculs LLM.
• Passes d'optimisation, abaissement et génération de code.
• Méthodes de recherche pour explorer différentes mises en œuvre et stratégies d'exécution.
• Vérification et contrôle de l'exactitude des modifications générées.
• Exécution GPU, profilage et optimisation des performances.
• Inférence LLM à travers les opérateurs, la mémoire, le parallélisme et la communication.
• Boucles d'optimisation qui relient les modifications générées aux mesures sur de vrais GPU.
Une direction que nous explorons combine un IR, un vérificateur, un compilateur et un optimiseur de recherche. Nous prévoyons de commencer par des problèmes ciblés, de construire des prototypes fonctionnels et d'étendre le système à partir de ce que nous avons appris.
Votre domaine principal dépendra de votre expérience, de vos compétences et de vos intérêts. Vous pouvez vous concentrer davantage sur les compilateurs, les systèmes GPU ou l'inférence LLM tout en travaillant en étroite collaboration avec des personnes de l'ensemble de la pile.
CE QUE NOUS RECHERCHONS
Nous recherchons des ingénieurs possédant une expertise technique approfondie et un travail original dans au moins un domaine pertinent pour AGCO.
L'expérience pertinente comprend :
• Ingénierie du compilateur, y compris les passes d'optimisation, les IR, l'abaissement, la génération de code, LLVM ou MLIR.
• Programmation GPU avec CUDA, HIP, Metal, Vulkan ou technologies similaires.
• Travail sur les performances du GPU impliquant les noyaux, la mémoire, la synchronisation, le profilage ou le comportement du matériel.
• Moteurs d'inférence LLM et optimisation des performances.
• Attention, MoE, parallélisme, communication ou autres éléments au niveau système de l'exécution du LLM.
• Vérification formelle, vérification d'équivalence, SAT/SMT ou méthodes associées.
• Des systèmes qui génèrent, recherchent, testent, évaluent ou optimisent automatiquement le code.
Nous nous soucions de ce que vous avez personnellement construit et des décisions techniques qui se cachent derrière. Les candidats forts peuvent expliquer le problème, leur approche, les alternatives qu’ils ont explorées et comment ils ont mesuré le résultat.
Nous examinons le travail technique au cours du processus. Il peut s'agir d'un code public, d'une contribution en amont, d'un article, d'une thèse, d'un projet technique ou d'un texte détaillé basé sur un travail que vous pouvez partager.
CE QUE NOUS PROPOSONS
Vous rejoindrez une petite équipe de consolidation d'AGCO en tant qu'élément central de la technologie Kog.
• Travaillez à l'intersection des compilateurs, des systèmes GPU et de l'inférence LLM.
• Accès direct aux ingénieurs travaillant sur l'ensemble de la pile d'inférence.
• Une boucle rapide depuis une idée d'optimisation jusqu'à la compilation, l'exécution, la vérification et la mesure sur de vrais GPU.
• L'opportunité d'approfondir votre domaine technique le plus fort tout en vous développant dans les autres parties de la pile.
• Forte appropriation des décisions techniques et des systèmes qui façonneront la manière dont Kog optimise l'inférence LLM.
Ce poste est basé à Paris et nous recherchons des candidats capables de s'installer à Paris et de travailler en étroite collaboration avec l'équipe.
Trouvez un emploi en France sur Arbeitnow
Source : Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Kog
Emplacement
Paris, France
Annonce fournie par Kog.