Empleo
Del feed del socio
Ingeniero compilador agente
Precio a consultar
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- No
- Empresa
- Kog
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
ACERCA DE KOG
Kog crea una pila de inferencia codiseñada para agentes de IA en tiempo real en GPU de centros de datos estándar, que abarca arquitectura de modelo, motor de inferencia, compiladores y núcleos de GPU de bajo nivel.
En el lado del modelo, desarrollamos Laneformer 2B y Delayed Tensor Parallelism (DTP), una arquitectura Transformer que superpone la comunicación con cálculos útiles y transmisión de peso.
En el lado de los sistemas, Kog Inference Engine ejecuta esta pila en GPU de centros de datos AMD y NVIDIA estándar.
Kog genera 3500 tokens/s por solicitud en 8 GPU AMD MI300X y 2100 tokens/s por solicitud en 8 GPU NVIDIA H200, en FP16 con tamaño de lote 1, con la cuantificación y la decodificación especulativa deshabilitadas.
Nuestro próximo gran proyecto es AGCO, nuestro compilador agente. AGCO está diseñado para optimizar LLM en diferentes GPU y objetivos de optimización, incluida una inferencia muy rápida.
El equipo está formado por 10 personas, entre ellas 9 ingenieros e investigadores y 4 doctores.
Pruébelo en Playground.kog.ai. Lea los detalles técnicos en el blog de Kog Labs.
EN QUÉ TRABAJARÁS
Trabajará directamente en AGCO.
El objetivo es construir un sistema que pueda explorar formas de optimizar la ejecución de LLM, generar cambios, compilarlos, verificar su corrección, ejecutarlos en hardware real, medir los resultados y utilizar esta retroalimentación para guiar la próxima optimización.
Contribuirás en áreas como:
• Compilador y diseño de IR para representar y transformar cálculos LLM.
• Pases de optimización, rebaja y generación de código.
• Búsqueda de métodos para explorar diferentes implementaciones y estrategias de ejecución.
• Verificación y controles de corrección de los cambios generados.
• Ejecución de GPU, creación de perfiles y optimización del rendimiento.
• Inferencia LLM entre operadores, memoria, paralelismo y comunicación.
• Bucles de optimización que conectan los cambios generados con mediciones en GPU reales.
Una dirección que estamos explorando combina un IR, un verificador, un compilador y un optimizador de búsqueda. Planeamos comenzar con problemas enfocados, construir prototipos funcionales y ampliar el sistema a partir de lo que aprendemos.
Su área principal dependerá de su experiencia, habilidades e intereses. Puede centrarse más en compiladores, sistemas GPU o inferencia LLM mientras trabaja en estrecha colaboración con personas de toda la pila.
LO QUE BUSCAMOS
Buscamos ingenieros con profunda experiencia técnica y trabajo original en al menos un área relevante para AGCO.
La experiencia relevante incluye:
• Ingeniería del compilador, incluidos pases de optimización, IR, reducción, generación de código, LLVM o MLIR.
• Programación de GPU con CUDA, HIP, Metal, Vulkan o tecnologías similares.
• Trabajo de rendimiento de GPU que involucra núcleos, memoria, sincronización, creación de perfiles o comportamiento del hardware.
• Motores de inferencia LLM y optimización del rendimiento.
• Atención, MoE, paralelismo, comunicación u otras partes a nivel de sistemas de la ejecución de LLM.
• Verificación formal, verificación de equivalencia, SAT/SMT o métodos relacionados.
• Sistemas que generan, buscan, prueban, comparan u optimizan código automáticamente.
Nos preocupamos por lo que usted construyó personalmente y las decisiones técnicas detrás de ello. Los candidatos fuertes pueden explicar el problema, su enfoque, las alternativas que exploraron y cómo midieron el resultado.
Revisamos el trabajo técnico durante el proceso. Puede ser un código público, una contribución inicial, un artículo, una tesis, un proyecto técnico o un artículo detallado basado en un trabajo que pueda compartir.
QUE OFRECEMOS
Te unirás a un pequeño equipo que creará AGCO como parte central de la tecnología de Kog.
• Trabajar en la intersección de compiladores, sistemas GPU e inferencia LLM.
• Acceso directo a ingenieros que trabajan en toda la pila de inferencia.
• Un bucle rápido desde una idea de optimización hasta la compilación, ejecución, verificación y medición en GPU reales.
• La oportunidad de profundizar en su área técnica más fuerte mientras se expande a otras partes de la pila.
• Alta propiedad sobre las decisiones técnicas y los sistemas que darán forma a cómo Kog optimiza la inferencia LLM.
Este puesto tiene su sede en París y estamos buscando candidatos que puedan trasladarse a París y trabajar en estrecha colaboración con el equipo.
Encuentre empleo en Francia en Arbeitnow
Fuente: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Kog crea una pila de inferencia codiseñada para agentes de IA en tiempo real en GPU de centros de datos estándar, que abarca arquitectura de modelo, motor de inferencia, compiladores y núcleos de GPU de bajo nivel.
En el lado del modelo, desarrollamos Laneformer 2B y Delayed Tensor Parallelism (DTP), una arquitectura Transformer que superpone la comunicación con cálculos útiles y transmisión de peso.
En el lado de los sistemas, Kog Inference Engine ejecuta esta pila en GPU de centros de datos AMD y NVIDIA estándar.
Kog genera 3500 tokens/s por solicitud en 8 GPU AMD MI300X y 2100 tokens/s por solicitud en 8 GPU NVIDIA H200, en FP16 con tamaño de lote 1, con la cuantificación y la decodificación especulativa deshabilitadas.
Nuestro próximo gran proyecto es AGCO, nuestro compilador agente. AGCO está diseñado para optimizar LLM en diferentes GPU y objetivos de optimización, incluida una inferencia muy rápida.
El equipo está formado por 10 personas, entre ellas 9 ingenieros e investigadores y 4 doctores.
Pruébelo en Playground.kog.ai. Lea los detalles técnicos en el blog de Kog Labs.
EN QUÉ TRABAJARÁS
Trabajará directamente en AGCO.
El objetivo es construir un sistema que pueda explorar formas de optimizar la ejecución de LLM, generar cambios, compilarlos, verificar su corrección, ejecutarlos en hardware real, medir los resultados y utilizar esta retroalimentación para guiar la próxima optimización.
Contribuirás en áreas como:
• Compilador y diseño de IR para representar y transformar cálculos LLM.
• Pases de optimización, rebaja y generación de código.
• Búsqueda de métodos para explorar diferentes implementaciones y estrategias de ejecución.
• Verificación y controles de corrección de los cambios generados.
• Ejecución de GPU, creación de perfiles y optimización del rendimiento.
• Inferencia LLM entre operadores, memoria, paralelismo y comunicación.
• Bucles de optimización que conectan los cambios generados con mediciones en GPU reales.
Una dirección que estamos explorando combina un IR, un verificador, un compilador y un optimizador de búsqueda. Planeamos comenzar con problemas enfocados, construir prototipos funcionales y ampliar el sistema a partir de lo que aprendemos.
Su área principal dependerá de su experiencia, habilidades e intereses. Puede centrarse más en compiladores, sistemas GPU o inferencia LLM mientras trabaja en estrecha colaboración con personas de toda la pila.
LO QUE BUSCAMOS
Buscamos ingenieros con profunda experiencia técnica y trabajo original en al menos un área relevante para AGCO.
La experiencia relevante incluye:
• Ingeniería del compilador, incluidos pases de optimización, IR, reducción, generación de código, LLVM o MLIR.
• Programación de GPU con CUDA, HIP, Metal, Vulkan o tecnologías similares.
• Trabajo de rendimiento de GPU que involucra núcleos, memoria, sincronización, creación de perfiles o comportamiento del hardware.
• Motores de inferencia LLM y optimización del rendimiento.
• Atención, MoE, paralelismo, comunicación u otras partes a nivel de sistemas de la ejecución de LLM.
• Verificación formal, verificación de equivalencia, SAT/SMT o métodos relacionados.
• Sistemas que generan, buscan, prueban, comparan u optimizan código automáticamente.
Nos preocupamos por lo que usted construyó personalmente y las decisiones técnicas detrás de ello. Los candidatos fuertes pueden explicar el problema, su enfoque, las alternativas que exploraron y cómo midieron el resultado.
Revisamos el trabajo técnico durante el proceso. Puede ser un código público, una contribución inicial, un artículo, una tesis, un proyecto técnico o un artículo detallado basado en un trabajo que pueda compartir.
QUE OFRECEMOS
Te unirás a un pequeño equipo que creará AGCO como parte central de la tecnología de Kog.
• Trabajar en la intersección de compiladores, sistemas GPU e inferencia LLM.
• Acceso directo a ingenieros que trabajan en toda la pila de inferencia.
• Un bucle rápido desde una idea de optimización hasta la compilación, ejecución, verificación y medición en GPU reales.
• La oportunidad de profundizar en su área técnica más fuerte mientras se expande a otras partes de la pila.
• Alta propiedad sobre las decisiones técnicas y los sistemas que darán forma a cómo Kog optimiza la inferencia LLM.
Este puesto tiene su sede en París y estamos buscando candidatos que puedan trasladarse a París y trabajar en estrecha colaboración con el equipo.
Encuentre empleo en Francia en Arbeitnow
Fuente: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Fuente: Kog
Ubicación
París, Francia
Publicación proporcionada por Kog.