Empleo
Del feed del socio
Ingeniero de Investigación de IA (Optimización de Kernel e Inferencia)
Precio a consultar
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- No
- Empresa
- Jobgether
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
Este puesto se cotiza en nombre de una empresa asociada, que gestiona todas las solicitudes y los próximos pasos. Nuestro socio está buscando un ingeniero de investigación de IA (optimización de kernel e inferencia) con sede en Suiza.
Trabajará en la intersección de la investigación de IA, la ingeniería de sistemas y la inferencia de modelos de alto rendimiento.
Su atención se centrará en desarrollar y optimizar arquitecturas de servicio de modelos para sistemas avanzados de IA en una variedad de entornos de hardware.
Afrontará desafíos relacionados con la latencia, el rendimiento, la eficiencia de la memoria y la escalabilidad, incluida la implementación en dispositivos móviles y de borde con recursos limitados.
El puesto combina investigación práctica con ingeniería de bajo nivel, lo que le brinda la oportunidad de desarrollar estrategias de inferencia y núcleos de GPU novedosos.
Trabajará con arquitecturas complejas que abarcan texto, imagen, audio, modelos de difusión y transformadores de visión.
Su trabajo implicará evaluaciones comparativas rigurosas, pruebas de producción y optimización iterativa para traducir la investigación en mejoras de rendimiento mensurables.
Colaborará con equipos multifuncionales en un entorno remoto altamente técnico centrado en ampliar los límites de los sistemas de IA eficientes.
Responsabilidades
• Diseñe e implemente arquitecturas avanzadas de servicio de modelos optimizadas para un alto rendimiento, baja latencia y utilización eficiente de la memoria.
• Desarrollar canales de inferencia capaces de operar eficazmente en diversos entornos, incluidos dispositivos móviles y plataformas de borde con recursos limitados.
• Establecer objetivos de rendimiento claros que cubran la latencia de respuesta, la velocidad de generación de tokens, el rendimiento, el uso de memoria y la confiabilidad.
• Cree y ejecute puntos de referencia de inferencia controlados en entornos simulados y de producción, rastreando la latencia, el rendimiento, el consumo de memoria y las tasas de error.
• Crear y mantener conjuntos de datos representativos y escenarios de simulación para evaluar el rendimiento del modelo en condiciones del mundo real y con recursos limitados.
• Identificar cuellos de botella computacionales y de memoria en los canales de inferencia e implementar soluciones que incluyan procesamiento por lotes, redes, administración de memoria y otras optimizaciones a nivel de sistema.
• Desarrollar kernels de GPU personalizados y sombreadores informáticos para hardware móvil, incluidas soluciones escritas en Metal Shading Language (MSL).
• Aplicar técnicas avanzadas de optimización de inferencias, como poda, cuantificación, atención Flash, almacenamiento en caché KV y decodificación especulativa.
• Diseñe y optimice sistemas de inferencia distribuida utilizando enfoques como el paralelismo tensorial, el paralelismo de canalización y el paralelismo experto para cargas de trabajo de GPU a gran escala.
• Trabajar con equipos multifuncionales de ingeniería e investigación para integrar marcos de inferencia optimizados en aplicaciones de producción y dispositivos de borde.
• Definir metodologías de evaluación, documentar resultados experimentales, comparar el rendimiento con puntos de referencia establecidos y perfeccionar continuamente las estrategias de optimización.
• Monitorear el desempeño de la producción y utilizar investigaciones empíricas para identificar oportunidades para futuras mejoras en escalabilidad, eficiencia y confiabilidad.
Requisitos:
• Licenciatura en Informática o carrera técnica afín; un doctorado en PNL, aprendizaje automático o una disciplina relacionada es muy relevante, particularmente con una sólida trayectoria en investigación de IA y publicaciones en conferencias líderes.
• Experiencia comprobada en Metal Shading Language (MSL), incluida la capacidad de escribir sombreadores informáticos personalizados desde cero.
• Experiencia demostrada con optimización del kernel de bajo nivel y optimización de inferencia en dispositivos móviles u otros dispositivos con recursos limitados.
• Historial de entrega de mejoras mensurables en latencia de inferencia, rendimiento y uso de memoria para aplicaciones de dominios específicos.
• Comprensión profunda de las arquitecturas modernas de servicio de modelos, motores de inferencia y técnicas de optimización para la implementación de IA de alto rendimiento.
• Gran experiencia escribiendo kernels de GPU para dispositivos móviles como teléfonos inteligentes.
• Experiencia práctica desarrollando e implementando canales de inferencia de extremo a extremo, desde la optimización de modelos hasta la integración de producción en hardware restringido.
• Gran capacidad para aplicar investigación empírica y experimentación sistemática para resolver desafíos de latencia, computacionales y de memoria.
• Experiencia en el diseño de marcos robustos de evaluación y evaluación comparativa para sistemas de inferencia.
• Conocimiento de técnicas de inferencia distribuida, incluido el paralelismo tensorial, el paralelismo de canalización y el paralelismo experto para clústeres de GPU a gran escala.
• Comprensión profunda de los fundamentos matemáticos y la arquitectura de los modelos de difusión y transformadores de visión.
• Familiaridad con técnicas modernas de optimización de inferencias, incluidas poda, cuantificación, atención Flash, optimización de caché KV y decodificación especulativa como EAGLE.
• Fuertes capacidades analíticas y de resolución de problemas, con capacidad para investigar cuellos de botella de sistemas complejos y convertir los resultados de la investigación en soluciones prácticas de ingeniería.
• Excelentes habilidades de comunicación en inglés y capacidad para colaborar eficazmente con equipos técnicos distribuidos y multifuncionales.
Beneficios:
• Oportunidad de trabajar en sistemas avanzados de IA que abarcan servicio de modelos, optimización de inferencia, computación móvil, implementación de borde e inferencia distribuida a gran escala.
• Entorno de trabajo remoto con un equipo internacional.
• Exposición a investigaciones de IA de vanguardia y desafíos prácticos de ingeniería de sistemas.
• Oportunidad de contribuir a la infraestructura de rendimiento crítico donde las mejoras pueden tener un impacto mensurable en las aplicaciones de IA del mundo real.
• Entorno colaborativo que combina la experimentación impulsada por la investigación con la ingeniería práctica.
• Oportunidad de trabajar con arquitecturas de modelos avanzados, incluidos modelos de difusión, transformadores de visión y sistemas multimodales.…
Fuente: Arbeitnow (https://www.arbeitnow.ch/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-switzerland-456279)
Trabajará en la intersección de la investigación de IA, la ingeniería de sistemas y la inferencia de modelos de alto rendimiento.
Su atención se centrará en desarrollar y optimizar arquitecturas de servicio de modelos para sistemas avanzados de IA en una variedad de entornos de hardware.
Afrontará desafíos relacionados con la latencia, el rendimiento, la eficiencia de la memoria y la escalabilidad, incluida la implementación en dispositivos móviles y de borde con recursos limitados.
El puesto combina investigación práctica con ingeniería de bajo nivel, lo que le brinda la oportunidad de desarrollar estrategias de inferencia y núcleos de GPU novedosos.
Trabajará con arquitecturas complejas que abarcan texto, imagen, audio, modelos de difusión y transformadores de visión.
Su trabajo implicará evaluaciones comparativas rigurosas, pruebas de producción y optimización iterativa para traducir la investigación en mejoras de rendimiento mensurables.
Colaborará con equipos multifuncionales en un entorno remoto altamente técnico centrado en ampliar los límites de los sistemas de IA eficientes.
Responsabilidades
• Diseñe e implemente arquitecturas avanzadas de servicio de modelos optimizadas para un alto rendimiento, baja latencia y utilización eficiente de la memoria.
• Desarrollar canales de inferencia capaces de operar eficazmente en diversos entornos, incluidos dispositivos móviles y plataformas de borde con recursos limitados.
• Establecer objetivos de rendimiento claros que cubran la latencia de respuesta, la velocidad de generación de tokens, el rendimiento, el uso de memoria y la confiabilidad.
• Cree y ejecute puntos de referencia de inferencia controlados en entornos simulados y de producción, rastreando la latencia, el rendimiento, el consumo de memoria y las tasas de error.
• Crear y mantener conjuntos de datos representativos y escenarios de simulación para evaluar el rendimiento del modelo en condiciones del mundo real y con recursos limitados.
• Identificar cuellos de botella computacionales y de memoria en los canales de inferencia e implementar soluciones que incluyan procesamiento por lotes, redes, administración de memoria y otras optimizaciones a nivel de sistema.
• Desarrollar kernels de GPU personalizados y sombreadores informáticos para hardware móvil, incluidas soluciones escritas en Metal Shading Language (MSL).
• Aplicar técnicas avanzadas de optimización de inferencias, como poda, cuantificación, atención Flash, almacenamiento en caché KV y decodificación especulativa.
• Diseñe y optimice sistemas de inferencia distribuida utilizando enfoques como el paralelismo tensorial, el paralelismo de canalización y el paralelismo experto para cargas de trabajo de GPU a gran escala.
• Trabajar con equipos multifuncionales de ingeniería e investigación para integrar marcos de inferencia optimizados en aplicaciones de producción y dispositivos de borde.
• Definir metodologías de evaluación, documentar resultados experimentales, comparar el rendimiento con puntos de referencia establecidos y perfeccionar continuamente las estrategias de optimización.
• Monitorear el desempeño de la producción y utilizar investigaciones empíricas para identificar oportunidades para futuras mejoras en escalabilidad, eficiencia y confiabilidad.
Requisitos:
• Licenciatura en Informática o carrera técnica afín; un doctorado en PNL, aprendizaje automático o una disciplina relacionada es muy relevante, particularmente con una sólida trayectoria en investigación de IA y publicaciones en conferencias líderes.
• Experiencia comprobada en Metal Shading Language (MSL), incluida la capacidad de escribir sombreadores informáticos personalizados desde cero.
• Experiencia demostrada con optimización del kernel de bajo nivel y optimización de inferencia en dispositivos móviles u otros dispositivos con recursos limitados.
• Historial de entrega de mejoras mensurables en latencia de inferencia, rendimiento y uso de memoria para aplicaciones de dominios específicos.
• Comprensión profunda de las arquitecturas modernas de servicio de modelos, motores de inferencia y técnicas de optimización para la implementación de IA de alto rendimiento.
• Gran experiencia escribiendo kernels de GPU para dispositivos móviles como teléfonos inteligentes.
• Experiencia práctica desarrollando e implementando canales de inferencia de extremo a extremo, desde la optimización de modelos hasta la integración de producción en hardware restringido.
• Gran capacidad para aplicar investigación empírica y experimentación sistemática para resolver desafíos de latencia, computacionales y de memoria.
• Experiencia en el diseño de marcos robustos de evaluación y evaluación comparativa para sistemas de inferencia.
• Conocimiento de técnicas de inferencia distribuida, incluido el paralelismo tensorial, el paralelismo de canalización y el paralelismo experto para clústeres de GPU a gran escala.
• Comprensión profunda de los fundamentos matemáticos y la arquitectura de los modelos de difusión y transformadores de visión.
• Familiaridad con técnicas modernas de optimización de inferencias, incluidas poda, cuantificación, atención Flash, optimización de caché KV y decodificación especulativa como EAGLE.
• Fuertes capacidades analíticas y de resolución de problemas, con capacidad para investigar cuellos de botella de sistemas complejos y convertir los resultados de la investigación en soluciones prácticas de ingeniería.
• Excelentes habilidades de comunicación en inglés y capacidad para colaborar eficazmente con equipos técnicos distribuidos y multifuncionales.
Beneficios:
• Oportunidad de trabajar en sistemas avanzados de IA que abarcan servicio de modelos, optimización de inferencia, computación móvil, implementación de borde e inferencia distribuida a gran escala.
• Entorno de trabajo remoto con un equipo internacional.
• Exposición a investigaciones de IA de vanguardia y desafíos prácticos de ingeniería de sistemas.
• Oportunidad de contribuir a la infraestructura de rendimiento crítico donde las mejoras pueden tener un impacto mensurable en las aplicaciones de IA del mundo real.
• Entorno colaborativo que combina la experimentación impulsada por la investigación con la ingeniería práctica.
• Oportunidad de trabajar con arquitecturas de modelos avanzados, incluidos modelos de difusión, transformadores de visión y sistemas multimodales.…
Fuente: Arbeitnow (https://www.arbeitnow.ch/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-switzerland-456279)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Fuente: Jobgether
Publicación proporcionada por Jobgether.