Empleo
Del feed del socio
Ingeniero ML, Infraestructura
Precio a consultar
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- No
- Empresa
- Prior Labs
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
Quienes somos
Los modelos de fundación transformaron texto e imágenes. Los datos estructurados, el formato de datos más grande y de mayor trascendencia del mundo, se mantuvieron intactos hasta ahora. Lo que los LLM hicieron por el lenguaje, lo estamos haciendo por las tablas.
Fuimos pioneros en los modelos de base tabular: TabPFN v2 fue una noticia de portada de Nature, ha superado más de 3,5 millones de descargas y más de 7500 estrellas de GitHub, y se ejecuta en producción desde la detección de enfermedades pulmonares con Oxford Cancer Analytics hasta la prevención de fallas de trenes con Hitachi. Los problemas más difíciles (millones de filas, inferencia en tiempo real, modalidades completamente nuevas) todavía están abiertos y nadie más está trabajando en ellos a este nivel.
Somos un equipo pequeño y altamente selectivo de más de 40 personas con experiencia en Google, DeepMind, Meta, Apple, Amazon, Jane Street y CERN, liderados por Frank Hutter, Noah Hollmann y Sauraj Gambhir, y asesorados por Bernhard Schölkopf y el ganador del Premio Turing Yann LeCun.
En julio de 2026, menos de 18 meses después de nuestra inversión inicial de 9 millones de euros, nos unimos a SAP como un laboratorio de inteligencia artificial de vanguardia independiente: el mismo equipo, misión y modelos abiertos, ahora respaldados por más de mil millones de euros durante cuatro años.
Acerca del rol
Gastamos decenas de millones al año en computación GPU para entrenar modelos de base tabular. Ese no es un objetivo, es lo que estamos ejecutando hoy y está creciendo. La persona propietaria de esta infraestructura toma decisiones que valen millones de dólares: arquitectura del clúster, eficiencia de la programación, estrategia del proveedor, selección de hardware. Una llamada equivocada cuesta seis cifras.
Hoy ejecutamos Slurm en GCP en varios clústeres. Estamos escalando a una infraestructura de múltiples clústeres y múltiples proveedores y evaluando nuevas generaciones de hardware a medida que se ponen en línea. Usted es dueño de toda la pila, desde las operaciones del clúster y la optimización de costos hasta el rendimiento de la capacitación distribuida y la capa de herramientas que mantiene a los investigadores avanzando rápidamente. Trabaja directamente con el equipo de investigación y comprende lo que están haciendo lo suficientemente bien como para tomar decisiones de infraestructura que realmente los ayuden. Y este no es un rol puramente de apoyo. Operamos en un entorno abierto. Si tiene la próxima arquitectura tabular SOTA bajo la manga, continúe y entrénela.
En qué trabajarás:
• Poseer y desarrollar una infraestructura de GPU multiclúster. Slurm en GCP hoy, multiproveedor y nuevo hardware mañana. Arquitectura, programación, confiabilidad, optimización de costos.
• Impulsar la utilización de la GPU y el rendimiento de la capacitación: creación de perfiles, optimización de la memoria, cuellos de botella en la comunicación, depuración a nivel de sistemas de la capacitación distribuida en ejecuciones grandes.
• Diseñe la próxima generación de nuestra infraestructura: orquestación de múltiples clústeres, nuevas generaciones de GPU, diversificación de proveedores, planificación de capacidad frente a las crecientes demandas informáticas.
• Construir la capa de productividad del desarrollador: canales de CI, seguimiento de experimentos, registro de modelos, procesamiento de datos y herramientas internas que mantienen alta la velocidad de iteración de la investigación.
• Poseer el presupuesto informático. Usted comprende el costo por FLOP entre proveedores y hardware, y odia la computación desperdiciada.
Pila de tecnología: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Puede ser una buena opción si tiene:
• Más de 3 años construyendo y operando infraestructura de GPU de producción o sistemas de capacitación distribuidos a escala. En un importante laboratorio de IA, una startup de ML bien financiada o un entorno de HPC
• Profunda experiencia práctica con Slurm y gestión de clusters. Ha depurado fallas de programación, optimizado la utilización en cargas de trabajo de GPU multiinquilino y operado infraestructura donde el tiempo de inactividad tiene un costo real.
• Pensamiento sistémico de nivel experto: ancho de banda de memoria, creación de perfiles de GPU. Razonas sobre hardware, no sobre configuraciones.
• Fuerte Python y fluidez genuina con los aspectos internos de PyTorch. Suficiente para perfilar una ejecución de entrenamiento y determinar si el cuello de botella es la carga de datos, la comunicación o la computación.
• Historial de toma de decisiones de infraestructura que mejoraron de manera mensurable el rendimiento de la capacitación o la rentabilidad.
• Fuertes habilidades en herramientas de IA. Utiliza Claude Code, Cursor o similar con fluidez para moverse rápido sin sacrificar la calidad.
Bono:
• Experiencia operando con un gasto de GPU a escala de decenas de millones
• Experiencia en infraestructura de nube/HPC híbrida o multinube
• Experiencia Triton, CUDA o kernel personalizado
• Experimente la ampliación de la orquestación de un solo clúster a la de varios clústeres.
• Seguimiento de experimentos de creación en segundo plano, registro de modelos o herramientas de canalización de aprendizaje automático.
La vida en los laboratorios anteriores
Trabajará junto a investigadores y constructores que exigen un listón muy alto, tanto en la calidad de su trabajo como en la forma en que trabajan entre sí. Nos movemos rápido y todavía nos tomamos el tiempo para hacer las cosas bien.
Nuestros equipos tienen su sede en Berlín, Friburgo y Nueva York; cuando trabajas en algo tan duro como TabPFN, estar en la misma sala es importante. Pero grandes personas vienen de todas partes y, en casos excepcionales, estamos abiertos a lo remoto, lo que normalmente significa viajes frecuentes a una de nuestras oficinas. Dondequiera que esté, toda la empresa se reúne periódicamente en sitios externos para construir y celebrar juntos.
Nuestros compromisos
Los mejores productos y equipos los crean personas con una amplia gama de perspectivas y antecedentes. Damos la bienvenida a solicitudes de todas las identidades y estilos de vida, especialmente si alguna vez se sintió desanimado por "no marcar todas las casillas", y brindamos igualdad de oportunidades independientemente del género, orientación sexual, origen, discapacidad o cualquier otro rasgo que lo haga quien es.
Nos preocupamos por cómo se manejan sus datos: consulte nuestra página Privacidad de datos de reclutamiento
Encuentre más trabajos de habla inglesa en Alemania en Arbeitnow
Fuente: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Los modelos de fundación transformaron texto e imágenes. Los datos estructurados, el formato de datos más grande y de mayor trascendencia del mundo, se mantuvieron intactos hasta ahora. Lo que los LLM hicieron por el lenguaje, lo estamos haciendo por las tablas.
Fuimos pioneros en los modelos de base tabular: TabPFN v2 fue una noticia de portada de Nature, ha superado más de 3,5 millones de descargas y más de 7500 estrellas de GitHub, y se ejecuta en producción desde la detección de enfermedades pulmonares con Oxford Cancer Analytics hasta la prevención de fallas de trenes con Hitachi. Los problemas más difíciles (millones de filas, inferencia en tiempo real, modalidades completamente nuevas) todavía están abiertos y nadie más está trabajando en ellos a este nivel.
Somos un equipo pequeño y altamente selectivo de más de 40 personas con experiencia en Google, DeepMind, Meta, Apple, Amazon, Jane Street y CERN, liderados por Frank Hutter, Noah Hollmann y Sauraj Gambhir, y asesorados por Bernhard Schölkopf y el ganador del Premio Turing Yann LeCun.
En julio de 2026, menos de 18 meses después de nuestra inversión inicial de 9 millones de euros, nos unimos a SAP como un laboratorio de inteligencia artificial de vanguardia independiente: el mismo equipo, misión y modelos abiertos, ahora respaldados por más de mil millones de euros durante cuatro años.
Acerca del rol
Gastamos decenas de millones al año en computación GPU para entrenar modelos de base tabular. Ese no es un objetivo, es lo que estamos ejecutando hoy y está creciendo. La persona propietaria de esta infraestructura toma decisiones que valen millones de dólares: arquitectura del clúster, eficiencia de la programación, estrategia del proveedor, selección de hardware. Una llamada equivocada cuesta seis cifras.
Hoy ejecutamos Slurm en GCP en varios clústeres. Estamos escalando a una infraestructura de múltiples clústeres y múltiples proveedores y evaluando nuevas generaciones de hardware a medida que se ponen en línea. Usted es dueño de toda la pila, desde las operaciones del clúster y la optimización de costos hasta el rendimiento de la capacitación distribuida y la capa de herramientas que mantiene a los investigadores avanzando rápidamente. Trabaja directamente con el equipo de investigación y comprende lo que están haciendo lo suficientemente bien como para tomar decisiones de infraestructura que realmente los ayuden. Y este no es un rol puramente de apoyo. Operamos en un entorno abierto. Si tiene la próxima arquitectura tabular SOTA bajo la manga, continúe y entrénela.
En qué trabajarás:
• Poseer y desarrollar una infraestructura de GPU multiclúster. Slurm en GCP hoy, multiproveedor y nuevo hardware mañana. Arquitectura, programación, confiabilidad, optimización de costos.
• Impulsar la utilización de la GPU y el rendimiento de la capacitación: creación de perfiles, optimización de la memoria, cuellos de botella en la comunicación, depuración a nivel de sistemas de la capacitación distribuida en ejecuciones grandes.
• Diseñe la próxima generación de nuestra infraestructura: orquestación de múltiples clústeres, nuevas generaciones de GPU, diversificación de proveedores, planificación de capacidad frente a las crecientes demandas informáticas.
• Construir la capa de productividad del desarrollador: canales de CI, seguimiento de experimentos, registro de modelos, procesamiento de datos y herramientas internas que mantienen alta la velocidad de iteración de la investigación.
• Poseer el presupuesto informático. Usted comprende el costo por FLOP entre proveedores y hardware, y odia la computación desperdiciada.
Pila de tecnología: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Puede ser una buena opción si tiene:
• Más de 3 años construyendo y operando infraestructura de GPU de producción o sistemas de capacitación distribuidos a escala. En un importante laboratorio de IA, una startup de ML bien financiada o un entorno de HPC
• Profunda experiencia práctica con Slurm y gestión de clusters. Ha depurado fallas de programación, optimizado la utilización en cargas de trabajo de GPU multiinquilino y operado infraestructura donde el tiempo de inactividad tiene un costo real.
• Pensamiento sistémico de nivel experto: ancho de banda de memoria, creación de perfiles de GPU. Razonas sobre hardware, no sobre configuraciones.
• Fuerte Python y fluidez genuina con los aspectos internos de PyTorch. Suficiente para perfilar una ejecución de entrenamiento y determinar si el cuello de botella es la carga de datos, la comunicación o la computación.
• Historial de toma de decisiones de infraestructura que mejoraron de manera mensurable el rendimiento de la capacitación o la rentabilidad.
• Fuertes habilidades en herramientas de IA. Utiliza Claude Code, Cursor o similar con fluidez para moverse rápido sin sacrificar la calidad.
Bono:
• Experiencia operando con un gasto de GPU a escala de decenas de millones
• Experiencia en infraestructura de nube/HPC híbrida o multinube
• Experiencia Triton, CUDA o kernel personalizado
• Experimente la ampliación de la orquestación de un solo clúster a la de varios clústeres.
• Seguimiento de experimentos de creación en segundo plano, registro de modelos o herramientas de canalización de aprendizaje automático.
La vida en los laboratorios anteriores
Trabajará junto a investigadores y constructores que exigen un listón muy alto, tanto en la calidad de su trabajo como en la forma en que trabajan entre sí. Nos movemos rápido y todavía nos tomamos el tiempo para hacer las cosas bien.
Nuestros equipos tienen su sede en Berlín, Friburgo y Nueva York; cuando trabajas en algo tan duro como TabPFN, estar en la misma sala es importante. Pero grandes personas vienen de todas partes y, en casos excepcionales, estamos abiertos a lo remoto, lo que normalmente significa viajes frecuentes a una de nuestras oficinas. Dondequiera que esté, toda la empresa se reúne periódicamente en sitios externos para construir y celebrar juntos.
Nuestros compromisos
Los mejores productos y equipos los crean personas con una amplia gama de perspectivas y antecedentes. Damos la bienvenida a solicitudes de todas las identidades y estilos de vida, especialmente si alguna vez se sintió desanimado por "no marcar todas las casillas", y brindamos igualdad de oportunidades independientemente del género, orientación sexual, origen, discapacidad o cualquier otro rasgo que lo haga quien es.
Nos preocupamos por cómo se manejan sus datos: consulte nuestra página Privacidad de datos de reclutamiento
Encuentre más trabajos de habla inglesa en Alemania en Arbeitnow
Fuente: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Fuente: Prior Labs
Ubicación
Berlin, Alemania
Publicación proporcionada por Prior Labs.