Empleo
Del feed del socio
Ingeniero de software sénior, plataforma informática
165.000 US$ Salario
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- Sí
- Salario desde
- 165.000
- Salario hasta
- 225.000
- Empresa
- Moonlite
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
Moonlite ofrece una infraestructura de IA de alto rendimiento para organizaciones que realizan investigaciones computacionales intensivas, capacitación de modelos a gran escala y cargas de trabajo de procesamiento de datos exigentes. Proporcionamos infraestructura implementada en nuestras instalaciones o ubicadas en las suyas, brindando computación reservada o bajo demanda flexible que se siente como una extensión de su centro de datos existente. Nuestro equipo de especialistas en infraestructura de IA combina el rendimiento básico con la simplicidad operativa nativa de la nube, lo que permite a los equipos de investigación y a las empresas implementar cargas de trabajo de IA exigentes con confiabilidad y cumplimiento de nivel empresarial.
Tu papel:
Jugará un papel decisivo en la construcción de nuestra plataforma informática acelerada por GPU que impulsa el entrenamiento y la inferencia de IA distribuida, simulaciones a gran escala y cargas de trabajo de investigación computacional. Al trabajar en estrecha colaboración con el producto, los miembros del equipo de su plataforma y los especialistas en infraestructura, diseñará e implementará la capa de orquestación informática que gestiona los clústeres de GPU, el aprovisionamiento básico y la programación de recursos, lo que permitirá a los investigadores e ingenieros acceder mediante programación a recursos informáticos de alto rendimiento con una simplicidad similar a la de la nube.
Responsabilidades laborales
•
Sistemas de orquestación informática: diseñe y cree plataformas de orquestación informática escalables que administren clústeres de GPU, aprovisionamiento de servidores sin sistema operativo y asignación de recursos en entornos de infraestructura ubicados conjuntamente.
•
Gestión y programación de recursos: implemente programación inteligente de cargas de trabajo, asignación de recursos y algoritmos de optimización que maximicen la utilización de la GPU y al mismo tiempo mantengan garantías de rendimiento para las cargas de trabajo de investigación y capacitación.
•
Aprovisionamiento de clústeres de investigación: diseñe e implemente sistemas para aprovisionar y gestionar entornos informáticos de investigación, incluidos clústeres Kubernetes y SLURM, permitiendo la implementación automatizada, la programación de recursos y la orquestación de cargas de trabajo para la capacitación de IA distribuida y cargas de trabajo de HPC.
•
Ingeniería de plataforma GPU: desarrolle capacidades de plataforma para administrar configuraciones de GPU NVIDIA de última generación (H100, H200, B200, B300), incluida la administración de recursos de GPU, el aislamiento de múltiples inquilinos y la integración con sistemas de orquestación informática.
•
Gestión del ciclo de vida bare-metal: cree automatización y herramientas para una gestión completa del ciclo de vida del servidor bare-metal, desde el aprovisionamiento y la configuración iniciales hasta las operaciones continuas, las actualizaciones y la reasignación de recursos.
•
Sistemas de rendimiento crítico: Optimice los componentes de la plataforma informática para lograr un rendimiento de alto rendimiento y baja latencia, garantizando que las cargas de trabajo de investigación alcancen una eficiencia casi completa en entornos virtualizados o en contenedores.
•
Integración y API de plataforma: desarrolle API y SDK sólidos que permitan a los investigadores aprovisionar y administrar mediante programación recursos informáticos, integrándose perfectamente con los flujos de trabajo y la infraestructura de investigación existentes.
•
Observabilidad y monitoreo: implemente sistemas integrales de monitoreo y telemetría para recursos informáticos, brindando visibilidad de la virtualización de GPU, el rendimiento de la carga de trabajo y el estado de la infraestructura.
•
Aislamiento y tenencia múltiple: cree aislamiento informático multitenencia de nivel empresarial, límites de seguridad y cuotas de recursos que permitan compartir de forma segura la infraestructura de GPU entre equipos y organizaciones.
Requisitos
•
Experiencia: más de 5 años en ingeniería de software con experiencia comprobada en la creación de plataformas informáticas, sistemas de orquestación de contenedores o infraestructura informática distribuida para entornos de producción.
•
Ingeniería de plataformas informáticas: sólida experiencia en la creación de sistemas de orquestación informática, programación de recursos o gestión de cargas de trabajo a escala.
•
Kubernetes y orquestación de contenedores: gran familiaridad con la arquitectura de Kubernetes, conceptos de orquestación de contenedores y experiencia en la implementación de cargas de trabajo en entornos de Kubernetes. Comprensión de pods, implementaciones, servicios y operaciones básicas de Kubernetes.
•
Habilidades de programación: se valora mucho la experiencia con Go, C/C++, Python o Rust para componentes críticos para el rendimiento.
•
Linux y programación de sistemas: sólida experiencia con Linux en entornos de producción, incluidos sistemas de programación, optimización del rendimiento y gestión de recursos de bajo nivel.
•
Virtualización y contenedores: conocimiento profundo de las tecnologías de virtualización (KVM, Xen), tiempos de ejecución de contenedores y plataformas de orquestación.
•
Fundamentos de informática GPU: comprensión de las arquitecturas GPU, programación CUDA (dónde y cuando sea necesario) y gestión de recursos GPU, o una gran capacidad para aprender rápidamente.
•
Infraestructura bare-metal: experiencia con aprovisionamiento bare-metal, sistemas de gestión fuera de banda y capas de abstracción de hardware.
•
Resolución de problemas y arquitectura: capacidad demostrada para resolver desafíos complejos de rendimiento y escalabilidad mientras se equilibra el envío pragmático con una buena arquitectura a largo plazo.
•
Autonomía y comunicación: Cómodo para navegar la ambigüedad, definir requisitos de manera colaborativa y comunicar discusiones técnicas a través de documentación clara.
•
Compromiso con el crecimiento: Mentalidad de crecimiento con enfoque continuo en el aprendizaje y el desarrollo profesional.
Calificaciones preferidas
• Aprovisionamiento en segundo plano o gestión de entornos informáticos de investigación (clusters Kubernetes, SLURM o HPC)
• Experiencia con tecnologías de virtualización de GPU (SR-IOV, NVIDIA vGPU) y uso compartido de GPU multiinquilino
• Experiencia en plataformas de orquestación de contenedores con programación personalizada o gestión de recursos.
• Conocimiento de redes de alto rendimiento para comunicación GPU (InfiniBand, RDMA, NVLink, NVSwitch)
• Familiaridad con los marcos de capacitación de AI/ML (PyTorch, TensorFlow) y sus requisitos de infraestructura.
• Comprensión de los patrones de entrenamiento distribuido y coordinación de GPU de múltiples nodos
• Experiencia en la construcción de infraestructura para instituciones de investigación, laboratorios o entornos informáticos técnicos...
Fuente: Himalaya (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Tu papel:
Jugará un papel decisivo en la construcción de nuestra plataforma informática acelerada por GPU que impulsa el entrenamiento y la inferencia de IA distribuida, simulaciones a gran escala y cargas de trabajo de investigación computacional. Al trabajar en estrecha colaboración con el producto, los miembros del equipo de su plataforma y los especialistas en infraestructura, diseñará e implementará la capa de orquestación informática que gestiona los clústeres de GPU, el aprovisionamiento básico y la programación de recursos, lo que permitirá a los investigadores e ingenieros acceder mediante programación a recursos informáticos de alto rendimiento con una simplicidad similar a la de la nube.
Responsabilidades laborales
•
Sistemas de orquestación informática: diseñe y cree plataformas de orquestación informática escalables que administren clústeres de GPU, aprovisionamiento de servidores sin sistema operativo y asignación de recursos en entornos de infraestructura ubicados conjuntamente.
•
Gestión y programación de recursos: implemente programación inteligente de cargas de trabajo, asignación de recursos y algoritmos de optimización que maximicen la utilización de la GPU y al mismo tiempo mantengan garantías de rendimiento para las cargas de trabajo de investigación y capacitación.
•
Aprovisionamiento de clústeres de investigación: diseñe e implemente sistemas para aprovisionar y gestionar entornos informáticos de investigación, incluidos clústeres Kubernetes y SLURM, permitiendo la implementación automatizada, la programación de recursos y la orquestación de cargas de trabajo para la capacitación de IA distribuida y cargas de trabajo de HPC.
•
Ingeniería de plataforma GPU: desarrolle capacidades de plataforma para administrar configuraciones de GPU NVIDIA de última generación (H100, H200, B200, B300), incluida la administración de recursos de GPU, el aislamiento de múltiples inquilinos y la integración con sistemas de orquestación informática.
•
Gestión del ciclo de vida bare-metal: cree automatización y herramientas para una gestión completa del ciclo de vida del servidor bare-metal, desde el aprovisionamiento y la configuración iniciales hasta las operaciones continuas, las actualizaciones y la reasignación de recursos.
•
Sistemas de rendimiento crítico: Optimice los componentes de la plataforma informática para lograr un rendimiento de alto rendimiento y baja latencia, garantizando que las cargas de trabajo de investigación alcancen una eficiencia casi completa en entornos virtualizados o en contenedores.
•
Integración y API de plataforma: desarrolle API y SDK sólidos que permitan a los investigadores aprovisionar y administrar mediante programación recursos informáticos, integrándose perfectamente con los flujos de trabajo y la infraestructura de investigación existentes.
•
Observabilidad y monitoreo: implemente sistemas integrales de monitoreo y telemetría para recursos informáticos, brindando visibilidad de la virtualización de GPU, el rendimiento de la carga de trabajo y el estado de la infraestructura.
•
Aislamiento y tenencia múltiple: cree aislamiento informático multitenencia de nivel empresarial, límites de seguridad y cuotas de recursos que permitan compartir de forma segura la infraestructura de GPU entre equipos y organizaciones.
Requisitos
•
Experiencia: más de 5 años en ingeniería de software con experiencia comprobada en la creación de plataformas informáticas, sistemas de orquestación de contenedores o infraestructura informática distribuida para entornos de producción.
•
Ingeniería de plataformas informáticas: sólida experiencia en la creación de sistemas de orquestación informática, programación de recursos o gestión de cargas de trabajo a escala.
•
Kubernetes y orquestación de contenedores: gran familiaridad con la arquitectura de Kubernetes, conceptos de orquestación de contenedores y experiencia en la implementación de cargas de trabajo en entornos de Kubernetes. Comprensión de pods, implementaciones, servicios y operaciones básicas de Kubernetes.
•
Habilidades de programación: se valora mucho la experiencia con Go, C/C++, Python o Rust para componentes críticos para el rendimiento.
•
Linux y programación de sistemas: sólida experiencia con Linux en entornos de producción, incluidos sistemas de programación, optimización del rendimiento y gestión de recursos de bajo nivel.
•
Virtualización y contenedores: conocimiento profundo de las tecnologías de virtualización (KVM, Xen), tiempos de ejecución de contenedores y plataformas de orquestación.
•
Fundamentos de informática GPU: comprensión de las arquitecturas GPU, programación CUDA (dónde y cuando sea necesario) y gestión de recursos GPU, o una gran capacidad para aprender rápidamente.
•
Infraestructura bare-metal: experiencia con aprovisionamiento bare-metal, sistemas de gestión fuera de banda y capas de abstracción de hardware.
•
Resolución de problemas y arquitectura: capacidad demostrada para resolver desafíos complejos de rendimiento y escalabilidad mientras se equilibra el envío pragmático con una buena arquitectura a largo plazo.
•
Autonomía y comunicación: Cómodo para navegar la ambigüedad, definir requisitos de manera colaborativa y comunicar discusiones técnicas a través de documentación clara.
•
Compromiso con el crecimiento: Mentalidad de crecimiento con enfoque continuo en el aprendizaje y el desarrollo profesional.
Calificaciones preferidas
• Aprovisionamiento en segundo plano o gestión de entornos informáticos de investigación (clusters Kubernetes, SLURM o HPC)
• Experiencia con tecnologías de virtualización de GPU (SR-IOV, NVIDIA vGPU) y uso compartido de GPU multiinquilino
• Experiencia en plataformas de orquestación de contenedores con programación personalizada o gestión de recursos.
• Conocimiento de redes de alto rendimiento para comunicación GPU (InfiniBand, RDMA, NVLink, NVSwitch)
• Familiaridad con los marcos de capacitación de AI/ML (PyTorch, TensorFlow) y sus requisitos de infraestructura.
• Comprensión de los patrones de entrenamiento distribuido y coordinación de GPU de múltiples nodos
• Experiencia en la construcción de infraestructura para instituciones de investigación, laboratorios o entornos informáticos técnicos...
Fuente: Himalaya (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Fuente: Moonlite
Publicación proporcionada por Moonlite.