Empleo
Del feed del socio
Ingeniero de Soporte Técnico (N2) - Computación
Precio a consultar
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- No
- Empresa
- Mistral.ai
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
Acerca de Mistral
Mistral ofrece soluciones de inteligencia artificial completas: desde modelos de vanguardia hasta herramientas, aplicaciones y computación para desarrolladores. Nos asociamos con empresas que abordan los problemas más difíciles en industrias de alto riesgo como las finanzas, la manufactura, la defensa, la atención médica y el sector público, y cocreamos sistemas de inteligencia artificial personalizados que pueden ejecutar según sus condiciones.
Somos un equipo dinámico y colaborativo apasionado por la IA y su potencial para transformar la sociedad. Nuestra fuerza laboral diversa prospera en entornos competitivos y está comprometida a impulsar la innovación. Nuestros equipos están distribuidos entre Europa, Norteamérica, Asia y Medio Oriente. Somos creativos, bajos en ego y con espíritu de equipo.
Mistral AI está creando un nuevo equipo de soporte informático para garantizar la confiabilidad, el rendimiento y la escalabilidad de nuestros clústeres de GPU en un entorno de Kubernetes. Como uno de los miembros fundadores de este equipo, desempeñará un papel fundamental en la configuración de sus procesos, estándares y cultura.
En esta función de soporte híbrido L1/L2, usted será el primer punto de contacto para los clientes y los equipos internos, brindando orientación técnica, solución de problemas y resolución de problemas para consultas relacionadas con la computación. También servirá como punto de escalada para problemas complejos, aprovechando su profundo conocimiento de sistemas, experiencia en Kubernetes y habilidades de depuración operativa para garantizar que nuestras cargas de trabajo de IA se ejecuten sin problemas a escala.
Se trata de una función centrada en el soporte que combina la administración de sistemas, la comunicación cara al cliente y la experiencia en infraestructura informática. Si bien la codificación no es el objetivo principal, la familiaridad con Go para la depuración y la automatización es una ventaja.
Responsabilidades clave
El primer punto de contacto del cliente
• Actuar como el primer interlocutor para los clientes y equipos internos, brindando respuestas oportunas y efectivas a consultas relacionadas con la computación.
• Clasificar y priorizar las solicitudes entrantes, garantizando que se cumplan los SLA para su reconocimiento, primera respuesta y resolución.
• Reúna y analice los detalles del problema inicial (por ejemplo, registros, mensajes de error, métricas del sistema) para diagnosticar problemas de manera eficiente.
• Proporcionar orientación clara y práctica a los clientes y usuarios internos, incluidas soluciones temporales cuando corresponda.
Soporte técnico
• Servir como punto de escalamiento L2 para Linux, Kubernetes y problemas de infraestructura informática, brindando una solución técnica profunda para:
• Cargas de trabajo de GPU/TPU (por ejemplo, errores de CUDA, pérdidas de memoria, fallas en el trabajo).
• Clústeres de Kubernetes (por ejemplo, fallas de pods, fallas de nodos, configuraciones incorrectas de redes).
• Entornos bare metal y de nube (por ejemplo, AWS EC2, máquinas virtuales de GCP, clústeres de HPC).
• Diagnosticar y resolver cuellos de botella de rendimiento, fallas de hardware y contención de recursos en sistemas distribuidos.
• Analizar métricas, registros y seguimientos del sistema (por ejemplo, dmesg, journalctl, nvidia-smi, Prometheus, Grafana) para identificar las causas fundamentales de los problemas.
• Participar en rotaciones de guardia para brindar soporte las 24 horas del día, los 7 días de la semana para sistemas informáticos críticos.
• Es bueno tenerlo: optimice las configuraciones del sistema (por ejemplo, parámetros del kernel, ajuste del sistema de archivos, configuraciones de red) para cargas de trabajo de computación de alto rendimiento (HPC) y IA.
Kubernetes y contenedorización
• Depurar clústeres de Kubernetes centrándose en:
• Problemas con pods y nodos (por ejemplo, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Redes y almacenamiento (por ejemplo, complementos CNI, PersistentVolumes, StorageClasses).
• Gestión de recursos (por ejemplo, solicitudes/límites, clases de QOS, afinidad de nodos).
• Solucionar problemas de tiempo de ejecución de contenedores (Docker, contenedord), como fallas en la extracción de imágenes, cumplimiento de OCI o errores de tiempo de ejecución.
• Colaborar con los equipos de SRE para comprender y mejorar las herramientas existentes basadas en IaC (Terraform, Ansible) y Go.
Documentación y mejora de procesos
• Crear y mantener runbooks, playbooks y documentación interna para problemas informáticos comunes (por ejemplo, depuración de GPU, solución de problemas de Kubernetes).
• Contribuir a las autopsias con seguimientos procesables para evitar incidentes recurrentes.
• Capacitar a los equipos internos sobre las mejores prácticas para la infraestructura informática y la depuración.
• Ayudar a definir y perfeccionar los procesos de soporte como miembro fundador del nuevo equipo de Compute Support.
Lo que estamos buscando
Habilidades y experiencia requeridas
• Más de 5 años de experiencia en administración de sistemas, soporte técnico u operaciones de infraestructura, con un fuerte enfoque en entornos de computación pesada (bare metal, nube, HPC o virtualización).
• Profunda experiencia en Linux/Unix:
• Depuración de problemas a nivel del kernel (por ejemplo, OOM Killer, cuellos de botella de E/S, aceleración de la CPU).
• Ajuste del rendimiento (por ejemplo, sysctl, ulimit, optimizaciones del sistema de archivos).
• Solución de problemas de redes (por ejemplo, iptables, tcpdump, DNS, NFS, SSH).
• Gestión de almacenamiento (por ejemplo, LVM, RAID, NVMe, almacenamiento local GPU).
• La experiencia práctica en Kubernetes es obligatoria:
• Depuración de pods, nodos y clústeres (por ejemplo, kubectl describe, kubectl logs, crictl).
• Redes y almacenamiento (por ejemplo, complementos CNI, PersistentVolumes).
• Gestión de recursos (por ejemplo, solicitudes/límites, clases de QOS).
• Familiaridad con la contenedorización (Docker, containerd) y conocimiento básico de IaC. Competencia con herramientas de monitoreo (Prometheus, Grafana, ELK, OpenTelemetry).
• Habilidades básicas de programación/automatización (preferiblemente Go, pero Bash o Python son aceptables para tareas ad-hoc).
• La experiencia con entornos bare metal, virtualización o HPC (por ejemplo, Fluidstack, Coreweave, Vast) es una gran ventaja.
• Excelentes habilidades de comunicación y resolución de problemas, con capacidad para explicar cuestiones técnicas con claridad y paciencia a partes interesadas tanto técnicas como no técnicas.
• Mentalidad centrada en el cliente y pasión por resolver problemas de manera eficiente y mejorar la confiabilidad del sistema.
• Capacidad para trabajar en rotaciones de guardia y manejar situaciones de alta presión con un enfoque estructurado y tranquilo.
• Compromiso de cumplir SLA estrictos para el reconocimiento de problemas, la clasificación y la primera respuesta.…
Fuente: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Mistral ofrece soluciones de inteligencia artificial completas: desde modelos de vanguardia hasta herramientas, aplicaciones y computación para desarrolladores. Nos asociamos con empresas que abordan los problemas más difíciles en industrias de alto riesgo como las finanzas, la manufactura, la defensa, la atención médica y el sector público, y cocreamos sistemas de inteligencia artificial personalizados que pueden ejecutar según sus condiciones.
Somos un equipo dinámico y colaborativo apasionado por la IA y su potencial para transformar la sociedad. Nuestra fuerza laboral diversa prospera en entornos competitivos y está comprometida a impulsar la innovación. Nuestros equipos están distribuidos entre Europa, Norteamérica, Asia y Medio Oriente. Somos creativos, bajos en ego y con espíritu de equipo.
Mistral AI está creando un nuevo equipo de soporte informático para garantizar la confiabilidad, el rendimiento y la escalabilidad de nuestros clústeres de GPU en un entorno de Kubernetes. Como uno de los miembros fundadores de este equipo, desempeñará un papel fundamental en la configuración de sus procesos, estándares y cultura.
En esta función de soporte híbrido L1/L2, usted será el primer punto de contacto para los clientes y los equipos internos, brindando orientación técnica, solución de problemas y resolución de problemas para consultas relacionadas con la computación. También servirá como punto de escalada para problemas complejos, aprovechando su profundo conocimiento de sistemas, experiencia en Kubernetes y habilidades de depuración operativa para garantizar que nuestras cargas de trabajo de IA se ejecuten sin problemas a escala.
Se trata de una función centrada en el soporte que combina la administración de sistemas, la comunicación cara al cliente y la experiencia en infraestructura informática. Si bien la codificación no es el objetivo principal, la familiaridad con Go para la depuración y la automatización es una ventaja.
Responsabilidades clave
El primer punto de contacto del cliente
• Actuar como el primer interlocutor para los clientes y equipos internos, brindando respuestas oportunas y efectivas a consultas relacionadas con la computación.
• Clasificar y priorizar las solicitudes entrantes, garantizando que se cumplan los SLA para su reconocimiento, primera respuesta y resolución.
• Reúna y analice los detalles del problema inicial (por ejemplo, registros, mensajes de error, métricas del sistema) para diagnosticar problemas de manera eficiente.
• Proporcionar orientación clara y práctica a los clientes y usuarios internos, incluidas soluciones temporales cuando corresponda.
Soporte técnico
• Servir como punto de escalamiento L2 para Linux, Kubernetes y problemas de infraestructura informática, brindando una solución técnica profunda para:
• Cargas de trabajo de GPU/TPU (por ejemplo, errores de CUDA, pérdidas de memoria, fallas en el trabajo).
• Clústeres de Kubernetes (por ejemplo, fallas de pods, fallas de nodos, configuraciones incorrectas de redes).
• Entornos bare metal y de nube (por ejemplo, AWS EC2, máquinas virtuales de GCP, clústeres de HPC).
• Diagnosticar y resolver cuellos de botella de rendimiento, fallas de hardware y contención de recursos en sistemas distribuidos.
• Analizar métricas, registros y seguimientos del sistema (por ejemplo, dmesg, journalctl, nvidia-smi, Prometheus, Grafana) para identificar las causas fundamentales de los problemas.
• Participar en rotaciones de guardia para brindar soporte las 24 horas del día, los 7 días de la semana para sistemas informáticos críticos.
• Es bueno tenerlo: optimice las configuraciones del sistema (por ejemplo, parámetros del kernel, ajuste del sistema de archivos, configuraciones de red) para cargas de trabajo de computación de alto rendimiento (HPC) y IA.
Kubernetes y contenedorización
• Depurar clústeres de Kubernetes centrándose en:
• Problemas con pods y nodos (por ejemplo, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Redes y almacenamiento (por ejemplo, complementos CNI, PersistentVolumes, StorageClasses).
• Gestión de recursos (por ejemplo, solicitudes/límites, clases de QOS, afinidad de nodos).
• Solucionar problemas de tiempo de ejecución de contenedores (Docker, contenedord), como fallas en la extracción de imágenes, cumplimiento de OCI o errores de tiempo de ejecución.
• Colaborar con los equipos de SRE para comprender y mejorar las herramientas existentes basadas en IaC (Terraform, Ansible) y Go.
Documentación y mejora de procesos
• Crear y mantener runbooks, playbooks y documentación interna para problemas informáticos comunes (por ejemplo, depuración de GPU, solución de problemas de Kubernetes).
• Contribuir a las autopsias con seguimientos procesables para evitar incidentes recurrentes.
• Capacitar a los equipos internos sobre las mejores prácticas para la infraestructura informática y la depuración.
• Ayudar a definir y perfeccionar los procesos de soporte como miembro fundador del nuevo equipo de Compute Support.
Lo que estamos buscando
Habilidades y experiencia requeridas
• Más de 5 años de experiencia en administración de sistemas, soporte técnico u operaciones de infraestructura, con un fuerte enfoque en entornos de computación pesada (bare metal, nube, HPC o virtualización).
• Profunda experiencia en Linux/Unix:
• Depuración de problemas a nivel del kernel (por ejemplo, OOM Killer, cuellos de botella de E/S, aceleración de la CPU).
• Ajuste del rendimiento (por ejemplo, sysctl, ulimit, optimizaciones del sistema de archivos).
• Solución de problemas de redes (por ejemplo, iptables, tcpdump, DNS, NFS, SSH).
• Gestión de almacenamiento (por ejemplo, LVM, RAID, NVMe, almacenamiento local GPU).
• La experiencia práctica en Kubernetes es obligatoria:
• Depuración de pods, nodos y clústeres (por ejemplo, kubectl describe, kubectl logs, crictl).
• Redes y almacenamiento (por ejemplo, complementos CNI, PersistentVolumes).
• Gestión de recursos (por ejemplo, solicitudes/límites, clases de QOS).
• Familiaridad con la contenedorización (Docker, containerd) y conocimiento básico de IaC. Competencia con herramientas de monitoreo (Prometheus, Grafana, ELK, OpenTelemetry).
• Habilidades básicas de programación/automatización (preferiblemente Go, pero Bash o Python son aceptables para tareas ad-hoc).
• La experiencia con entornos bare metal, virtualización o HPC (por ejemplo, Fluidstack, Coreweave, Vast) es una gran ventaja.
• Excelentes habilidades de comunicación y resolución de problemas, con capacidad para explicar cuestiones técnicas con claridad y paciencia a partes interesadas tanto técnicas como no técnicas.
• Mentalidad centrada en el cliente y pasión por resolver problemas de manera eficiente y mejorar la confiabilidad del sistema.
• Capacidad para trabajar en rotaciones de guardia y manejar situaciones de alta presión con un enfoque estructurado y tranquilo.
• Compromiso de cumplir SLA estrictos para el reconocimiento de problemas, la clasificación y la primera respuesta.…
Fuente: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Fuente: Mistral.ai
Ubicación
Paris, Francia
Publicación proporcionada por Mistral.ai.