Empleo
Del feed del socio
Arquitecto de soluciones de IA
Precio a consultar
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- Sí
- Empresa
- Uvation
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
Descripción general del trabajo
Buscamos un arquitecto de soluciones de IA con experiencia
para diseñar y liderar soluciones empresariales de infraestructura de GPU y fábrica de IA de extremo a extremo que abarquen computación, redes de alto rendimiento, almacenamiento, Kubernetes, nube y plataformas AI/ML. El puesto requiere una sólida experiencia en tecnologías de GPU NVIDIA, cargas de trabajo de IA, arquitectura de infraestructura escalable, seguridad, observabilidad, ingeniería de rendimiento y planificación de capacidad.
Responsabilidades clave
• Arquitectura propia de extremo a extremo para AI Factory y soluciones de AI empresarial desde los requisitos hasta la preparación para la producción.
• Evaluar los requisitos de carga de trabajo de IA/ML para capacitación, ajuste, inferencia, procesamiento por lotes y computación de alto rendimiento.
• Diseñar arquitecturas informáticas de GPU que incluyen plataformas NVIDIA HGX/DGX/OEM, sistemas multi-GPU, NVLink/NVSwitch y asignación de recursos de GPU.
• Diseñe redes de IA de alto rendimiento utilizando Ethernet 100/200/400/800G, EVPN/VXLAN y arquitecturas leaf-spine.
• Diseñe arquitecturas de datos y almacenamiento de IA utilizando almacenamiento de objetos, sistemas de archivos paralelos como Ceph, WEKA o plataformas equivalentes.
• Definir la arquitectura de la plataforma de IA en Kubernetes, HPC, tiempos de ejecución de contenedores, plataformas de servicio de modelos y marcos de IA empresarial.
• Establecer estándares de arquitectura para seguridad, identidad, aislamiento de inquilinos, protección de datos, observabilidad, recuperación ante desastres y resiliencia operativa.
• Desarrollar arquitecturas de referencia, diseños de alto y bajo nivel, modelos de capacidad, listas de materiales, evaluaciones de tecnología y hojas de ruta de implementación.
• Liderar evaluaciones técnicas, pruebas de conceptos, evaluaciones de proveedores y juntas de revisión de arquitectura.
• Colaborar con equipos de infraestructura, redes, seguridad, almacenamiento, nube, datos, aplicaciones y operaciones.
• Definir objetivos de rendimiento, disponibilidad, escalabilidad, seguridad y costos y validar la arquitectura frente a criterios de aceptación mensurables.
• Proporcionar liderazgo técnico durante la implementación, migración, integración, resolución de problemas y transición de producción.
• Habilidades técnicas requeridas
Arquitectura de IA/ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, operador de GPU y ecosistema de plataforma de IA.
• PyTorch, TensorFlow, JAX y comprensión operativa de las cargas de trabajo de capacitación e inferencia.
• Programación de GPU, multiinquilino, MIG/vGPU, utilización de GPU y ubicación de cargas de trabajo.
• LLM, IA generativa, RAG, ajuste fino, servicio de modelos y arquitectura de inferencia.
Infraestructura de fábrica de GPU e IA
• NVIDIA A100/H100/H200/B200 o plataformas GPU equivalentes; Familiaridad con los sistemas de próxima generación.
• NVLink, NVSwitch, topología PCIe y arquitectura de rendimiento multi-GPU.
• Arquitectura de servidor GPU DGX/HGX/OEM y gestión del ciclo de vida.
• Planificación de la capacidad de AI Factory, densidad de racks, energía, refrigeración, puesta en marcha y estrategia de ciclo de vida.
Redes de alto rendimiento
• Ethernet 100/200/400/800G, InfiniBand, RoCEv2 y RDMA, Netris
• Tecnologías NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum y BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS y gestión de congestión.
• Tráfico de GPU este-oeste, GPUDirect RDMA y resolución de problemas de rendimiento de red.
Arquitectura de datos y almacenamiento de IA
• Sistemas de archivos paralelos, almacenamiento de objetos, NFS, NVMe/NVMe-oF y canalizaciones de datos de alto rendimiento.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp o tecnologías equivalentes.
• Conceptos de lago/casa del lago de datos, metadatos, linaje, movimiento de datos y ciclo de vida de los datos.
• Almacenamiento GPUDirect y optimización del rendimiento del almacenamiento/red.
Plataforma y orquestación de IA
• Kubernetes, operador de GPU, tiempos de ejecución de contenedores y programación de GPU de Kubernetes.
• HPC u otros programadores de carga de trabajo equivalentes.
• Plataformas de servicio/inferencia de modelos y arquitectura de plataforma MLOps.
• Puertas de enlace API, descubrimiento de servicios, gestión de secretos e integración de plataformas.
Arquitectura híbrida y de nube
• Servicios de seguridad e infraestructura de IA de AWS y/o Azure.
• Conectividad de nube híbrida, IAM, redes privadas, almacenamiento en nube y ubicación de cargas de trabajo.
• Optimización de costos de la nube, planificación de capacidad y consideraciones de FinOps para cargas de trabajo de GPU.
Seguridad y gobernanza
• Zero Trust, segmentación de red, IAM/RBAC, PAM e identidad de carga de trabajo.
• GPU, DPU, contenedor, Kubernetes, firmware y seguridad de la cadena de suministro.
• Cifrado en reposo/en tránsito, gestión de secretos, registro de auditoría y controles de cumplimiento.
• Riesgos específicos de la IA, incluida la protección de datos/modelos, el aislamiento de inquilinos y el acceso seguro a los modelos.
Observabilidad y confiabilidad
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM y telemetría de infraestructura.
• Monitoreo en GPU, CPU, memoria, red, almacenamiento, energía y dominios térmicos.
• Alta disponibilidad, respaldo/restauración, recuperación ante desastres, continuidad del negocio y diseño de dominio de fallas.
• Ingeniería de rendimiento, análisis de cuellos de botella, diseño SLO/SLA y previsión de capacidad.
Entregables de arquitectura
• Arquitectura de referencia de AI Factory y planos de soluciones
• Diseño de alto nivel (HLD) y diseño de bajo nivel (LLD)
• Diagramas de arquitectura de red, computación, GPU y almacenamiento.
• Modelos de capacidad, rendimiento y escalabilidad.
• Documentos de evaluación de tecnología y comparación de proveedores.
• Arquitectura de seguridad y entradas del modelo de amenazas.
• Lista de materiales (BOM) y dimensionamiento de la infraestructura
• Estrategia de migración/implementación y hoja de ruta de implementación
• Lista de verificación de preparación operativa, runbooks y criterios de aceptación
Experiencia y calificaciones
• Más de 10 años de experiencia en infraestructura, nube, arquitectura empresarial o arquitectura de soluciones, con una exposición significativa a la infraestructura de IA/GPU.
• Experiencia comprobada en el diseño de plataformas empresariales a gran escala y en la traducción de requisitos comerciales en arquitecturas técnicas.
• Comprensión práctica de infraestructura física, sistemas GPU, redes, almacenamiento y plataformas Linux.
• Se prefiere Licenciatura en Ciencias de la Computación, Ingeniería, Tecnología de la Información o campo relacionado.…
Fuente: Empleos remotos en la UE (https://euremotejobs.com/job/ai-solution-architect-2/)
Buscamos un arquitecto de soluciones de IA con experiencia
para diseñar y liderar soluciones empresariales de infraestructura de GPU y fábrica de IA de extremo a extremo que abarquen computación, redes de alto rendimiento, almacenamiento, Kubernetes, nube y plataformas AI/ML. El puesto requiere una sólida experiencia en tecnologías de GPU NVIDIA, cargas de trabajo de IA, arquitectura de infraestructura escalable, seguridad, observabilidad, ingeniería de rendimiento y planificación de capacidad.
Responsabilidades clave
• Arquitectura propia de extremo a extremo para AI Factory y soluciones de AI empresarial desde los requisitos hasta la preparación para la producción.
• Evaluar los requisitos de carga de trabajo de IA/ML para capacitación, ajuste, inferencia, procesamiento por lotes y computación de alto rendimiento.
• Diseñar arquitecturas informáticas de GPU que incluyen plataformas NVIDIA HGX/DGX/OEM, sistemas multi-GPU, NVLink/NVSwitch y asignación de recursos de GPU.
• Diseñe redes de IA de alto rendimiento utilizando Ethernet 100/200/400/800G, EVPN/VXLAN y arquitecturas leaf-spine.
• Diseñe arquitecturas de datos y almacenamiento de IA utilizando almacenamiento de objetos, sistemas de archivos paralelos como Ceph, WEKA o plataformas equivalentes.
• Definir la arquitectura de la plataforma de IA en Kubernetes, HPC, tiempos de ejecución de contenedores, plataformas de servicio de modelos y marcos de IA empresarial.
• Establecer estándares de arquitectura para seguridad, identidad, aislamiento de inquilinos, protección de datos, observabilidad, recuperación ante desastres y resiliencia operativa.
• Desarrollar arquitecturas de referencia, diseños de alto y bajo nivel, modelos de capacidad, listas de materiales, evaluaciones de tecnología y hojas de ruta de implementación.
• Liderar evaluaciones técnicas, pruebas de conceptos, evaluaciones de proveedores y juntas de revisión de arquitectura.
• Colaborar con equipos de infraestructura, redes, seguridad, almacenamiento, nube, datos, aplicaciones y operaciones.
• Definir objetivos de rendimiento, disponibilidad, escalabilidad, seguridad y costos y validar la arquitectura frente a criterios de aceptación mensurables.
• Proporcionar liderazgo técnico durante la implementación, migración, integración, resolución de problemas y transición de producción.
• Habilidades técnicas requeridas
Arquitectura de IA/ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, operador de GPU y ecosistema de plataforma de IA.
• PyTorch, TensorFlow, JAX y comprensión operativa de las cargas de trabajo de capacitación e inferencia.
• Programación de GPU, multiinquilino, MIG/vGPU, utilización de GPU y ubicación de cargas de trabajo.
• LLM, IA generativa, RAG, ajuste fino, servicio de modelos y arquitectura de inferencia.
Infraestructura de fábrica de GPU e IA
• NVIDIA A100/H100/H200/B200 o plataformas GPU equivalentes; Familiaridad con los sistemas de próxima generación.
• NVLink, NVSwitch, topología PCIe y arquitectura de rendimiento multi-GPU.
• Arquitectura de servidor GPU DGX/HGX/OEM y gestión del ciclo de vida.
• Planificación de la capacidad de AI Factory, densidad de racks, energía, refrigeración, puesta en marcha y estrategia de ciclo de vida.
Redes de alto rendimiento
• Ethernet 100/200/400/800G, InfiniBand, RoCEv2 y RDMA, Netris
• Tecnologías NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum y BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS y gestión de congestión.
• Tráfico de GPU este-oeste, GPUDirect RDMA y resolución de problemas de rendimiento de red.
Arquitectura de datos y almacenamiento de IA
• Sistemas de archivos paralelos, almacenamiento de objetos, NFS, NVMe/NVMe-oF y canalizaciones de datos de alto rendimiento.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp o tecnologías equivalentes.
• Conceptos de lago/casa del lago de datos, metadatos, linaje, movimiento de datos y ciclo de vida de los datos.
• Almacenamiento GPUDirect y optimización del rendimiento del almacenamiento/red.
Plataforma y orquestación de IA
• Kubernetes, operador de GPU, tiempos de ejecución de contenedores y programación de GPU de Kubernetes.
• HPC u otros programadores de carga de trabajo equivalentes.
• Plataformas de servicio/inferencia de modelos y arquitectura de plataforma MLOps.
• Puertas de enlace API, descubrimiento de servicios, gestión de secretos e integración de plataformas.
Arquitectura híbrida y de nube
• Servicios de seguridad e infraestructura de IA de AWS y/o Azure.
• Conectividad de nube híbrida, IAM, redes privadas, almacenamiento en nube y ubicación de cargas de trabajo.
• Optimización de costos de la nube, planificación de capacidad y consideraciones de FinOps para cargas de trabajo de GPU.
Seguridad y gobernanza
• Zero Trust, segmentación de red, IAM/RBAC, PAM e identidad de carga de trabajo.
• GPU, DPU, contenedor, Kubernetes, firmware y seguridad de la cadena de suministro.
• Cifrado en reposo/en tránsito, gestión de secretos, registro de auditoría y controles de cumplimiento.
• Riesgos específicos de la IA, incluida la protección de datos/modelos, el aislamiento de inquilinos y el acceso seguro a los modelos.
Observabilidad y confiabilidad
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM y telemetría de infraestructura.
• Monitoreo en GPU, CPU, memoria, red, almacenamiento, energía y dominios térmicos.
• Alta disponibilidad, respaldo/restauración, recuperación ante desastres, continuidad del negocio y diseño de dominio de fallas.
• Ingeniería de rendimiento, análisis de cuellos de botella, diseño SLO/SLA y previsión de capacidad.
Entregables de arquitectura
• Arquitectura de referencia de AI Factory y planos de soluciones
• Diseño de alto nivel (HLD) y diseño de bajo nivel (LLD)
• Diagramas de arquitectura de red, computación, GPU y almacenamiento.
• Modelos de capacidad, rendimiento y escalabilidad.
• Documentos de evaluación de tecnología y comparación de proveedores.
• Arquitectura de seguridad y entradas del modelo de amenazas.
• Lista de materiales (BOM) y dimensionamiento de la infraestructura
• Estrategia de migración/implementación y hoja de ruta de implementación
• Lista de verificación de preparación operativa, runbooks y criterios de aceptación
Experiencia y calificaciones
• Más de 10 años de experiencia en infraestructura, nube, arquitectura empresarial o arquitectura de soluciones, con una exposición significativa a la infraestructura de IA/GPU.
• Experiencia comprobada en el diseño de plataformas empresariales a gran escala y en la traducción de requisitos comerciales en arquitecturas técnicas.
• Comprensión práctica de infraestructura física, sistemas GPU, redes, almacenamiento y plataformas Linux.
• Se prefiere Licenciatura en Ciencias de la Computación, Ingeniería, Tecnología de la Información o campo relacionado.…
Fuente: Empleos remotos en la UE (https://euremotejobs.com/job/ai-solution-architect-2/)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Fuente: Uvation
Publicación proporcionada por Uvation.