Emploi
De la source partenaire
Architecte de solutions IA
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Oui
- Entreprise
- Uvation
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
Aperçu du poste
Nous recherchons un architecte de solutions IA expérimenté
pour concevoir et diriger des solutions d'infrastructure AI Factory et GPU de bout en bout couvrant le calcul, les réseaux hautes performances, le stockage, Kubernetes, le cloud et les plates-formes IA/ML. Le rôle nécessite une solide expertise dans les technologies GPU NVIDIA, les charges de travail d'IA, l'architecture d'infrastructure évolutive, la sécurité, l'observabilité, l'ingénierie des performances et la planification des capacités.
Principales responsabilités
• Propre architecture de bout en bout pour les solutions AI Factory et d'entreprise, depuis les exigences jusqu'à la préparation à la production.
• Évaluez les exigences en matière de charge de travail IA/ML pour la formation, le réglage fin, l'inférence, le traitement par lots et le calcul haute performance.
• Concevoir des architectures de calcul GPU incluant les plates-formes NVIDIA HGX/DGX/OEM, les systèmes multi-GPU, NVLink/NVSwitch et l'allocation des ressources GPU.
• Concevoir un réseau d'IA hautes performances à l'aide d'architectures Ethernet 100/200/400/800G, EVPN/VXLAN et leaf-spine.
• Concevoir des architectures de stockage et de données IA à l'aide du stockage d'objets, de systèmes de fichiers parallèles comme Ceph, WEKA ou de plateformes équivalentes.
• Définir l'architecture de la plateforme d'IA sur Kubernetes, HPC, les environnements d'exécution de conteneurs, les plateformes de service de modèles et les frameworks d'IA d'entreprise.
• Établir des normes d'architecture pour la sécurité, l'identité, l'isolation des locataires, la protection des données, l'observabilité, la reprise après sinistre et la résilience opérationnelle.
• Développer des architectures de référence, des conceptions de haut niveau/bas niveau, des modèles de capacité, des nomenclatures, des évaluations technologiques et des feuilles de route de mise en œuvre.
• Diriger les évaluations techniques, les validations de principe, les évaluations des fournisseurs et les comités de révision de l'architecture.
• Collaborer avec les équipes d'infrastructure, de réseau, de sécurité, de stockage, de cloud, de données, d'applications et d'exploitation.
• Définir les objectifs de performances, de disponibilité, d'évolutivité, de sécurité et de coûts et valider l'architecture par rapport à des critères d'acceptation mesurables.
• Assurer un leadership technique pendant le déploiement, la migration, l'intégration, le dépannage et la transition de production.
• Compétences techniques requises
Architecture IA/ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, GPU Operator et écosystème de plateforme IA.
• PyTorch, TensorFlow, JAX et compréhension opérationnelle des charges de travail de formation et d'inférence.
• Planification GPU, multilocation, MIG/vGPU, utilisation GPU et placement des charges de travail.
• LLM, IA générative, RAG, mise au point, service de modèles et architecture d'inférence.
Infrastructure d'usine GPU et IA
• NVIDIA A100/H100/H200/B200 ou plates-formes GPU équivalentes ; familiarité avec les systèmes de nouvelle génération.
• NVLink, NVSwitch, topologie PCIe et architecture de performances multi-GPU.
• Architecture du serveur GPU DGX/HGX/OEM et gestion du cycle de vie.
• Planification de la capacité d'AI Factory, densité des racks, alimentation, refroidissement, mise en service et stratégie de cycle de vie.
Réseau haute performance
• Ethernet 100/200/400/800G, InfiniBand, RoCEv2 et RDMA, Netris
• Technologies NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum et BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS et gestion des congestions.
• Trafic GPU est-ouest, GPUDirect RDMA et dépannage des performances réseau.
Architecture de stockage et de données IA
• Systèmes de fichiers parallèles, stockage d'objets, NFS, NVMe/NVMe-oF et pipelines de données à haut débit.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp ou technologies équivalentes.
• Concepts de lac/lakehouse de données, métadonnées, traçabilité, mouvement des données et cycle de vie des données.
• GPUDirect Storage et optimisation des performances de stockage/réseau.
Plateforme IA et orchestration
• Kubernetes, opérateur GPU, environnements d'exécution de conteneurs et planification GPU Kubernetes.
• HPC ou autres planificateurs de charge de travail équivalents.
• Modéliser les plates-formes de service/d'inférence et l'architecture de la plate-forme MLOps.
• Passerelles API, découverte de services, gestion des secrets et intégration de plateforme.
Architecture cloud et hybride
• Services d'infrastructure et de sécurité AWS et/ou Azure AI.
• Connectivité cloud hybride, IAM, réseau privé, stockage cloud et placement des charges de travail.
• Optimisation des coûts du cloud, planification de la capacité et considérations FinOps pour les charges de travail GPU.
Sécurité et gouvernance
• Zero Trust, segmentation réseau, IAM/RBAC, PAM et identité de charge de travail.
• Sécurité du GPU, du DPU, des conteneurs, de Kubernetes, du firmware et de la chaîne d'approvisionnement.
• Chiffrement au repos/en transit, gestion des secrets, journalisation d'audit et contrôles de conformité.
• Risques spécifiques à l'IA, notamment la protection des données/modèles, l'isolation des locataires et l'accès sécurisé aux modèles.
Observabilité et fiabilité
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM et télémétrie d'infrastructure.
• Surveillance des domaines GPU, CPU, mémoire, réseau, stockage, alimentation et thermique.
• Haute disponibilité, sauvegarde/restauration, reprise après sinistre, continuité d'activité et conception de domaines de défaillance.
• Ingénierie des performances, analyse des goulots d'étranglement, conception SLO/SLA et prévision de capacité.
Livrables architecturaux
• Architecture de référence et plans de solution AI Factory
• Conception de haut niveau (HLD) et conception de bas niveau (LLD)
• Diagrammes d'architecture de réseau, de calcul, de GPU et de stockage
• Modèles de capacité, de performances et d'évolutivité
• Documents d'évaluation technologique et de comparaison des fournisseurs
• Architecture de sécurité et entrées du modèle de menace
• Nomenclature (BOM) et dimensionnement des infrastructures
• Stratégie de migration/déploiement et feuille de route de mise en œuvre
• Liste de contrôle de préparation opérationnelle, runbooks et critères d'acceptation
Expérience et qualifications
• Plus de 10 ans d'expérience en infrastructure, cloud, architecture d'entreprise ou architecture de solutions, avec une exposition significative à l'infrastructure IA/GPU.
• Expérience avérée dans la conception de plates-formes d'entreprise à grande échelle et dans la traduction des exigences commerciales en architectures techniques.
• Compréhension pratique de l'infrastructure physique, des systèmes GPU, des réseaux, du stockage et des plates-formes Linux.
• Baccalauréat en informatique, en ingénierie, en technologie de l'information ou dans un domaine connexe préféré.…
Source : Emplois à distance dans l'UE (https://euremotejobs.com/job/ai-solution-architect-2/)
Nous recherchons un architecte de solutions IA expérimenté
pour concevoir et diriger des solutions d'infrastructure AI Factory et GPU de bout en bout couvrant le calcul, les réseaux hautes performances, le stockage, Kubernetes, le cloud et les plates-formes IA/ML. Le rôle nécessite une solide expertise dans les technologies GPU NVIDIA, les charges de travail d'IA, l'architecture d'infrastructure évolutive, la sécurité, l'observabilité, l'ingénierie des performances et la planification des capacités.
Principales responsabilités
• Propre architecture de bout en bout pour les solutions AI Factory et d'entreprise, depuis les exigences jusqu'à la préparation à la production.
• Évaluez les exigences en matière de charge de travail IA/ML pour la formation, le réglage fin, l'inférence, le traitement par lots et le calcul haute performance.
• Concevoir des architectures de calcul GPU incluant les plates-formes NVIDIA HGX/DGX/OEM, les systèmes multi-GPU, NVLink/NVSwitch et l'allocation des ressources GPU.
• Concevoir un réseau d'IA hautes performances à l'aide d'architectures Ethernet 100/200/400/800G, EVPN/VXLAN et leaf-spine.
• Concevoir des architectures de stockage et de données IA à l'aide du stockage d'objets, de systèmes de fichiers parallèles comme Ceph, WEKA ou de plateformes équivalentes.
• Définir l'architecture de la plateforme d'IA sur Kubernetes, HPC, les environnements d'exécution de conteneurs, les plateformes de service de modèles et les frameworks d'IA d'entreprise.
• Établir des normes d'architecture pour la sécurité, l'identité, l'isolation des locataires, la protection des données, l'observabilité, la reprise après sinistre et la résilience opérationnelle.
• Développer des architectures de référence, des conceptions de haut niveau/bas niveau, des modèles de capacité, des nomenclatures, des évaluations technologiques et des feuilles de route de mise en œuvre.
• Diriger les évaluations techniques, les validations de principe, les évaluations des fournisseurs et les comités de révision de l'architecture.
• Collaborer avec les équipes d'infrastructure, de réseau, de sécurité, de stockage, de cloud, de données, d'applications et d'exploitation.
• Définir les objectifs de performances, de disponibilité, d'évolutivité, de sécurité et de coûts et valider l'architecture par rapport à des critères d'acceptation mesurables.
• Assurer un leadership technique pendant le déploiement, la migration, l'intégration, le dépannage et la transition de production.
• Compétences techniques requises
Architecture IA/ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, GPU Operator et écosystème de plateforme IA.
• PyTorch, TensorFlow, JAX et compréhension opérationnelle des charges de travail de formation et d'inférence.
• Planification GPU, multilocation, MIG/vGPU, utilisation GPU et placement des charges de travail.
• LLM, IA générative, RAG, mise au point, service de modèles et architecture d'inférence.
Infrastructure d'usine GPU et IA
• NVIDIA A100/H100/H200/B200 ou plates-formes GPU équivalentes ; familiarité avec les systèmes de nouvelle génération.
• NVLink, NVSwitch, topologie PCIe et architecture de performances multi-GPU.
• Architecture du serveur GPU DGX/HGX/OEM et gestion du cycle de vie.
• Planification de la capacité d'AI Factory, densité des racks, alimentation, refroidissement, mise en service et stratégie de cycle de vie.
Réseau haute performance
• Ethernet 100/200/400/800G, InfiniBand, RoCEv2 et RDMA, Netris
• Technologies NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum et BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS et gestion des congestions.
• Trafic GPU est-ouest, GPUDirect RDMA et dépannage des performances réseau.
Architecture de stockage et de données IA
• Systèmes de fichiers parallèles, stockage d'objets, NFS, NVMe/NVMe-oF et pipelines de données à haut débit.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp ou technologies équivalentes.
• Concepts de lac/lakehouse de données, métadonnées, traçabilité, mouvement des données et cycle de vie des données.
• GPUDirect Storage et optimisation des performances de stockage/réseau.
Plateforme IA et orchestration
• Kubernetes, opérateur GPU, environnements d'exécution de conteneurs et planification GPU Kubernetes.
• HPC ou autres planificateurs de charge de travail équivalents.
• Modéliser les plates-formes de service/d'inférence et l'architecture de la plate-forme MLOps.
• Passerelles API, découverte de services, gestion des secrets et intégration de plateforme.
Architecture cloud et hybride
• Services d'infrastructure et de sécurité AWS et/ou Azure AI.
• Connectivité cloud hybride, IAM, réseau privé, stockage cloud et placement des charges de travail.
• Optimisation des coûts du cloud, planification de la capacité et considérations FinOps pour les charges de travail GPU.
Sécurité et gouvernance
• Zero Trust, segmentation réseau, IAM/RBAC, PAM et identité de charge de travail.
• Sécurité du GPU, du DPU, des conteneurs, de Kubernetes, du firmware et de la chaîne d'approvisionnement.
• Chiffrement au repos/en transit, gestion des secrets, journalisation d'audit et contrôles de conformité.
• Risques spécifiques à l'IA, notamment la protection des données/modèles, l'isolation des locataires et l'accès sécurisé aux modèles.
Observabilité et fiabilité
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM et télémétrie d'infrastructure.
• Surveillance des domaines GPU, CPU, mémoire, réseau, stockage, alimentation et thermique.
• Haute disponibilité, sauvegarde/restauration, reprise après sinistre, continuité d'activité et conception de domaines de défaillance.
• Ingénierie des performances, analyse des goulots d'étranglement, conception SLO/SLA et prévision de capacité.
Livrables architecturaux
• Architecture de référence et plans de solution AI Factory
• Conception de haut niveau (HLD) et conception de bas niveau (LLD)
• Diagrammes d'architecture de réseau, de calcul, de GPU et de stockage
• Modèles de capacité, de performances et d'évolutivité
• Documents d'évaluation technologique et de comparaison des fournisseurs
• Architecture de sécurité et entrées du modèle de menace
• Nomenclature (BOM) et dimensionnement des infrastructures
• Stratégie de migration/déploiement et feuille de route de mise en œuvre
• Liste de contrôle de préparation opérationnelle, runbooks et critères d'acceptation
Expérience et qualifications
• Plus de 10 ans d'expérience en infrastructure, cloud, architecture d'entreprise ou architecture de solutions, avec une exposition significative à l'infrastructure IA/GPU.
• Expérience avérée dans la conception de plates-formes d'entreprise à grande échelle et dans la traduction des exigences commerciales en architectures techniques.
• Compréhension pratique de l'infrastructure physique, des systèmes GPU, des réseaux, du stockage et des plates-formes Linux.
• Baccalauréat en informatique, en ingénierie, en technologie de l'information ou dans un domaine connexe préféré.…
Source : Emplois à distance dans l'UE (https://euremotejobs.com/job/ai-solution-architect-2/)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Uvation
Annonce fournie par Uvation.