Praca
Z kanału partnera
Architekt rozwiązań AI
Cena na życzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Tak
- Firma
- Uvation
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
Przegląd pracy
Poszukujemy doświadczonego architekta rozwiązań AI
projektować i prowadzić kompleksowe rozwiązania w zakresie infrastruktury AI Factory i GPU dla przedsiębiorstw, obejmujące obliczenia, wysokowydajne sieci, pamięć masową, Kubernetes, chmurę i platformy AI/ML. Rola ta wymaga dużej wiedzy specjalistycznej w zakresie technologii procesorów graficznych NVIDIA, obciążeń AI, skalowalnej architektury infrastruktury, bezpieczeństwa, obserwowalności, inżynierii wydajności i planowania pojemności.
Kluczowe obowiązki
• Własna, kompleksowa architektura rozwiązań AI Factory i Enterprise AI od wymagań po gotowość produkcyjną.
• Ocena wymagań dotyczących obciążenia AI/ML w zakresie szkolenia, dostrajania, wnioskowania, przetwarzania wsadowego i obliczeń o wysokiej wydajności.
• Projektowanie architektur obliczeniowych GPU, w tym platform NVIDIA HGX/DGX/OEM, systemów z wieloma procesorami graficznymi, NVLink/NVSwitch i alokacji zasobów GPU.
• Projektuj wysokowydajne sieci AI z wykorzystaniem architektur 100/200/400/800G Ethernet, EVPN/VXLAN i typu „leaf-spine”.
• Projektuj architektury pamięci masowej i danych wykorzystujące pamięć obiektową, równoległe systemy plików, takie jak Ceph, WEKA lub równoważne platformy.
• Zdefiniuj architekturę platformy AI w Kubernetes, HPC, środowiskach wykonawczych kontenerów, platformach obsługujących modele i platformach AI dla przedsiębiorstw.
• Ustanawiaj standardy architektury w zakresie bezpieczeństwa, tożsamości, izolacji najemców, ochrony danych, obserwowalności, odzyskiwania po awarii i odporności operacyjnej.
• Opracuj architektury referencyjne, projekty wysokiego/niskiego poziomu, modele wydajności, zestawienia materiałowe, oceny technologii i plany wdrożenia.
• Kierowanie ocenami technicznymi, weryfikacją koncepcji, ocenami dostawców i komisjami recenzującymi architekturę.
• Współpraca z zespołami zajmującymi się infrastrukturą, siecią, bezpieczeństwem, pamięcią masową, chmurą, danymi, aplikacjami i operacjami.
• Zdefiniuj cele w zakresie wydajności, dostępności, skalowalności, bezpieczeństwa i kosztów oraz zweryfikuj architekturę pod kątem mierzalnych kryteriów akceptacji.
• Zapewnij kierownictwo techniczne podczas wdrażania, migracji, integracji, rozwiązywania problemów i przenoszenia produkcji.
• Wymagane umiejętności techniczne
Architektura AI/ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, operator GPU i ekosystem platformy AI.
• PyTorch, TensorFlow, JAX i operacyjne zrozumienie obciążeń związanych ze szkoleniem i wnioskowaniem.
• Planowanie GPU, wielodostępność, MIG/vGPU, wykorzystanie GPU i rozmieszczenie obciążeń.
• LLM, generatywna sztuczna inteligencja, RAG, dostrajanie, obsługa modeli i architektura wnioskowania.
Infrastruktura fabryczna procesorów graficznych i sztucznej inteligencji
• NVIDIA A100/H100/H200/B200 lub równoważne platformy GPU; znajomość systemów nowej generacji.
• NVLink, NVSwitch, topologia PCIe i architektura wydajności z wieloma procesorami graficznymi.
• Architektura serwera GPU DGX/HGX/OEM i zarządzanie cyklem życia.
• Planowanie wydajności fabryki AI, gęstość szaf, zasilanie, chłodzenie, uruchomienie i strategia cyklu życia.
Sieć o wysokiej wydajności
• 100/200/400/800G Ethernet, InfiniBand, RoCEv2 i RDMA, Netris
• Technologie NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum i BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS i zarządzanie przeciążeniami.
• Ruch GPU ze wschodu na zachód, GPUDirect RDMA i rozwiązywanie problemów z wydajnością sieci.
Pamięć masowa AI i architektura danych
• Równoległe systemy plików, pamięć obiektowa, NFS, NVMe/NVMe-oF i potoki danych o dużej przepustowości.
• Technologie Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp lub równoważne.
• Koncepcje jeziora danych/lakehouse, metadane, pochodzenie, przenoszenie danych i cykl życia danych.
• Optymalizacja wydajności pamięci masowej i sieci GPUDirect.
Platforma i orkiestracja AI
• Kubernetes, operator GPU, środowiska wykonawcze kontenerów i planowanie GPU Kubernetes.
• HPC lub inne równoważne programy planujące obciążenie.
• Modeluj platformy obsługujące/wnioskowujące i architekturę platformy MLOps.
• Bramy API, wykrywanie usług, zarządzanie sekretami i integracja platform.
Architektura chmurowa i hybrydowa
• Infrastruktura i usługi bezpieczeństwa AWS i/lub Azure AI.
• Łączność z chmurą hybrydową, uprawnienia IAM, sieci prywatne, przechowywanie w chmurze i rozmieszczenie obciążeń.
• Optymalizacja kosztów chmury, planowanie wydajności i kwestie FinOps dla obciążeń GPU.
Bezpieczeństwo i zarządzanie
• Zero zaufania, segmentacja sieci, IAM/RBAC, PAM i tożsamość obciążenia.
• GPU, DPU, kontener, Kubernetes, oprogramowanie sprzętowe i bezpieczeństwo łańcucha dostaw.
• Szyfrowanie w stanie spoczynku/w transporcie, zarządzanie tajemnicami, rejestrowanie audytów i kontrole zgodności.
• Zagrożenia związane ze sztuczną inteligencją, w tym ochrona danych/modeli, izolacja najemców i bezpieczny dostęp do modeli.
Obserwowalność i niezawodność
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM i telemetria infrastruktury.
• Monitorowanie domen procesora graficznego, procesora, pamięci, sieci, pamięci masowej, zasilania i temperatury.
• Wysoka dostępność, kopie zapasowe/przywracanie, odzyskiwanie po awarii, ciągłość biznesowa i projektowanie domeny awaryjnej.
• Inżynieria wydajności, analiza wąskich gardeł, projektowanie SLO/SLA i prognozowanie wydajności.
Elementy dostarczane architektury
• Architektura referencyjna AI Factory i plany rozwiązań
• Projektowanie wysokiego poziomu (HLD) i projektowanie niskiego poziomu (LLD)
• Diagramy architektury sieci, obliczeń, GPU i pamięci masowej
• Modele pojemności, wydajności i skalowalności
• Dokumenty dotyczące oceny technologii i porównania dostawców
• Dane wejściowe dotyczące architektury bezpieczeństwa i modelu zagrożeń
• Zestawienie materiałów (BOM) i dobór infrastruktury
• Strategia migracji/wdrożenia i plan wdrożenia
• Lista kontrolna gotowości operacyjnej, elementy runbook i kryteria akceptacji
Doświadczenie i kwalifikacje
• Ponad 10 lat doświadczenia w infrastrukturze, chmurze, architekturze korporacyjnej lub architekturze rozwiązań, ze znacznym narażeniem na infrastrukturę AI/GPU.
• Udokumentowane doświadczenie w projektowaniu platform dla dużych przedsiębiorstw i przekładaniu wymagań biznesowych na architektury techniczne.
• Praktyczna znajomość infrastruktury fizycznej, systemów GPU, sieci, pamięci masowej i platform Linux.
• Mile widziane wykształcenie wyższe w dziedzinie informatyki, inżynierii, technologii informatycznych lub pokrewnej.…
Źródło: Praca zdalna w UE (https://euremotejobs.com/job/ai-solution-architect-2/)
Poszukujemy doświadczonego architekta rozwiązań AI
projektować i prowadzić kompleksowe rozwiązania w zakresie infrastruktury AI Factory i GPU dla przedsiębiorstw, obejmujące obliczenia, wysokowydajne sieci, pamięć masową, Kubernetes, chmurę i platformy AI/ML. Rola ta wymaga dużej wiedzy specjalistycznej w zakresie technologii procesorów graficznych NVIDIA, obciążeń AI, skalowalnej architektury infrastruktury, bezpieczeństwa, obserwowalności, inżynierii wydajności i planowania pojemności.
Kluczowe obowiązki
• Własna, kompleksowa architektura rozwiązań AI Factory i Enterprise AI od wymagań po gotowość produkcyjną.
• Ocena wymagań dotyczących obciążenia AI/ML w zakresie szkolenia, dostrajania, wnioskowania, przetwarzania wsadowego i obliczeń o wysokiej wydajności.
• Projektowanie architektur obliczeniowych GPU, w tym platform NVIDIA HGX/DGX/OEM, systemów z wieloma procesorami graficznymi, NVLink/NVSwitch i alokacji zasobów GPU.
• Projektuj wysokowydajne sieci AI z wykorzystaniem architektur 100/200/400/800G Ethernet, EVPN/VXLAN i typu „leaf-spine”.
• Projektuj architektury pamięci masowej i danych wykorzystujące pamięć obiektową, równoległe systemy plików, takie jak Ceph, WEKA lub równoważne platformy.
• Zdefiniuj architekturę platformy AI w Kubernetes, HPC, środowiskach wykonawczych kontenerów, platformach obsługujących modele i platformach AI dla przedsiębiorstw.
• Ustanawiaj standardy architektury w zakresie bezpieczeństwa, tożsamości, izolacji najemców, ochrony danych, obserwowalności, odzyskiwania po awarii i odporności operacyjnej.
• Opracuj architektury referencyjne, projekty wysokiego/niskiego poziomu, modele wydajności, zestawienia materiałowe, oceny technologii i plany wdrożenia.
• Kierowanie ocenami technicznymi, weryfikacją koncepcji, ocenami dostawców i komisjami recenzującymi architekturę.
• Współpraca z zespołami zajmującymi się infrastrukturą, siecią, bezpieczeństwem, pamięcią masową, chmurą, danymi, aplikacjami i operacjami.
• Zdefiniuj cele w zakresie wydajności, dostępności, skalowalności, bezpieczeństwa i kosztów oraz zweryfikuj architekturę pod kątem mierzalnych kryteriów akceptacji.
• Zapewnij kierownictwo techniczne podczas wdrażania, migracji, integracji, rozwiązywania problemów i przenoszenia produkcji.
• Wymagane umiejętności techniczne
Architektura AI/ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, operator GPU i ekosystem platformy AI.
• PyTorch, TensorFlow, JAX i operacyjne zrozumienie obciążeń związanych ze szkoleniem i wnioskowaniem.
• Planowanie GPU, wielodostępność, MIG/vGPU, wykorzystanie GPU i rozmieszczenie obciążeń.
• LLM, generatywna sztuczna inteligencja, RAG, dostrajanie, obsługa modeli i architektura wnioskowania.
Infrastruktura fabryczna procesorów graficznych i sztucznej inteligencji
• NVIDIA A100/H100/H200/B200 lub równoważne platformy GPU; znajomość systemów nowej generacji.
• NVLink, NVSwitch, topologia PCIe i architektura wydajności z wieloma procesorami graficznymi.
• Architektura serwera GPU DGX/HGX/OEM i zarządzanie cyklem życia.
• Planowanie wydajności fabryki AI, gęstość szaf, zasilanie, chłodzenie, uruchomienie i strategia cyklu życia.
Sieć o wysokiej wydajności
• 100/200/400/800G Ethernet, InfiniBand, RoCEv2 i RDMA, Netris
• Technologie NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum i BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS i zarządzanie przeciążeniami.
• Ruch GPU ze wschodu na zachód, GPUDirect RDMA i rozwiązywanie problemów z wydajnością sieci.
Pamięć masowa AI i architektura danych
• Równoległe systemy plików, pamięć obiektowa, NFS, NVMe/NVMe-oF i potoki danych o dużej przepustowości.
• Technologie Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp lub równoważne.
• Koncepcje jeziora danych/lakehouse, metadane, pochodzenie, przenoszenie danych i cykl życia danych.
• Optymalizacja wydajności pamięci masowej i sieci GPUDirect.
Platforma i orkiestracja AI
• Kubernetes, operator GPU, środowiska wykonawcze kontenerów i planowanie GPU Kubernetes.
• HPC lub inne równoważne programy planujące obciążenie.
• Modeluj platformy obsługujące/wnioskowujące i architekturę platformy MLOps.
• Bramy API, wykrywanie usług, zarządzanie sekretami i integracja platform.
Architektura chmurowa i hybrydowa
• Infrastruktura i usługi bezpieczeństwa AWS i/lub Azure AI.
• Łączność z chmurą hybrydową, uprawnienia IAM, sieci prywatne, przechowywanie w chmurze i rozmieszczenie obciążeń.
• Optymalizacja kosztów chmury, planowanie wydajności i kwestie FinOps dla obciążeń GPU.
Bezpieczeństwo i zarządzanie
• Zero zaufania, segmentacja sieci, IAM/RBAC, PAM i tożsamość obciążenia.
• GPU, DPU, kontener, Kubernetes, oprogramowanie sprzętowe i bezpieczeństwo łańcucha dostaw.
• Szyfrowanie w stanie spoczynku/w transporcie, zarządzanie tajemnicami, rejestrowanie audytów i kontrole zgodności.
• Zagrożenia związane ze sztuczną inteligencją, w tym ochrona danych/modeli, izolacja najemców i bezpieczny dostęp do modeli.
Obserwowalność i niezawodność
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM i telemetria infrastruktury.
• Monitorowanie domen procesora graficznego, procesora, pamięci, sieci, pamięci masowej, zasilania i temperatury.
• Wysoka dostępność, kopie zapasowe/przywracanie, odzyskiwanie po awarii, ciągłość biznesowa i projektowanie domeny awaryjnej.
• Inżynieria wydajności, analiza wąskich gardeł, projektowanie SLO/SLA i prognozowanie wydajności.
Elementy dostarczane architektury
• Architektura referencyjna AI Factory i plany rozwiązań
• Projektowanie wysokiego poziomu (HLD) i projektowanie niskiego poziomu (LLD)
• Diagramy architektury sieci, obliczeń, GPU i pamięci masowej
• Modele pojemności, wydajności i skalowalności
• Dokumenty dotyczące oceny technologii i porównania dostawców
• Dane wejściowe dotyczące architektury bezpieczeństwa i modelu zagrożeń
• Zestawienie materiałów (BOM) i dobór infrastruktury
• Strategia migracji/wdrożenia i plan wdrożenia
• Lista kontrolna gotowości operacyjnej, elementy runbook i kryteria akceptacji
Doświadczenie i kwalifikacje
• Ponad 10 lat doświadczenia w infrastrukturze, chmurze, architekturze korporacyjnej lub architekturze rozwiązań, ze znacznym narażeniem na infrastrukturę AI/GPU.
• Udokumentowane doświadczenie w projektowaniu platform dla dużych przedsiębiorstw i przekładaniu wymagań biznesowych na architektury techniczne.
• Praktyczna znajomość infrastruktury fizycznej, systemów GPU, sieci, pamięci masowej i platform Linux.
• Mile widziane wykształcenie wyższe w dziedzinie informatyki, inżynierii, technologii informatycznych lub pokrewnej.…
Źródło: Praca zdalna w UE (https://euremotejobs.com/job/ai-solution-architect-2/)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Uvation
Ogłoszenie pochodzi od Uvation.