Вакансія
З партнерського стрічки
Архітектор рішень AI
Ціна за запитом
Деталі
- Тип зайнятості
- Повна зайнятість
- Віддалено
- Так
- Компанія
- Uvation
Опис
Автоматичний переклад з English. Оригінальний текст є авторитетним. Машинний переклад — готується точніший варіант.
Огляд роботи
Ми шукаємо досвідченого архітектора рішень AI
розробляти та керувати наскрізними корпоративними рішеннями AI Factory та GPU інфраструктури, що охоплюють обчислення, високопродуктивну мережу, сховище, Kubernetes, хмару та платформи AI/ML. Посада вимагає значного досвіду в технологіях NVIDIA GPU, робочих навантаженнях AI, масштабованій архітектурі інфраструктури, безпеці, спостережливості, розробці продуктивності та плануванні потужностей.
Основні обов'язки
• Власна наскрізна архітектура для заводських і корпоративних рішень штучного інтелекту від вимог до готовності до виробництва.
• Оцініть вимоги до робочого навантаження AI/ML для навчання, тонкого налаштування, висновків, пакетної обробки та високопродуктивних обчислень.
• Розробка обчислювальних архітектур GPU, включаючи платформи NVIDIA HGX/DGX/OEM, системи з кількома GPU, NVLink/NVSwitch і розподіл ресурсів GPU.
• Створюйте високопродуктивні мережі штучного інтелекту з використанням 100/200/400/800G Ethernet, EVPN/VXLAN і архітектури leaf-spine.
• Розробляйте архітектури сховища та даних штучного інтелекту з використанням сховища об’єктів, паралельних файлових систем, таких як Ceph, WEKA або еквівалентних платформ.
• Визначте архітектуру платформи штучного інтелекту в Kubernetes, HPC, середовищі виконання контейнерів, платформах обслуговування моделей і корпоративних фреймворках ШІ.
• Встановіть стандарти архітектури для безпеки, ідентичності, ізоляції орендарів, захисту даних, спостережуваності, аварійного відновлення та операційної стійкості.
• Розробка еталонних архітектур, проектів високого/низького рівня, моделей потужності, описів матеріалів, оцінок технологій і дорожніх карт впровадження.
• Керувати технічними оцінками, перевірками концепцій, оцінками постачальників і комісіями з перевірки архітектури.
• Співпрацюйте з групами інфраструктури, мережі, безпеки, сховища, хмари, обробки даних, додатків та операцій.
• Визначте цільові показники щодо продуктивності, доступності, масштабованості, безпеки та вартості та перевірте архітектуру на відповідність вимірюваним критеріям прийнятності.
• Забезпечення технічного керівництва під час розгортання, міграції, інтеграції, усунення несправностей і переходу до виробництва.
• Необхідні технічні навички
Архітектура AI / ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, GPU Operator та екосистема платформи AI.
• PyTorch, TensorFlow, JAX та оперативне розуміння робочих навантажень навчання та висновків.
• Планування графічного процесора, мультитенантність, MIG/vGPU, використання GPU та розміщення робочого навантаження.
• LLM, генеративний штучний інтелект, RAG, точне налаштування, обслуговування моделей і архітектура висновків.
Заводська інфраструктура GPU та AI
• NVIDIA A100/H100/H200/B200 або еквівалентні GPU платформи; знайомство з системами нового покоління.
• NVLink, NVSwitch, топологія PCIe та архітектура продуктивності з кількома GPU.
• Серверна архітектура GPU DGX/HGX/OEM і керування життєвим циклом.
• Планування заводських потужностей ШІ, щільність стелажів, живлення, охолодження, введення в експлуатацію та стратегія життєвого циклу.
Високопродуктивна мережа
• 100/200/400/800G Ethernet, InfiniBand, RoCEv2 і RDMA, Netris
• Технології NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum і BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS і керування перевантаженнями.
• Трафік GPU схід-захід, GPUDirect RDMA та усунення несправностей продуктивності мережі.
Архітектура зберігання та даних AI
• Паралельні файлові системи, сховище об’єктів, NFS, NVMe/NVMe-oF і високопродуктивні конвеєри даних.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp або еквівалентні технології.
• Концепції озера даних/озерної хати, метадані, походження, переміщення даних і життєвий цикл даних.
• GPUDirect Storage та оптимізація сховища/мережі.
Платформа AI та оркестровка
• Kubernetes, GPU Operator, середовища виконання контейнерів і Kubernetes GPU планування.
• HPC або інші еквівалентні планувальники робочого навантаження.
• Платформи обслуговування моделей/виведення та архітектура платформи MLOps.
• Шлюзи API, виявлення служб, керування секретами та інтеграція платформи.
Хмарна та гібридна архітектура
• Інфраструктура та служби безпеки AWS та/або Azure AI.
• Гібридне хмарне підключення, IAM, приватна мережа, хмарне сховище та розміщення робочого навантаження.
• Оптимізація витрат у хмарі, планування потужності та міркування FinOps для робочих навантажень GPU.
Безпека та управління
• Нульова довіра, сегментація мережі, IAM/RBAC, PAM та ідентифікація робочого навантаження.
• GPU, DPU, контейнер, Kubernetes, вбудоване програмне забезпечення та безпека ланцюга поставок.
• Шифрування під час передачі/передачі, керування секретами, журнал аудиту та контроль відповідності.
• Специфічні ризики ШІ, включаючи захист даних/моделі, ізоляцію клієнта та безпечний доступ до моделі.
Спостережливість і надійність
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM та інфраструктурна телеметрія.
• Моніторинг графічного процесора, центрального процесора, пам’яті, мережі, сховища, живлення та теплового домену.
• Висока доступність, резервне копіювання/відновлення, аварійне відновлення, безперервність бізнесу та дизайн домену збою.
• Розробка продуктивності, аналіз вузьких місць, проектування SLO/SLA та прогнозування потужності.
Архітектурні результати
• Еталонна архітектура AI Factory і креслення рішень
• Дизайн високого рівня (HLD) і дизайн низького рівня (LLD)
• Схеми архітектури мережі, обчислень, GPU та сховища
• Моделі потужності, продуктивності та масштабованості
• Оцінка технології та документи порівняння постачальників
• Архітектура безпеки та вхідні дані моделі загроз
• Специфікація матеріалів (BOM) і визначення розмірів інфраструктури
• Стратегія міграції/розгортання та дорожня карта впровадження
• Контрольний список експлуатаційної готовності, журнали та критерії прийняття
Досвід і кваліфікація
• Понад 10 років досвіду роботи з інфраструктурою, хмарою, корпоративною архітектурою або архітектурою рішень із значним впливом на інфраструктуру AI/GPU.
• Перевірений досвід проектування великомасштабних корпоративних платформ і перетворення бізнес-вимог у технічну архітектуру.
• Практичне розуміння фізичної інфраструктури, систем GPU, мереж, сховищ і платформ Linux.
• Бажано ступінь бакалавра в галузі комп’ютерних наук, інженерії, інформаційних технологій або суміжної галузі.…
Джерело: EU Remote Jobs (https://euremotejobs.com/job/ai-solution-architect-2/)
Ми шукаємо досвідченого архітектора рішень AI
розробляти та керувати наскрізними корпоративними рішеннями AI Factory та GPU інфраструктури, що охоплюють обчислення, високопродуктивну мережу, сховище, Kubernetes, хмару та платформи AI/ML. Посада вимагає значного досвіду в технологіях NVIDIA GPU, робочих навантаженнях AI, масштабованій архітектурі інфраструктури, безпеці, спостережливості, розробці продуктивності та плануванні потужностей.
Основні обов'язки
• Власна наскрізна архітектура для заводських і корпоративних рішень штучного інтелекту від вимог до готовності до виробництва.
• Оцініть вимоги до робочого навантаження AI/ML для навчання, тонкого налаштування, висновків, пакетної обробки та високопродуктивних обчислень.
• Розробка обчислювальних архітектур GPU, включаючи платформи NVIDIA HGX/DGX/OEM, системи з кількома GPU, NVLink/NVSwitch і розподіл ресурсів GPU.
• Створюйте високопродуктивні мережі штучного інтелекту з використанням 100/200/400/800G Ethernet, EVPN/VXLAN і архітектури leaf-spine.
• Розробляйте архітектури сховища та даних штучного інтелекту з використанням сховища об’єктів, паралельних файлових систем, таких як Ceph, WEKA або еквівалентних платформ.
• Визначте архітектуру платформи штучного інтелекту в Kubernetes, HPC, середовищі виконання контейнерів, платформах обслуговування моделей і корпоративних фреймворках ШІ.
• Встановіть стандарти архітектури для безпеки, ідентичності, ізоляції орендарів, захисту даних, спостережуваності, аварійного відновлення та операційної стійкості.
• Розробка еталонних архітектур, проектів високого/низького рівня, моделей потужності, описів матеріалів, оцінок технологій і дорожніх карт впровадження.
• Керувати технічними оцінками, перевірками концепцій, оцінками постачальників і комісіями з перевірки архітектури.
• Співпрацюйте з групами інфраструктури, мережі, безпеки, сховища, хмари, обробки даних, додатків та операцій.
• Визначте цільові показники щодо продуктивності, доступності, масштабованості, безпеки та вартості та перевірте архітектуру на відповідність вимірюваним критеріям прийнятності.
• Забезпечення технічного керівництва під час розгортання, міграції, інтеграції, усунення несправностей і переходу до виробництва.
• Необхідні технічні навички
Архітектура AI / ML
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, GPU Operator та екосистема платформи AI.
• PyTorch, TensorFlow, JAX та оперативне розуміння робочих навантажень навчання та висновків.
• Планування графічного процесора, мультитенантність, MIG/vGPU, використання GPU та розміщення робочого навантаження.
• LLM, генеративний штучний інтелект, RAG, точне налаштування, обслуговування моделей і архітектура висновків.
Заводська інфраструктура GPU та AI
• NVIDIA A100/H100/H200/B200 або еквівалентні GPU платформи; знайомство з системами нового покоління.
• NVLink, NVSwitch, топологія PCIe та архітектура продуктивності з кількома GPU.
• Серверна архітектура GPU DGX/HGX/OEM і керування життєвим циклом.
• Планування заводських потужностей ШІ, щільність стелажів, живлення, охолодження, введення в експлуатацію та стратегія життєвого циклу.
Високопродуктивна мережа
• 100/200/400/800G Ethernet, InfiniBand, RoCEv2 і RDMA, Netris
• Технології NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum і BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS і керування перевантаженнями.
• Трафік GPU схід-захід, GPUDirect RDMA та усунення несправностей продуктивності мережі.
Архітектура зберігання та даних AI
• Паралельні файлові системи, сховище об’єктів, NFS, NVMe/NVMe-oF і високопродуктивні конвеєри даних.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp або еквівалентні технології.
• Концепції озера даних/озерної хати, метадані, походження, переміщення даних і життєвий цикл даних.
• GPUDirect Storage та оптимізація сховища/мережі.
Платформа AI та оркестровка
• Kubernetes, GPU Operator, середовища виконання контейнерів і Kubernetes GPU планування.
• HPC або інші еквівалентні планувальники робочого навантаження.
• Платформи обслуговування моделей/виведення та архітектура платформи MLOps.
• Шлюзи API, виявлення служб, керування секретами та інтеграція платформи.
Хмарна та гібридна архітектура
• Інфраструктура та служби безпеки AWS та/або Azure AI.
• Гібридне хмарне підключення, IAM, приватна мережа, хмарне сховище та розміщення робочого навантаження.
• Оптимізація витрат у хмарі, планування потужності та міркування FinOps для робочих навантажень GPU.
Безпека та управління
• Нульова довіра, сегментація мережі, IAM/RBAC, PAM та ідентифікація робочого навантаження.
• GPU, DPU, контейнер, Kubernetes, вбудоване програмне забезпечення та безпека ланцюга поставок.
• Шифрування під час передачі/передачі, керування секретами, журнал аудиту та контроль відповідності.
• Специфічні ризики ШІ, включаючи захист даних/моделі, ізоляцію клієнта та безпечний доступ до моделі.
Спостережливість і надійність
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM та інфраструктурна телеметрія.
• Моніторинг графічного процесора, центрального процесора, пам’яті, мережі, сховища, живлення та теплового домену.
• Висока доступність, резервне копіювання/відновлення, аварійне відновлення, безперервність бізнесу та дизайн домену збою.
• Розробка продуктивності, аналіз вузьких місць, проектування SLO/SLA та прогнозування потужності.
Архітектурні результати
• Еталонна архітектура AI Factory і креслення рішень
• Дизайн високого рівня (HLD) і дизайн низького рівня (LLD)
• Схеми архітектури мережі, обчислень, GPU та сховища
• Моделі потужності, продуктивності та масштабованості
• Оцінка технології та документи порівняння постачальників
• Архітектура безпеки та вхідні дані моделі загроз
• Специфікація матеріалів (BOM) і визначення розмірів інфраструктури
• Стратегія міграції/розгортання та дорожня карта впровадження
• Контрольний список експлуатаційної готовності, журнали та критерії прийняття
Досвід і кваліфікація
• Понад 10 років досвіду роботи з інфраструктурою, хмарою, корпоративною архітектурою або архітектурою рішень із значним впливом на інфраструктуру AI/GPU.
• Перевірений досвід проектування великомасштабних корпоративних платформ і перетворення бізнес-вимог у технічну архітектуру.
• Практичне розуміння фізичної інфраструктури, систем GPU, мереж, сховищ і платформ Linux.
• Бажано ступінь бакалавра в галузі комп’ютерних наук, інженерії, інформаційних технологій або суміжної галузі.…
Джерело: EU Remote Jobs (https://euremotejobs.com/job/ai-solution-architect-2/)
Це оголошення надходить із партнерського фіду. Подайте заявку на сайті джерела.
Джерело: Uvation
Оголошення надано Uvation.