Работа
Из фида партнера
Архитектор решений искусственного интеллекта
Цена по запросу
Детали
- Тип занятости
- Полная занятость
- Удалённо
- Да
- Компания
- Uvation
Описание
Автоматически переведено с языка English. Оригинальный текст является основным. Машинный перевод — готовится более точный вариант.
Обзор вакансии
Мы ищем опытного архитектора AI-решений.
разрабатывать и возглавлять комплексные корпоративные решения AI Factory и инфраструктуры графических процессоров, охватывающие вычислительные, высокопроизводительные сети, хранилища, Kubernetes, облака и платформы AI/ML. Для этой роли требуются глубокие знания в технологиях NVIDIA GPU, рабочих нагрузках искусственного интеллекта, масштабируемой инфраструктурной архитектуре, безопасности, наблюдаемости, проектировании производительности и планировании мощности.
Ключевые обязанности
• Собственная комплексная архитектура для AI Factory и корпоративных решений AI, от требований до готовности к производству.
• Оценить требования к рабочей нагрузке AI/ML для обучения, тонкой настройки, вывода, пакетной обработки и высокопроизводительных вычислений.
• Проектировать вычислительные архитектуры графических процессоров, включая платформы NVIDIA HGX/DGX/OEM, системы с несколькими графическими процессорами, NVLink/NVSwitch и распределение ресурсов графических процессоров.
• Проектируйте высокопроизводительные сети искусственного интеллекта с использованием 100/200/400/800G Ethernet, EVPN/VXLAN и архитектур конечных узлов.
• Разрабатывайте архитектуры хранения и данных искусственного интеллекта с использованием объектного хранилища, параллельных файловых систем, таких как Ceph, WEKA или эквивалентных платформ.
• Определить архитектуру платформы ИИ в Kubernetes, HPC, средах выполнения контейнеров, платформах обслуживания моделей и корпоративных средах ИИ.
• Установить архитектурные стандарты безопасности, идентификации, изоляции клиентов, защиты данных, наблюдаемости, аварийного восстановления и эксплуатационной устойчивости.
• Разрабатывать эталонные архитектуры, проекты высокого и низкого уровня, модели мощности, спецификации материалов, оценки технологий и дорожные карты реализации.
• Руководит техническими оценками, проверкой концепций, оценками поставщиков и комиссиями по обзору архитектуры.
• Сотрудничать с командами по инфраструктуре, сети, безопасности, хранению, облаку, данным, приложениям и операциям.
• Определить целевые показатели производительности, доступности, масштабируемости, безопасности и стоимости и проверить архитектуру на соответствие измеримым критериям приемки.
• Обеспечение технического руководства во время развертывания, миграции, интеграции, устранения неполадок и перехода к производству.
• Требуемые технические навыки
Архитектура искусственного интеллекта/МО
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, оператор графического процессора и экосистема платформы искусственного интеллекта.
• PyTorch, TensorFlow, JAX и оперативное понимание рабочих нагрузок обучения и вывода.
• Планирование графического процессора, многопользовательская среда, MIG/vGPU, использование графического процессора и распределение рабочей нагрузки.
• LLM, генеративный искусственный интеллект, RAG, точная настройка, обслуживание моделей и архитектура вывода.
Заводская инфраструктура графических процессоров и искусственного интеллекта
• NVIDIA A100/H100/H200/B200 или эквивалентные платформы графических процессоров; знакомство с системами нового поколения.
• NVLink, NVSwitch, топология PCIe и архитектура производительности с несколькими графическими процессорами.
• Серверная архитектура графического процессора DGX/HGX/OEM и управление жизненным циклом.
• Планирование мощности AI Factory, плотность стоек, электропитание, охлаждение, ввод в эксплуатацию и стратегия жизненного цикла.
Высокопроизводительная сеть
• Ethernet 100/200/400/800G, InfiniBand, RoCEv2 и RDMA, Netris
• Технологии NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum и BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS и управление перегрузками.
• Трафик графического процессора «восток-запад», GPUDirect RDMA и устранение неполадок производительности сети.
Архитектура хранения и данных AI
• Параллельные файловые системы, объектные хранилища, NFS, NVMe/NVMe-oF и конвейеры данных с высокой пропускной способностью.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp или эквивалентные технологии.
• Концепции озера/озёрного дома данных, метаданные, происхождение, перемещение данных и жизненный цикл данных.
• GPUDirect Storage и оптимизация производительности хранилища/сети.
Платформа искусственного интеллекта и оркестровка
• Kubernetes, оператор графического процессора, среда выполнения контейнеров и планирование графического процессора Kubernetes.
• HPC или другие эквивалентные планировщики рабочих нагрузок.
• Моделировать платформы обслуживания/вывода и архитектуру платформы MLOps.
• Шлюзы API, обнаружение сервисов, управление секретами и интеграция платформ.
Облачная и гибридная архитектура
• AWS и/или Azure AI-инфраструктура и услуги безопасности.
• Подключение к гибридному облаку, IAM, частные сети, облачное хранилище и размещение рабочих нагрузок.
• Оптимизация затрат на облако, планирование мощности и аспекты FinOps для рабочих нагрузок графических процессоров.
Безопасность и управление
• Нулевое доверие, сегментация сети, IAM/RBAC, PAM и идентификация рабочей нагрузки.
• Графический процессор, DPU, контейнер, Kubernetes, встроенное ПО и безопасность цепочки поставок.
• Шифрование при хранении/пересылке, управление секретами, ведение журнала аудита и контроль соответствия.
• Риски, связанные с искусственным интеллектом, включая защиту данных/моделей, изоляцию клиентов и безопасный доступ к модели.
Наблюдаемость и надежность
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM и телеметрия инфраструктуры.
• Мониторинг графического процессора, процессора, памяти, сети, хранилища, питания и температуры.
• Высокая доступность, резервное копирование/восстановление, аварийное восстановление, непрерывность бизнеса и проектирование отказоустойчивых областей.
• Проектирование производительности, анализ узких мест, проектирование SLO/SLA и прогнозирование мощности.
Результаты архитектуры
• Эталонная архитектура AI Factory и чертежи решений.
• Проектирование высокого уровня (HLD) и проектирование низкого уровня (LLD).
• Диаграммы архитектуры сети, вычислений, графического процессора и хранилища.
• Модели емкости, производительности и масштабируемости.
• Документы по оценке технологий и сравнению поставщиков.
• Архитектура безопасности и исходные данные модели угроз.
• Спецификация материалов (BOM) и определение размеров инфраструктуры.
• Стратегия миграции/развертывания и дорожная карта реализации.
• Контрольный список эксплуатационной готовности, инструкции и критерии приемки.
Опыт и квалификация
• Более 10 лет опыта работы в сфере инфраструктуры, облачных технологий, корпоративной архитектуры или архитектуры решений со значительным опытом работы в инфраструктуре искусственного интеллекта и графических процессоров.
• Подтвержденный опыт проектирования крупномасштабных корпоративных платформ и перевода бизнес-требований в техническую архитектуру.
• Практическое понимание физической инфраструктуры, систем графических процессоров, сетей, систем хранения данных и платформ Linux.
• Предпочтительна степень бакалавра в области компьютерных наук, инженерии, информационных технологий или смежных областях.…
Источник: Удаленная работа в ЕС (https://euremotejobs.com/job/ai-solution-architect-2/).
Мы ищем опытного архитектора AI-решений.
разрабатывать и возглавлять комплексные корпоративные решения AI Factory и инфраструктуры графических процессоров, охватывающие вычислительные, высокопроизводительные сети, хранилища, Kubernetes, облака и платформы AI/ML. Для этой роли требуются глубокие знания в технологиях NVIDIA GPU, рабочих нагрузках искусственного интеллекта, масштабируемой инфраструктурной архитектуре, безопасности, наблюдаемости, проектировании производительности и планировании мощности.
Ключевые обязанности
• Собственная комплексная архитектура для AI Factory и корпоративных решений AI, от требований до готовности к производству.
• Оценить требования к рабочей нагрузке AI/ML для обучения, тонкой настройки, вывода, пакетной обработки и высокопроизводительных вычислений.
• Проектировать вычислительные архитектуры графических процессоров, включая платформы NVIDIA HGX/DGX/OEM, системы с несколькими графическими процессорами, NVLink/NVSwitch и распределение ресурсов графических процессоров.
• Проектируйте высокопроизводительные сети искусственного интеллекта с использованием 100/200/400/800G Ethernet, EVPN/VXLAN и архитектур конечных узлов.
• Разрабатывайте архитектуры хранения и данных искусственного интеллекта с использованием объектного хранилища, параллельных файловых систем, таких как Ceph, WEKA или эквивалентных платформ.
• Определить архитектуру платформы ИИ в Kubernetes, HPC, средах выполнения контейнеров, платформах обслуживания моделей и корпоративных средах ИИ.
• Установить архитектурные стандарты безопасности, идентификации, изоляции клиентов, защиты данных, наблюдаемости, аварийного восстановления и эксплуатационной устойчивости.
• Разрабатывать эталонные архитектуры, проекты высокого и низкого уровня, модели мощности, спецификации материалов, оценки технологий и дорожные карты реализации.
• Руководит техническими оценками, проверкой концепций, оценками поставщиков и комиссиями по обзору архитектуры.
• Сотрудничать с командами по инфраструктуре, сети, безопасности, хранению, облаку, данным, приложениям и операциям.
• Определить целевые показатели производительности, доступности, масштабируемости, безопасности и стоимости и проверить архитектуру на соответствие измеримым критериям приемки.
• Обеспечение технического руководства во время развертывания, миграции, интеграции, устранения неполадок и перехода к производству.
• Требуемые технические навыки
Архитектура искусственного интеллекта/МО
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, оператор графического процессора и экосистема платформы искусственного интеллекта.
• PyTorch, TensorFlow, JAX и оперативное понимание рабочих нагрузок обучения и вывода.
• Планирование графического процессора, многопользовательская среда, MIG/vGPU, использование графического процессора и распределение рабочей нагрузки.
• LLM, генеративный искусственный интеллект, RAG, точная настройка, обслуживание моделей и архитектура вывода.
Заводская инфраструктура графических процессоров и искусственного интеллекта
• NVIDIA A100/H100/H200/B200 или эквивалентные платформы графических процессоров; знакомство с системами нового поколения.
• NVLink, NVSwitch, топология PCIe и архитектура производительности с несколькими графическими процессорами.
• Серверная архитектура графического процессора DGX/HGX/OEM и управление жизненным циклом.
• Планирование мощности AI Factory, плотность стоек, электропитание, охлаждение, ввод в эксплуатацию и стратегия жизненного цикла.
Высокопроизводительная сеть
• Ethernet 100/200/400/800G, InfiniBand, RoCEv2 и RDMA, Netris
• Технологии NVIDIA ConnectX/SuperNIC, Spectrum/Spectrum-X, Quantum и BlueField DPU.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS и управление перегрузками.
• Трафик графического процессора «восток-запад», GPUDirect RDMA и устранение неполадок производительности сети.
Архитектура хранения и данных AI
• Параллельные файловые системы, объектные хранилища, NFS, NVMe/NVMe-oF и конвейеры данных с высокой пропускной способностью.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp или эквивалентные технологии.
• Концепции озера/озёрного дома данных, метаданные, происхождение, перемещение данных и жизненный цикл данных.
• GPUDirect Storage и оптимизация производительности хранилища/сети.
Платформа искусственного интеллекта и оркестровка
• Kubernetes, оператор графического процессора, среда выполнения контейнеров и планирование графического процессора Kubernetes.
• HPC или другие эквивалентные планировщики рабочих нагрузок.
• Моделировать платформы обслуживания/вывода и архитектуру платформы MLOps.
• Шлюзы API, обнаружение сервисов, управление секретами и интеграция платформ.
Облачная и гибридная архитектура
• AWS и/или Azure AI-инфраструктура и услуги безопасности.
• Подключение к гибридному облаку, IAM, частные сети, облачное хранилище и размещение рабочих нагрузок.
• Оптимизация затрат на облако, планирование мощности и аспекты FinOps для рабочих нагрузок графических процессоров.
Безопасность и управление
• Нулевое доверие, сегментация сети, IAM/RBAC, PAM и идентификация рабочей нагрузки.
• Графический процессор, DPU, контейнер, Kubernetes, встроенное ПО и безопасность цепочки поставок.
• Шифрование при хранении/пересылке, управление секретами, ведение журнала аудита и контроль соответствия.
• Риски, связанные с искусственным интеллектом, включая защиту данных/моделей, изоляцию клиентов и безопасный доступ к модели.
Наблюдаемость и надежность
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM и телеметрия инфраструктуры.
• Мониторинг графического процессора, процессора, памяти, сети, хранилища, питания и температуры.
• Высокая доступность, резервное копирование/восстановление, аварийное восстановление, непрерывность бизнеса и проектирование отказоустойчивых областей.
• Проектирование производительности, анализ узких мест, проектирование SLO/SLA и прогнозирование мощности.
Результаты архитектуры
• Эталонная архитектура AI Factory и чертежи решений.
• Проектирование высокого уровня (HLD) и проектирование низкого уровня (LLD).
• Диаграммы архитектуры сети, вычислений, графического процессора и хранилища.
• Модели емкости, производительности и масштабируемости.
• Документы по оценке технологий и сравнению поставщиков.
• Архитектура безопасности и исходные данные модели угроз.
• Спецификация материалов (BOM) и определение размеров инфраструктуры.
• Стратегия миграции/развертывания и дорожная карта реализации.
• Контрольный список эксплуатационной готовности, инструкции и критерии приемки.
Опыт и квалификация
• Более 10 лет опыта работы в сфере инфраструктуры, облачных технологий, корпоративной архитектуры или архитектуры решений со значительным опытом работы в инфраструктуре искусственного интеллекта и графических процессоров.
• Подтвержденный опыт проектирования крупномасштабных корпоративных платформ и перевода бизнес-требований в техническую архитектуру.
• Практическое понимание физической инфраструктуры, систем графических процессоров, сетей, систем хранения данных и платформ Linux.
• Предпочтительна степень бакалавра в области компьютерных наук, инженерии, информационных технологий или смежных областях.…
Источник: Удаленная работа в ЕС (https://euremotejobs.com/job/ai-solution-architect-2/).
Это объявление получено из партнерского фида. Оформляйте заказ на исходном сайте.
Источник: Uvation
Объявление предоставлено Uvation.