Работа
Из фида партнера
Инженер технической поддержки (L2) – вычисления
Цена по запросу
Детали
- Тип занятости
- Полная занятость
- Удалённо
- Нет
- Компания
- Mistral.ai
Описание
Автоматически переведено с языка English. Оригинальный текст является основным. Машинный перевод — готовится более точный вариант.
О Мистрале
Mistral предлагает комплексные решения в области искусственного интеллекта: от передовых моделей до инструментов разработки, приложений и вычислений. Мы сотрудничаем с предприятиями, решающими самые сложные проблемы в таких важных отраслях, как финансы, производство, оборона, здравоохранение и государственный сектор, совместно создавая индивидуальные системы искусственного интеллекта, которые они могут использовать на своих условиях.
Мы — динамичная, сплоченная команда, увлеченная искусственным интеллектом и его потенциалом преобразования общества. Наш разнообразный персонал процветает в конкурентной среде и стремится внедрять инновации. Наши команды распределены по Европе, Северной Америке, Азии и Ближнему Востоку. Мы креативны, с низким эго и командным духом.
Mistral AI создает новую команду поддержки вычислений, чтобы обеспечить надежность, производительность и масштабируемость наших кластеров графических процессоров в среде Kubernetes. Будучи одним из основателей этой команды, вы будете играть ключевую роль в формировании ее процессов, стандартов и культуры.
В этой гибридной роли поддержки L1/L2 вы будете первым контактным лицом для клиентов и внутренних групп, предоставляя технические рекомендации, устранение неполадок и решение проблем, связанных с вычислениями. Вы также будете точкой эскалации сложных проблем, используя свои глубокие системные знания, опыт Kubernetes и навыки оперативной отладки, чтобы обеспечить бесперебойную работу наших рабочих нагрузок ИИ в любом масштабе.
Это должность, ориентированная на поддержку, которая сочетает в себе системное администрирование, общение с клиентами и опыт вычислительной инфраструктуры. Хотя программирование не является основным направлением деятельности, знание Go для отладки и автоматизации является плюсом.
Ключевые обязанности
Первое контактное лицо клиента
• Выступать в качестве первого собеседника для клиентов и внутренних команд, обеспечивая своевременные и эффективные ответы на запросы, связанные с вычислениями.
• Сортировать и определять приоритетность входящих запросов, гарантируя соблюдение соглашений об уровне обслуживания для подтверждения, первого ответа и разрешения.
• Собирайте и анализируйте первоначальные сведения о проблеме (например, журналы, сообщения об ошибках, системные показатели) для эффективной диагностики проблем.
• Предоставлять четкие и практические рекомендации клиентам и внутренним пользователям, включая временные обходные пути, где это применимо.
Техническая поддержка
• Служить точкой эскалации второго уровня для проблем Linux, Kubernetes и вычислительной инфраструктуры, обеспечивая глубокое техническое устранение неполадок для:
• Рабочие нагрузки графического процессора/TPU (например, ошибки CUDA, утечки памяти, сбои заданий).
• Кластеры Kubernetes (например, сбои модулей, сбои узлов, неправильные настройки сети).
• Голое железо и облачные среды (например, AWS EC2, виртуальные машины GCP, кластеры HPC).
• Диагностировать и устранять узкие места производительности, сбои оборудования и конфликты за ресурсы в распределенных системах.
• Анализировать системные показатели, журналы и трассировки (например, dmesg, Journalctl, nvidia-smi, Prometheus, Grafana) для выявления коренных причин проблем.
• Участвуйте в ротациях по вызову, чтобы обеспечить круглосуточную поддержку критически важных вычислительных систем.
• Приятно иметь возможность: оптимизировать конфигурации системы (например, параметры ядра, настройку файловой системы, настройки сети) для высокопроизводительных вычислений (HPC) и рабочих нагрузок искусственного интеллекта.
Kubernetes и контейнеризация
• Отладка кластеров Kubernetes с упором на:
• Проблемы с модулями и узлами (например, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Сеть и хранилище (например, плагины CNI, PersistentVolumes, StorageClasses).
• Управление ресурсами (например, запросы/ограничения, классы QOS, привязка узлов).
• Устранение неполадок во время выполнения контейнера (Docker,Containerd), таких как сбои получения образа, соответствие требованиям OCI или ошибки времени выполнения.
• Сотрудничать с командами SRE для понимания и улучшения существующих инструментов IaC (Terraform, Ansible) и Go.
Улучшение документации и процессов
• Создавайте и обслуживайте Runbook, Playbooks и внутреннюю документацию для решения распространенных проблем с вычислениями (например, отладка графического процессора, устранение неполадок Kubernetes).
• Участвовать в вскрытии с помощью практических последующих действий для предотвращения повторения инцидентов.
• Обучайте внутренние команды передовым методам работы с вычислительной инфраструктурой и отладкой.
• Помогите определить и усовершенствовать процессы поддержки в качестве члена-основателя новой группы вычислительной поддержки.
Что мы ищем
Требуемые навыки и опыт
• Более 5 лет опыта в системном администрировании, технической поддержке или эксплуатации инфраструктуры с особым акцентом на средах с большими вычислительными нагрузками (голое железо, облако, HPC или виртуализация).
• Глубокая экспертиза Linux/Unix:
• Отладка проблем на уровне ядра (например, OOM killer, узкие места ввода-вывода, регулирование ЦП).
• Настройка производительности (например, sysctl, ulimit, оптимизация файловой системы).
• Устранение неполадок сети (например, iptables, tcpdump, DNS, NFS, SSH).
• Управление хранилищем (например, LVM, RAID, NVMe, локальное хранилище на графическом процессоре).
• Практический опыт работы с Kubernetes обязателен:
• Отладка модулей, узлов и кластеров (например, kubectl define, kubectl logs, crictl).
• Сеть и хранилище (например, плагины CNI, PersistentVolumes).
• Управление ресурсами (например, запросы/ограничения, классы QOS).
• Знакомство с контейнеризацией (Docker,Containerd) и базовыми знаниями IaC. Владение инструментами мониторинга (Prometheus, Grafana, ELK, OpenTelemetry).
• Базовые навыки написания сценариев/автоматизации (предпочтительно Go, но для специальных задач приемлемы Bash или Python).
• Опыт работы со средами «голого железа», виртуализации или высокопроизводительных вычислений (например, Fluidstack, Coreweave, Vast) является большим плюсом.
• Отличные навыки решения проблем и коммуникативные навыки, а также способность четко и терпеливо объяснять технические вопросы как техническим, так и нетехническим заинтересованным сторонам.
• Ориентированность на клиента и стремление к эффективному решению проблем и повышению надежности системы.
• Способность работать по вызову и справляться со стрессовыми ситуациями, используя структурированный и спокойный подход.
• Обязательство соблюдать жесткие соглашения об уровне обслуживания для подтверждения проблем, сортировки и первого реагирования.…
Источник: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598).
Mistral предлагает комплексные решения в области искусственного интеллекта: от передовых моделей до инструментов разработки, приложений и вычислений. Мы сотрудничаем с предприятиями, решающими самые сложные проблемы в таких важных отраслях, как финансы, производство, оборона, здравоохранение и государственный сектор, совместно создавая индивидуальные системы искусственного интеллекта, которые они могут использовать на своих условиях.
Мы — динамичная, сплоченная команда, увлеченная искусственным интеллектом и его потенциалом преобразования общества. Наш разнообразный персонал процветает в конкурентной среде и стремится внедрять инновации. Наши команды распределены по Европе, Северной Америке, Азии и Ближнему Востоку. Мы креативны, с низким эго и командным духом.
Mistral AI создает новую команду поддержки вычислений, чтобы обеспечить надежность, производительность и масштабируемость наших кластеров графических процессоров в среде Kubernetes. Будучи одним из основателей этой команды, вы будете играть ключевую роль в формировании ее процессов, стандартов и культуры.
В этой гибридной роли поддержки L1/L2 вы будете первым контактным лицом для клиентов и внутренних групп, предоставляя технические рекомендации, устранение неполадок и решение проблем, связанных с вычислениями. Вы также будете точкой эскалации сложных проблем, используя свои глубокие системные знания, опыт Kubernetes и навыки оперативной отладки, чтобы обеспечить бесперебойную работу наших рабочих нагрузок ИИ в любом масштабе.
Это должность, ориентированная на поддержку, которая сочетает в себе системное администрирование, общение с клиентами и опыт вычислительной инфраструктуры. Хотя программирование не является основным направлением деятельности, знание Go для отладки и автоматизации является плюсом.
Ключевые обязанности
Первое контактное лицо клиента
• Выступать в качестве первого собеседника для клиентов и внутренних команд, обеспечивая своевременные и эффективные ответы на запросы, связанные с вычислениями.
• Сортировать и определять приоритетность входящих запросов, гарантируя соблюдение соглашений об уровне обслуживания для подтверждения, первого ответа и разрешения.
• Собирайте и анализируйте первоначальные сведения о проблеме (например, журналы, сообщения об ошибках, системные показатели) для эффективной диагностики проблем.
• Предоставлять четкие и практические рекомендации клиентам и внутренним пользователям, включая временные обходные пути, где это применимо.
Техническая поддержка
• Служить точкой эскалации второго уровня для проблем Linux, Kubernetes и вычислительной инфраструктуры, обеспечивая глубокое техническое устранение неполадок для:
• Рабочие нагрузки графического процессора/TPU (например, ошибки CUDA, утечки памяти, сбои заданий).
• Кластеры Kubernetes (например, сбои модулей, сбои узлов, неправильные настройки сети).
• Голое железо и облачные среды (например, AWS EC2, виртуальные машины GCP, кластеры HPC).
• Диагностировать и устранять узкие места производительности, сбои оборудования и конфликты за ресурсы в распределенных системах.
• Анализировать системные показатели, журналы и трассировки (например, dmesg, Journalctl, nvidia-smi, Prometheus, Grafana) для выявления коренных причин проблем.
• Участвуйте в ротациях по вызову, чтобы обеспечить круглосуточную поддержку критически важных вычислительных систем.
• Приятно иметь возможность: оптимизировать конфигурации системы (например, параметры ядра, настройку файловой системы, настройки сети) для высокопроизводительных вычислений (HPC) и рабочих нагрузок искусственного интеллекта.
Kubernetes и контейнеризация
• Отладка кластеров Kubernetes с упором на:
• Проблемы с модулями и узлами (например, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Сеть и хранилище (например, плагины CNI, PersistentVolumes, StorageClasses).
• Управление ресурсами (например, запросы/ограничения, классы QOS, привязка узлов).
• Устранение неполадок во время выполнения контейнера (Docker,Containerd), таких как сбои получения образа, соответствие требованиям OCI или ошибки времени выполнения.
• Сотрудничать с командами SRE для понимания и улучшения существующих инструментов IaC (Terraform, Ansible) и Go.
Улучшение документации и процессов
• Создавайте и обслуживайте Runbook, Playbooks и внутреннюю документацию для решения распространенных проблем с вычислениями (например, отладка графического процессора, устранение неполадок Kubernetes).
• Участвовать в вскрытии с помощью практических последующих действий для предотвращения повторения инцидентов.
• Обучайте внутренние команды передовым методам работы с вычислительной инфраструктурой и отладкой.
• Помогите определить и усовершенствовать процессы поддержки в качестве члена-основателя новой группы вычислительной поддержки.
Что мы ищем
Требуемые навыки и опыт
• Более 5 лет опыта в системном администрировании, технической поддержке или эксплуатации инфраструктуры с особым акцентом на средах с большими вычислительными нагрузками (голое железо, облако, HPC или виртуализация).
• Глубокая экспертиза Linux/Unix:
• Отладка проблем на уровне ядра (например, OOM killer, узкие места ввода-вывода, регулирование ЦП).
• Настройка производительности (например, sysctl, ulimit, оптимизация файловой системы).
• Устранение неполадок сети (например, iptables, tcpdump, DNS, NFS, SSH).
• Управление хранилищем (например, LVM, RAID, NVMe, локальное хранилище на графическом процессоре).
• Практический опыт работы с Kubernetes обязателен:
• Отладка модулей, узлов и кластеров (например, kubectl define, kubectl logs, crictl).
• Сеть и хранилище (например, плагины CNI, PersistentVolumes).
• Управление ресурсами (например, запросы/ограничения, классы QOS).
• Знакомство с контейнеризацией (Docker,Containerd) и базовыми знаниями IaC. Владение инструментами мониторинга (Prometheus, Grafana, ELK, OpenTelemetry).
• Базовые навыки написания сценариев/автоматизации (предпочтительно Go, но для специальных задач приемлемы Bash или Python).
• Опыт работы со средами «голого железа», виртуализации или высокопроизводительных вычислений (например, Fluidstack, Coreweave, Vast) является большим плюсом.
• Отличные навыки решения проблем и коммуникативные навыки, а также способность четко и терпеливо объяснять технические вопросы как техническим, так и нетехническим заинтересованным сторонам.
• Ориентированность на клиента и стремление к эффективному решению проблем и повышению надежности системы.
• Способность работать по вызову и справляться со стрессовыми ситуациями, используя структурированный и спокойный подход.
• Обязательство соблюдать жесткие соглашения об уровне обслуживания для подтверждения проблем, сортировки и первого реагирования.…
Источник: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598).
Это объявление получено из партнерского фида. Оформляйте заказ на исходном сайте.
Источник: Mistral.ai
Расположение
Париж, Франция
Объявление предоставлено Mistral.ai.