Вакансія
З партнерського стрічки
Інженер технічної підтримки (L2) – комп’ютер
Ціна за запитом
Деталі
- Тип зайнятості
- Повна зайнятість
- Віддалено
- Ні
- Компанія
- Mistral.ai
Опис
Автоматичний переклад з English. Оригінальний текст є авторитетним. Машинний переклад — готується точніший варіант.
Про Містраль
Mistral надає комплексні рішення ШІ: від передових моделей до інструментів розробника, додатків і обчислень. Ми співпрацюємо з підприємствами, які вирішують найскладніші проблеми в галузях із високими ставками, як-от фінанси, виробництво, оборона, охорона здоров’я та державний сектор, спільно створюючи індивідуальні системи штучного інтелекту, які вони можуть використовувати на своїх умовах.
Ми — динамічна команда, яка співпрацює, захоплюючись ШІ та його потенціалом для трансформації суспільства. Наша різноманітна робоча сила процвітає в конкурентному середовищі та прагне просувати інновації. Наші команди розподілені по Європі, Північній Америці, Азії та Близькому Сходу. Ми креативні, стримані та командні.
Mistral AI створює нову команду підтримки обчислень, щоб забезпечити надійність, продуктивність і масштабованість наших кластерів GPU в середовищі Kubernetes. Як один із засновників цієї команди, ви відіграватимете ключову роль у формуванні її процесів, стандартів і культури.
У цій гібридній ролі підтримки L1/L2 ви будете першим контактним пунктом для клієнтів і внутрішніх команд, надаючи технічні рекомендації, усунення несправностей і вирішення проблем, пов’язаних із запитами, пов’язаними з обчислювальною системою. Ви також будете служити точкою ескалації для складних проблем, використовуючи свої глибокі знання систем, досвід Kubernetes і навички оперативного налагодження, щоб забезпечити безперебійну роботу наших робочих навантажень ШІ в масштабі.
Це роль, зосереджена на підтримці, яка поєднує системне адміністрування, спілкування з клієнтами та досвід обчислювальної інфраструктури. Хоча кодування не є основною метою, знайомство з Go для налагодження та автоматизації є перевагою.
Основні обов'язки
Перша контактна точка клієнта
• Дійте як перший співрозмовник для клієнтів і внутрішніх команд, надаючи своєчасні та ефективні відповіді на запити, пов’язані з обчислювальною технікою.
• Сортування та пріоритезація вхідних запитів, гарантуючи виконання угод SLA щодо підтвердження, першої відповіді та вирішення.
• Збирайте та аналізуйте початкові деталі проблеми (наприклад, журнали, повідомлення про помилки, системні показники) для ефективної діагностики проблем.
• Надавати клієнтам і внутрішнім користувачам чіткі, практичні вказівки, включаючи тимчасові обхідні шляхи, де це можливо.
Технічна підтримка
• Служить точкою ескалації рівня 2 для проблем Linux, Kubernetes і обчислювальної інфраструктури, забезпечуючи глибоке технічне усунення несправностей для:
• Робочі навантаження GPU/TPU (наприклад, помилки CUDA, витоки пам’яті, збої завдань).
• Кластери Kubernetes (наприклад, збої модулів, збої вузлів, неправильні налаштування мережі).
• Голі металеві та хмарні середовища (наприклад, AWS EC2, віртуальні машини GCP, кластери HPC).
• Діагностика та усунення вузьких місць у продуктивності, апаратних збоїв і конкуренції за ресурси в розподілених системах.
• Аналізуйте системні показники, журнали та трасування (наприклад, dmesg, journalctl, nvidia-smi, Prometheus, Grafana), щоб визначити основні причини проблем.
• Беріть участь у чергуваннях за викликом, щоб забезпечити цілодобову підтримку критично важливих обчислювальних систем
• Приємно мати: оптимізуйте конфігурації системи (наприклад, параметри ядра, налаштування файлової системи, налаштування мережі) для високопродуктивних обчислень (HPC) і робочих навантажень ШІ.
Kubernetes і контейнеризація
• Налагодження кластерів Kubernetes з акцентом на:
• Проблеми з модулями та вузлами (наприклад, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Мережа та зберігання (наприклад, плагіни CNI, PersistentVolumes, StorageClasses).
• Керування ресурсами (наприклад, запити/ліміти, класи QOS, спорідненість вузлів).
• Усунення проблем із середовищем виконання контейнера (Docker, контейнер), таких як помилки отримання зображення, відповідність OCI або помилки виконання.
• Співпрацюйте з командами SRE, щоб зрозуміти та вдосконалити існуючі інструменти IaC (Terraform, Ansible) і Go.
Документація та вдосконалення процесів
• Створюйте та підтримуйте Runbook, playbooks і внутрішню документацію щодо типових проблем з обчисленнями (наприклад, налагодження GPU, усунення несправностей Kubernetes).
• Сприяти проведенню патологоанатомічних розслідувань за допомогою дієвих подальших заходів для запобігання повторним інцидентам.
• Навчіть внутрішні команди передовим практикам обчислювальної інфраструктури та налагодження.
• Допомога у визначенні та вдосконаленні процесів підтримки як член-засновник нової команди Compute Support.
Що ми шукаємо
Необхідні навички та досвід
• Понад 5 років досвіду в системному адмініструванні, технічній підтримці або інфраструктурних операціях, приділяючи особливу увагу обчислювальним середовищам (голі метали, хмара, HPC або віртуалізація).
• Глибокий досвід Linux/Unix:
• Проблеми налагодження на рівні ядра (наприклад, OOM killer, вузькі місця вводу-виводу, троттлінг ЦП).
• Налаштування продуктивності (наприклад, sysctl, ulimit, оптимізація файлової системи).
• Усунення несправностей мережі (наприклад, iptables, tcpdump, DNS, NFS, SSH).
• Керування сховищем (наприклад, LVM, RAID, NVMe, локальне сховище GPU).
• Практичний досвід Kubernetes є обов’язковим:
• Модулі налагодження, вузли та кластери (наприклад, kubectl describe, kubectl logs, crictl).
• Мережа та зберігання (наприклад, плагіни CNI, PersistentVolumes).
• Керування ресурсами (наприклад, запити/ліміти, класи QOS).
• Знайомство з контейнеризацією (Docker, container) і базовою обізнаністю про IaC. Володіння інструментами моніторингу (Prometheus, Grafana, ELK, OpenTelemetry).
• Базові навички створення сценаріїв/автоматизації (бажано Go, але Bash або Python прийнятні для спеціальних завдань).
• Досвід роботи з «голим металом», віртуалізацією або HPC-середовищем (наприклад, Fluidstack, Coreweave, Vast) є сильною перевагою.
• Чудові навички вирішення проблем і комунікації, а також здатність чітко і терпляче пояснювати технічні проблеми як технічним, так і нетехнічним зацікавленим сторонам.
• Орієнтація на клієнта з пристрастю до ефективного вирішення проблем і підвищення надійності системи.
• Здатність працювати в чергуваннях за викликом і справлятися зі складними ситуаціями зі структурованим, спокійним підходом.
• Зобов’язання дотримуватися жорстких угод SLA щодо підтвердження проблеми, сортування та першої реакції.…
Джерело: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Mistral надає комплексні рішення ШІ: від передових моделей до інструментів розробника, додатків і обчислень. Ми співпрацюємо з підприємствами, які вирішують найскладніші проблеми в галузях із високими ставками, як-от фінанси, виробництво, оборона, охорона здоров’я та державний сектор, спільно створюючи індивідуальні системи штучного інтелекту, які вони можуть використовувати на своїх умовах.
Ми — динамічна команда, яка співпрацює, захоплюючись ШІ та його потенціалом для трансформації суспільства. Наша різноманітна робоча сила процвітає в конкурентному середовищі та прагне просувати інновації. Наші команди розподілені по Європі, Північній Америці, Азії та Близькому Сходу. Ми креативні, стримані та командні.
Mistral AI створює нову команду підтримки обчислень, щоб забезпечити надійність, продуктивність і масштабованість наших кластерів GPU в середовищі Kubernetes. Як один із засновників цієї команди, ви відіграватимете ключову роль у формуванні її процесів, стандартів і культури.
У цій гібридній ролі підтримки L1/L2 ви будете першим контактним пунктом для клієнтів і внутрішніх команд, надаючи технічні рекомендації, усунення несправностей і вирішення проблем, пов’язаних із запитами, пов’язаними з обчислювальною системою. Ви також будете служити точкою ескалації для складних проблем, використовуючи свої глибокі знання систем, досвід Kubernetes і навички оперативного налагодження, щоб забезпечити безперебійну роботу наших робочих навантажень ШІ в масштабі.
Це роль, зосереджена на підтримці, яка поєднує системне адміністрування, спілкування з клієнтами та досвід обчислювальної інфраструктури. Хоча кодування не є основною метою, знайомство з Go для налагодження та автоматизації є перевагою.
Основні обов'язки
Перша контактна точка клієнта
• Дійте як перший співрозмовник для клієнтів і внутрішніх команд, надаючи своєчасні та ефективні відповіді на запити, пов’язані з обчислювальною технікою.
• Сортування та пріоритезація вхідних запитів, гарантуючи виконання угод SLA щодо підтвердження, першої відповіді та вирішення.
• Збирайте та аналізуйте початкові деталі проблеми (наприклад, журнали, повідомлення про помилки, системні показники) для ефективної діагностики проблем.
• Надавати клієнтам і внутрішнім користувачам чіткі, практичні вказівки, включаючи тимчасові обхідні шляхи, де це можливо.
Технічна підтримка
• Служить точкою ескалації рівня 2 для проблем Linux, Kubernetes і обчислювальної інфраструктури, забезпечуючи глибоке технічне усунення несправностей для:
• Робочі навантаження GPU/TPU (наприклад, помилки CUDA, витоки пам’яті, збої завдань).
• Кластери Kubernetes (наприклад, збої модулів, збої вузлів, неправильні налаштування мережі).
• Голі металеві та хмарні середовища (наприклад, AWS EC2, віртуальні машини GCP, кластери HPC).
• Діагностика та усунення вузьких місць у продуктивності, апаратних збоїв і конкуренції за ресурси в розподілених системах.
• Аналізуйте системні показники, журнали та трасування (наприклад, dmesg, journalctl, nvidia-smi, Prometheus, Grafana), щоб визначити основні причини проблем.
• Беріть участь у чергуваннях за викликом, щоб забезпечити цілодобову підтримку критично важливих обчислювальних систем
• Приємно мати: оптимізуйте конфігурації системи (наприклад, параметри ядра, налаштування файлової системи, налаштування мережі) для високопродуктивних обчислень (HPC) і робочих навантажень ШІ.
Kubernetes і контейнеризація
• Налагодження кластерів Kubernetes з акцентом на:
• Проблеми з модулями та вузлами (наприклад, CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Мережа та зберігання (наприклад, плагіни CNI, PersistentVolumes, StorageClasses).
• Керування ресурсами (наприклад, запити/ліміти, класи QOS, спорідненість вузлів).
• Усунення проблем із середовищем виконання контейнера (Docker, контейнер), таких як помилки отримання зображення, відповідність OCI або помилки виконання.
• Співпрацюйте з командами SRE, щоб зрозуміти та вдосконалити існуючі інструменти IaC (Terraform, Ansible) і Go.
Документація та вдосконалення процесів
• Створюйте та підтримуйте Runbook, playbooks і внутрішню документацію щодо типових проблем з обчисленнями (наприклад, налагодження GPU, усунення несправностей Kubernetes).
• Сприяти проведенню патологоанатомічних розслідувань за допомогою дієвих подальших заходів для запобігання повторним інцидентам.
• Навчіть внутрішні команди передовим практикам обчислювальної інфраструктури та налагодження.
• Допомога у визначенні та вдосконаленні процесів підтримки як член-засновник нової команди Compute Support.
Що ми шукаємо
Необхідні навички та досвід
• Понад 5 років досвіду в системному адмініструванні, технічній підтримці або інфраструктурних операціях, приділяючи особливу увагу обчислювальним середовищам (голі метали, хмара, HPC або віртуалізація).
• Глибокий досвід Linux/Unix:
• Проблеми налагодження на рівні ядра (наприклад, OOM killer, вузькі місця вводу-виводу, троттлінг ЦП).
• Налаштування продуктивності (наприклад, sysctl, ulimit, оптимізація файлової системи).
• Усунення несправностей мережі (наприклад, iptables, tcpdump, DNS, NFS, SSH).
• Керування сховищем (наприклад, LVM, RAID, NVMe, локальне сховище GPU).
• Практичний досвід Kubernetes є обов’язковим:
• Модулі налагодження, вузли та кластери (наприклад, kubectl describe, kubectl logs, crictl).
• Мережа та зберігання (наприклад, плагіни CNI, PersistentVolumes).
• Керування ресурсами (наприклад, запити/ліміти, класи QOS).
• Знайомство з контейнеризацією (Docker, container) і базовою обізнаністю про IaC. Володіння інструментами моніторингу (Prometheus, Grafana, ELK, OpenTelemetry).
• Базові навички створення сценаріїв/автоматизації (бажано Go, але Bash або Python прийнятні для спеціальних завдань).
• Досвід роботи з «голим металом», віртуалізацією або HPC-середовищем (наприклад, Fluidstack, Coreweave, Vast) є сильною перевагою.
• Чудові навички вирішення проблем і комунікації, а також здатність чітко і терпляче пояснювати технічні проблеми як технічним, так і нетехнічним зацікавленим сторонам.
• Орієнтація на клієнта з пристрастю до ефективного вирішення проблем і підвищення надійності системи.
• Здатність працювати в чергуваннях за викликом і справлятися зі складними ситуаціями зі структурованим, спокійним підходом.
• Зобов’язання дотримуватися жорстких угод SLA щодо підтвердження проблеми, сортування та першої реакції.…
Джерело: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Це оголошення надходить із партнерського фіду. Подайте заявку на сайті джерела.
Джерело: Mistral.ai
Розташування
Париж, Франція
Оголошення надано Mistral.ai.