Работа
Из фида партнера
Инженер машинного обучения, инфраструктура
Цена по запросу
Детали
- Тип занятости
- Полная занятость
- Удалённо
- Нет
- Компания
- Prior Labs
Описание
Автоматически переведено с языка English. Оригинальный текст является основным. Машинный перевод — готовится более точный вариант.
Кто мы
Модели Foundation преобразовали текст и изображения. Структурированные данные — самый крупный и важный формат данных в мире — до сих пор оставались нетронутыми. То, что LLM сделали для языка, мы делаем для таблиц.
Мы были пионерами табличных моделей: TabPFN v2 стала легендой Nature, имела более 3,5 миллионов загрузок и получила более 7500 звезд GitHub, а также запущена в производство: от выявления заболеваний легких с помощью Oxford Cancer Analytics до предотвращения сбоев поездов с помощью Hitachi. Самые сложные проблемы — миллионы строк, вывод в реальном времени, совершенно новые модальности — все еще открыты, и на этом уровне над ними больше никто не работает.
Мы — небольшая, тщательно отобранная команда из 40+ человек с опытом работы в Google, DeepMind, Meta, Apple, Amazon, Jane Street и CERN, которую возглавляют Фрэнк Хаттер, Ноа Холлманн и Саурадж Гамбхир, а консультантами являются Бернхард Шёлкопф и обладатель премии Тьюринга Янн Лекун.
В июле 2026 года, менее чем через 18 месяцев после предварительного посева стоимостью 9 миллионов евро, мы присоединились к SAP в качестве независимой передовой лаборатории искусственного интеллекта — с той же командой, миссией и моделями открытого веса, которые теперь поддерживаются более чем 1 миллиардом евро в течение четырех лет.
О роли
Мы тратим десятки миллионов долларов в год на вычисления на графических процессорах для обучения табличных моделей. Это не цель, это то, чем мы занимаемся сегодня, и оно растет. Человек, владеющий этой инфраструктурой, принимает решения стоимостью в миллионы долларов: архитектура кластера, эффективность планирования, стратегия провайдера, выбор оборудования. Неправильный звонок стоит шестизначную сумму.
Сегодня мы запускаем Slurm на GCP в нескольких кластерах. Мы масштабируемся к мультикластерной инфраструктуре с несколькими поставщиками и оцениваем новые поколения оборудования по мере их появления в сети. Вы владеете полным набором инструментов: от кластерных операций и оптимизации затрат до производительности распределенного обучения и уровня инструментов, которые позволяют исследователям быстро работать. Вы работаете напрямую с исследовательской группой и достаточно хорошо понимаете, чем они занимаются, чтобы принимать инфраструктурные решения, которые действительно им помогут. И это не чистая роль поддержки. Мы работаем в открытой среде. Если у вас в запасе есть следующая табличная архитектура SOTA, приступайте к ее обучению.
Над чем вы будете работать:
• Собственная и развивающаяся многокластерная инфраструктура графических процессоров. Slurm на GCP сегодня, мультипровайдер и новое оборудование завтра. Архитектура, планирование, надежность, оптимизация затрат
• Увеличение использования графического процессора и производительности обучения: профилирование, оптимизация памяти, устранение узких мест в коммуникации, отладка на уровне системы распределенного обучения при больших запусках.
• Создайте инфраструктуру следующего поколения: многокластерную оркестровку, новые поколения графических процессоров, диверсификацию поставщиков, планирование мощности с учетом растущих потребностей в вычислительных ресурсах.
• Создайте уровень производительности разработчиков: конвейеры CI, отслеживание экспериментов, реестр моделей, обработка данных и внутренние инструменты, которые поддерживают высокую скорость итерации исследований.
• Собственный бюджет вычислений. Вы понимаете стоимость одного флопа у разных поставщиков и оборудования и ненавидите напрасную трату вычислительных ресурсов.
Технический стек: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton.
Вам может подойти, если у вас есть:
• 3+ года создания и эксплуатации производственной инфраструктуры графических процессоров или распределенных систем обучения в любом масштабе. В крупной лаборатории искусственного интеллекта, хорошо финансируемом стартапе машинного обучения или в среде высокопроизводительных вычислений.
• Глубокий практический опыт работы с Slurm и управлением кластерами. Вы отладили сбои планирования, оптимизировали использование многопользовательских рабочих нагрузок графического процессора и управляли инфраструктурой, где простой имеет реальную стоимость.
• Системное мышление экспертного уровня: пропускная способность памяти, профилирование графического процессора. Вы рассуждаете об оборудовании, а не о конфигах
• Уверенное владение Python и свободное владение внутренними компонентами PyTorch. Достаточно, чтобы профилировать тренировочный запуск и определить, является ли узким местом загрузка данных, связь или вычисления.
• Опыт принятия инфраструктурных решений, которые значительно повысили эффективность обучения или экономическую эффективность.
• Хорошие навыки работы с искусственным интеллектом. Вы свободно используете Claude Code, Cursor или что-то подобное, чтобы двигаться быстро, не жертвуя качеством.
Бонус:
• Опыт работы с затратами на графические процессоры в десятки миллионов долларов.
• Опыт работы с мультиоблачной или гибридной высокопроизводительной/облачной инфраструктурой.
• Triton, CUDA или собственное ядро.
• Опыт масштабирования от одного кластера к многокластерной оркестрации.
• Отслеживание экспериментов по созданию фона, реестр моделей или инструменты конвейера машинного обучения.
Жизнь в Prior Labs
Вы будете работать вместе с исследователями и строителями, которые придерживаются очень высокой планки – как в качестве своей работы, так и в том, как они взаимодействуют друг с другом. Мы движемся быстро и все же находим время, чтобы все сделать правильно.
Наши команды базируются в Берлине, Фрайбурге и Нью-Йорке — когда вы работаете над чем-то столь сложным, как TabPFN, очень важно находиться в одной комнате. Но замечательные люди приходят отовсюду, и в исключительных случаях мы открыты для удаленной работы, что обычно означает частые поездки в один из наших офисов. Где бы вы ни находились, вся компания регулярно собирается вместе на выездных мероприятиях, чтобы вместе строить и праздновать.
Наши обязательства
Лучшие продукты и команды создаются людьми с широким спектром взглядов и опыта. Мы приветствуем заявки от всех личностей и слоев общества - особенно если вы когда-либо чувствовали себя обескураженным из-за того, что «не отметили все галочки» - и предоставляем равные возможности независимо от пола, сексуальной ориентации, происхождения, инвалидности или любой другой черты, которая делает вас тем, кто вы есть.
Мы заботимся о том, как обрабатываются ваши данные — см. нашу страницу «Конфиденциальность данных о рекрутинге».
Найдите больше англоговорящих вакансий в Германии на Arbeitnow
Источник: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317).
Модели Foundation преобразовали текст и изображения. Структурированные данные — самый крупный и важный формат данных в мире — до сих пор оставались нетронутыми. То, что LLM сделали для языка, мы делаем для таблиц.
Мы были пионерами табличных моделей: TabPFN v2 стала легендой Nature, имела более 3,5 миллионов загрузок и получила более 7500 звезд GitHub, а также запущена в производство: от выявления заболеваний легких с помощью Oxford Cancer Analytics до предотвращения сбоев поездов с помощью Hitachi. Самые сложные проблемы — миллионы строк, вывод в реальном времени, совершенно новые модальности — все еще открыты, и на этом уровне над ними больше никто не работает.
Мы — небольшая, тщательно отобранная команда из 40+ человек с опытом работы в Google, DeepMind, Meta, Apple, Amazon, Jane Street и CERN, которую возглавляют Фрэнк Хаттер, Ноа Холлманн и Саурадж Гамбхир, а консультантами являются Бернхард Шёлкопф и обладатель премии Тьюринга Янн Лекун.
В июле 2026 года, менее чем через 18 месяцев после предварительного посева стоимостью 9 миллионов евро, мы присоединились к SAP в качестве независимой передовой лаборатории искусственного интеллекта — с той же командой, миссией и моделями открытого веса, которые теперь поддерживаются более чем 1 миллиардом евро в течение четырех лет.
О роли
Мы тратим десятки миллионов долларов в год на вычисления на графических процессорах для обучения табличных моделей. Это не цель, это то, чем мы занимаемся сегодня, и оно растет. Человек, владеющий этой инфраструктурой, принимает решения стоимостью в миллионы долларов: архитектура кластера, эффективность планирования, стратегия провайдера, выбор оборудования. Неправильный звонок стоит шестизначную сумму.
Сегодня мы запускаем Slurm на GCP в нескольких кластерах. Мы масштабируемся к мультикластерной инфраструктуре с несколькими поставщиками и оцениваем новые поколения оборудования по мере их появления в сети. Вы владеете полным набором инструментов: от кластерных операций и оптимизации затрат до производительности распределенного обучения и уровня инструментов, которые позволяют исследователям быстро работать. Вы работаете напрямую с исследовательской группой и достаточно хорошо понимаете, чем они занимаются, чтобы принимать инфраструктурные решения, которые действительно им помогут. И это не чистая роль поддержки. Мы работаем в открытой среде. Если у вас в запасе есть следующая табличная архитектура SOTA, приступайте к ее обучению.
Над чем вы будете работать:
• Собственная и развивающаяся многокластерная инфраструктура графических процессоров. Slurm на GCP сегодня, мультипровайдер и новое оборудование завтра. Архитектура, планирование, надежность, оптимизация затрат
• Увеличение использования графического процессора и производительности обучения: профилирование, оптимизация памяти, устранение узких мест в коммуникации, отладка на уровне системы распределенного обучения при больших запусках.
• Создайте инфраструктуру следующего поколения: многокластерную оркестровку, новые поколения графических процессоров, диверсификацию поставщиков, планирование мощности с учетом растущих потребностей в вычислительных ресурсах.
• Создайте уровень производительности разработчиков: конвейеры CI, отслеживание экспериментов, реестр моделей, обработка данных и внутренние инструменты, которые поддерживают высокую скорость итерации исследований.
• Собственный бюджет вычислений. Вы понимаете стоимость одного флопа у разных поставщиков и оборудования и ненавидите напрасную трату вычислительных ресурсов.
Технический стек: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton.
Вам может подойти, если у вас есть:
• 3+ года создания и эксплуатации производственной инфраструктуры графических процессоров или распределенных систем обучения в любом масштабе. В крупной лаборатории искусственного интеллекта, хорошо финансируемом стартапе машинного обучения или в среде высокопроизводительных вычислений.
• Глубокий практический опыт работы с Slurm и управлением кластерами. Вы отладили сбои планирования, оптимизировали использование многопользовательских рабочих нагрузок графического процессора и управляли инфраструктурой, где простой имеет реальную стоимость.
• Системное мышление экспертного уровня: пропускная способность памяти, профилирование графического процессора. Вы рассуждаете об оборудовании, а не о конфигах
• Уверенное владение Python и свободное владение внутренними компонентами PyTorch. Достаточно, чтобы профилировать тренировочный запуск и определить, является ли узким местом загрузка данных, связь или вычисления.
• Опыт принятия инфраструктурных решений, которые значительно повысили эффективность обучения или экономическую эффективность.
• Хорошие навыки работы с искусственным интеллектом. Вы свободно используете Claude Code, Cursor или что-то подобное, чтобы двигаться быстро, не жертвуя качеством.
Бонус:
• Опыт работы с затратами на графические процессоры в десятки миллионов долларов.
• Опыт работы с мультиоблачной или гибридной высокопроизводительной/облачной инфраструктурой.
• Triton, CUDA или собственное ядро.
• Опыт масштабирования от одного кластера к многокластерной оркестрации.
• Отслеживание экспериментов по созданию фона, реестр моделей или инструменты конвейера машинного обучения.
Жизнь в Prior Labs
Вы будете работать вместе с исследователями и строителями, которые придерживаются очень высокой планки – как в качестве своей работы, так и в том, как они взаимодействуют друг с другом. Мы движемся быстро и все же находим время, чтобы все сделать правильно.
Наши команды базируются в Берлине, Фрайбурге и Нью-Йорке — когда вы работаете над чем-то столь сложным, как TabPFN, очень важно находиться в одной комнате. Но замечательные люди приходят отовсюду, и в исключительных случаях мы открыты для удаленной работы, что обычно означает частые поездки в один из наших офисов. Где бы вы ни находились, вся компания регулярно собирается вместе на выездных мероприятиях, чтобы вместе строить и праздновать.
Наши обязательства
Лучшие продукты и команды создаются людьми с широким спектром взглядов и опыта. Мы приветствуем заявки от всех личностей и слоев общества - особенно если вы когда-либо чувствовали себя обескураженным из-за того, что «не отметили все галочки» - и предоставляем равные возможности независимо от пола, сексуальной ориентации, происхождения, инвалидности или любой другой черты, которая делает вас тем, кто вы есть.
Мы заботимся о том, как обрабатываются ваши данные — см. нашу страницу «Конфиденциальность данных о рекрутинге».
Найдите больше англоговорящих вакансий в Германии на Arbeitnow
Источник: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317).
Это объявление получено из партнерского фида. Оформляйте заказ на исходном сайте.
Источник: Prior Labs
Расположение
Берлин, Германия
Объявление предоставлено Prior Labs.