Работа
Из фида партнера
Старший инженер по очистке данных Python (фрилансер)
40 $ Зарплата
Детали
- Тип занятости
- Частичная занятость
- Удалённо
- Да
- Зарплата от
- 40
- Зарплата до
- 40
- Компания
- Mindrift
Описание
Автоматически переведено с языка English. Оригинальный текст является основным. Машинный перевод — готовится более точный вариант.
Mindrift ищет высококвалифицированных специалистов по Vibecode, которые присоединятся к проекту Tendem () и будут реализовывать специализированные рабочие процессы очистки данных для реальных сценариев использования. Mindrift ищет высококвалифицированных старших инженеров по парсингу данных Python, которые смогут присоединиться к проекту Tendem и реализовать специализированные рабочие процессы парсинга данных для реальных приложений. В этой роли вы примените свой опыт в парсинге веб-страниц, извлечении и обработке данных для получения точных, надежных и высококачественных результатов. Эта удаленная возможность с частичной занятостью идеально подходит для технических специалистов, имеющих практический опыт работы с веб-страницами, извлечением и обработкой данных.
Что мы делаем
Платформа Mindrift объединяет специалистов с инновационными технологическими проектами. Наша миссия — помогать разрабатывать высококачественные технологии искусственного интеллекта, объединяя реальный опыт профессионалов со всего мира с передовыми усилиями по разработке искусственного интеллекта.
О роли
Это внештатная должность в проекте Tendem. В качестве старшего инженера по сбору данных Python вы будете выполнять задачи по сбору данных, требующие технической точности для веб-извлечения и обработки, используя такие инструменты, как Apify, OpenRouter и другие технологии, а также свой собственный технический опыт и подходы.
Ключевые обязанности
• Собственные комплексные рабочие процессы извлечения данных на сложных веб-сайтах, обеспечивающие полный охват, точность и надежную доставку структурированных наборов данных.
• Используйте доступные инструменты и настраиваемые рабочие процессы для ускорения сбора, проверки и выполнения задач данных при соблюдении определенных требований.
• Обеспечьте надежное извлечение данных из динамических и интерактивных веб-источников, при необходимости адаптируя подходы к обработке контента, отображаемого с помощью JavaScript, и изменению поведения сайта.
• Обеспечьте соблюдение стандартов качества данных посредством проверок достоверности, контроля согласованности между источниками, соблюдения спецификаций форматирования и систематической проверки перед доставкой.
• Масштабируйте операции очистки больших наборов данных с помощью эффективной пакетной обработки или распараллеливания, отслеживайте сбои и поддерживайте устойчивость к незначительным изменениям структуры сайта.
Образовательная квалификация
• Не менее 5 лет соответствующего опыта в области обработки данных, веб-скрапинга, автоматизации или разработки программного обеспечения (обязательно).
• Степень бакалавра или магистра в области инженерии, прикладной математики, информатики или смежных технических областях является плюсом.
Академический и/или профессиональный опыт
Кандидаты должны иметь прочную техническую базу и практический опыт работы со сценариями, автоматизацией и рабочими процессами извлечения данных. Мы ищем специалистов, которые умеют решать нетривиальные задачи, уверенно работать с современными инструментами и технологиями разработки, систематически собирать, структурировать и проверять данные из различных источников. Важны методический, детальный подход и способность работать самостоятельно.
Технические навыки (обязательно)
• Большой опыт парсинга веб-страниц Python (BeautifulSoup, Selenium или аналогичных), включая динамический контент (JS, AJAX, бесконечная прокрутка) и API через прокси.
• Доказанная способность извлекать данные из сложных структур (иерархии, архивные страницы, противоречивый HTML).
• Солидный опыт очистки, нормализации и проверки данных, предоставления структурированных наборов данных (CSV, JSON, Google Таблицы).
Дополнительные требования
• Подтвержденный опыт работы с механизмами защиты от ботов и динамическими структурами сайтов в больших масштабах.
• Опыт работы с облачной инфраструктурой (AWS или аналогичный) и контейнеризацией (Docker) как части реальных рабочих процессов.
• Практический опыт работы с платформами LLM (LangChain, OpenRouter или аналогичными), применяемыми для задач автоматизации.
• Большое внимание к деталям и приверженность точности данных.
• Самостоятельная трудовая этика с возможностью самостоятельного устранения неполадок.
• Ссылка на GitHub является плюсом.
• Владение английским языком: выше среднего (B2) или выше (обязательно).
Ожидаемые сроки проекта
По оценкам, для этого проекта выполнение задач потребует около 10–20 часов в неделю на активных фазах в зависимости от требований проекта. Это приблизительная оценка, а не гарантированная рабочая нагрузка, которая применяется только во время активности проекта.
Компенсация
В этом проекте участники могут зарабатывать до 40 долларов США в час в эквиваленте, в зависимости от их уровня и темпа вклада. Компенсация варьируется в зависимости от проекта в зависимости от масштаба, сложности и требуемого опыта. Обратите внимание, что другие проекты на платформе могут предлагать разные уровни заработка в зависимости от их требований.
Первоначально опубликовано о Гималаях
Источник: Гималаи (https://himalayas.app/companies/mindrift/jobs/senior-python-data-scraping-engineer-freelance-5626901476).
Что мы делаем
Платформа Mindrift объединяет специалистов с инновационными технологическими проектами. Наша миссия — помогать разрабатывать высококачественные технологии искусственного интеллекта, объединяя реальный опыт профессионалов со всего мира с передовыми усилиями по разработке искусственного интеллекта.
О роли
Это внештатная должность в проекте Tendem. В качестве старшего инженера по сбору данных Python вы будете выполнять задачи по сбору данных, требующие технической точности для веб-извлечения и обработки, используя такие инструменты, как Apify, OpenRouter и другие технологии, а также свой собственный технический опыт и подходы.
Ключевые обязанности
• Собственные комплексные рабочие процессы извлечения данных на сложных веб-сайтах, обеспечивающие полный охват, точность и надежную доставку структурированных наборов данных.
• Используйте доступные инструменты и настраиваемые рабочие процессы для ускорения сбора, проверки и выполнения задач данных при соблюдении определенных требований.
• Обеспечьте надежное извлечение данных из динамических и интерактивных веб-источников, при необходимости адаптируя подходы к обработке контента, отображаемого с помощью JavaScript, и изменению поведения сайта.
• Обеспечьте соблюдение стандартов качества данных посредством проверок достоверности, контроля согласованности между источниками, соблюдения спецификаций форматирования и систематической проверки перед доставкой.
• Масштабируйте операции очистки больших наборов данных с помощью эффективной пакетной обработки или распараллеливания, отслеживайте сбои и поддерживайте устойчивость к незначительным изменениям структуры сайта.
Образовательная квалификация
• Не менее 5 лет соответствующего опыта в области обработки данных, веб-скрапинга, автоматизации или разработки программного обеспечения (обязательно).
• Степень бакалавра или магистра в области инженерии, прикладной математики, информатики или смежных технических областях является плюсом.
Академический и/или профессиональный опыт
Кандидаты должны иметь прочную техническую базу и практический опыт работы со сценариями, автоматизацией и рабочими процессами извлечения данных. Мы ищем специалистов, которые умеют решать нетривиальные задачи, уверенно работать с современными инструментами и технологиями разработки, систематически собирать, структурировать и проверять данные из различных источников. Важны методический, детальный подход и способность работать самостоятельно.
Технические навыки (обязательно)
• Большой опыт парсинга веб-страниц Python (BeautifulSoup, Selenium или аналогичных), включая динамический контент (JS, AJAX, бесконечная прокрутка) и API через прокси.
• Доказанная способность извлекать данные из сложных структур (иерархии, архивные страницы, противоречивый HTML).
• Солидный опыт очистки, нормализации и проверки данных, предоставления структурированных наборов данных (CSV, JSON, Google Таблицы).
Дополнительные требования
• Подтвержденный опыт работы с механизмами защиты от ботов и динамическими структурами сайтов в больших масштабах.
• Опыт работы с облачной инфраструктурой (AWS или аналогичный) и контейнеризацией (Docker) как части реальных рабочих процессов.
• Практический опыт работы с платформами LLM (LangChain, OpenRouter или аналогичными), применяемыми для задач автоматизации.
• Большое внимание к деталям и приверженность точности данных.
• Самостоятельная трудовая этика с возможностью самостоятельного устранения неполадок.
• Ссылка на GitHub является плюсом.
• Владение английским языком: выше среднего (B2) или выше (обязательно).
Ожидаемые сроки проекта
По оценкам, для этого проекта выполнение задач потребует около 10–20 часов в неделю на активных фазах в зависимости от требований проекта. Это приблизительная оценка, а не гарантированная рабочая нагрузка, которая применяется только во время активности проекта.
Компенсация
В этом проекте участники могут зарабатывать до 40 долларов США в час в эквиваленте, в зависимости от их уровня и темпа вклада. Компенсация варьируется в зависимости от проекта в зависимости от масштаба, сложности и требуемого опыта. Обратите внимание, что другие проекты на платформе могут предлагать разные уровни заработка в зависимости от их требований.
Первоначально опубликовано о Гималаях
Источник: Гималаи (https://himalayas.app/companies/mindrift/jobs/senior-python-data-scraping-engineer-freelance-5626901476).
Это объявление получено из партнерского фида. Оформляйте заказ на исходном сайте.
Источник: Mindrift
Объявление предоставлено Mindrift.