Emploi
De la source partenaire
Ingénieur senior en grattage de données Python (indépendant)
40 $US Salaire
Détails
- Type de contrat
- Temps partiel
- À distance
- Oui
- Salaire à partir de
- 40
- Salaire jusqu'à
- 40
- Entreprise
- Mindrift
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
Mindrift recherche des spécialistes Vibecode hautement qualifiés pour rejoindre le projet Tendem () et piloter des flux de travail spécialisés de récupération de données pour des cas d'utilisation réels. Mindrift recherche des ingénieurs senior en grattage de données Python hautement qualifiés pour rejoindre le projet Tendem et piloter des flux de travail spécialisés de grattage de données pour des applications du monde réel. Dans ce rôle, vous appliquerez votre expertise en matière de web scraping, d'extraction et de traitement de données pour fournir des résultats précis, fiables et de haute qualité. Cette opportunité à distance à temps partiel est idéale pour les professionnels techniques possédant une expérience pratique du web scraping, de l'extraction et du traitement de données.
Ce que nous faisons
La plateforme Mindrift met en relation des spécialistes avec des projets technologiques innovants. Notre mission est d'aider à développer des technologies d'IA de haute qualité en combinant l'expertise réelle de professionnels du monde entier avec des efforts avancés de développement d'IA.
À propos du rôle
Il s'agit d'un rôle indépendant pour un projet Tendem. En tant qu'ingénieur principal en grattage de données Python, vous gérerez des tâches de grattage de données nécessitant une précision technique pour l'extraction et le traitement du Web, en utilisant des outils tels qu'Apify, OpenRouter et d'autres technologies, ainsi que votre propre expertise et approches techniques.
Principales responsabilités
• Posséder des workflows d'extraction de données de bout en bout sur des sites Web complexes, garantissant une couverture complète, l'exactitude et la fourniture fiable d'ensembles de données structurés.
• Tirez parti des outils disponibles et des flux de travail personnalisés pour accélérer la collecte de données, la validation et l'exécution des tâches tout en répondant aux exigences définies.
• Assurer une extraction fiable à partir de sources Web dynamiques et interactives, en adaptant les approches si nécessaire pour gérer le contenu rendu en JavaScript et en modifiant le comportement du site.
• Appliquer les normes de qualité des données grâce à des contrôles de validation, des contrôles de cohérence entre sources, le respect des spécifications de formatage et une vérification systématique avant la livraison.
• Faites évoluer les opérations de scraping pour de grands ensembles de données à l'aide d'un traitement par lots ou d'une parallélisation efficace, surveillez les pannes et maintenez la stabilité contre les modifications mineures de la structure du site.
Diplôme d'études
• Au moins 5 ans et plus d'expérience pertinente en ingénierie de données, web scraping, automatisation ou développement de logiciels (obligatoire).
• Un baccalauréat ou une maîtrise en ingénierie, en mathématiques appliquées, en informatique ou dans un domaine technique connexe est un plus.
Expérience académique et/ou professionnelle
Les candidats doivent avoir une base technique solide et une expérience pratique des flux de travail de script, d'automatisation et d'extraction de données. Nous recherchons des spécialistes capables de résoudre des problèmes non triviaux, de travailler en toute confiance avec des outils et des technologies de développement modernes et de collecter, structurer et valider systématiquement des données provenant de diverses sources. Une approche méthodique et soucieuse du détail ainsi que la capacité de travailler de manière indépendante sont essentielles.
Compétences techniques (essentielles)
• Forte expérience en web scraping Python (BeautifulSoup, Selenium ou similaire), y compris le contenu dynamique (JS, AJAX, défilement infini) et les API via des proxys
• Capacité avérée à extraire des données de structures complexes (hiérarchies, pages archivées, HTML incohérent)
• Solide expérience en nettoyage, normalisation et validation de données, fournissant des ensembles de données structurés (CSV, JSON, Google Sheets)
Exigences supplémentaires
• Expérience démontrée dans la gestion des mécanismes anti-bots et des structures de sites dynamiques à grande échelle
• Expérience avec l'infrastructure cloud (AWS ou équivalent) et la conteneurisation (Docker) dans le cadre de flux de travail réels
• Expérience pratique avec les frameworks LLM (LangChain, OpenRouter ou similaire) appliqués aux tâches d'automatisation
• Grande attention aux détails et engagement envers l'exactitude des données
• Éthique du travail autonome et capacité à résoudre les problèmes de manière indépendante
• Un lien vers GitHub est un plus
• Maîtrise de l'anglais : intermédiaire supérieur (B2) ou supérieur (obligatoire)
Temps attendus du projet
Pour ce projet, les tâches devraient nécessiter environ 10 à 20 heures par semaine pendant les phases actives, en fonction des exigences du projet. Il s'agit d'une estimation, et non d'une charge de travail garantie, et s'applique uniquement pendant que le projet est actif.
Rémunération
Sur ce projet, les contributeurs peuvent gagner jusqu'à 40 $ de l'heure, en fonction de leur niveau et de leur rythme de contribution. La rémunération varie selon les projets en fonction de la portée, de la complexité et de l'expertise requise. Veuillez noter que d'autres projets sur la plateforme peuvent proposer différents niveaux de gains en fonction de leurs besoins.
Publié initialement sur Himalaya
Source : Himalaya (https://himalayas.app/companies/minndrift/jobs/senior-python-data-scraping-engineer-freelance-5626901476)
Ce que nous faisons
La plateforme Mindrift met en relation des spécialistes avec des projets technologiques innovants. Notre mission est d'aider à développer des technologies d'IA de haute qualité en combinant l'expertise réelle de professionnels du monde entier avec des efforts avancés de développement d'IA.
À propos du rôle
Il s'agit d'un rôle indépendant pour un projet Tendem. En tant qu'ingénieur principal en grattage de données Python, vous gérerez des tâches de grattage de données nécessitant une précision technique pour l'extraction et le traitement du Web, en utilisant des outils tels qu'Apify, OpenRouter et d'autres technologies, ainsi que votre propre expertise et approches techniques.
Principales responsabilités
• Posséder des workflows d'extraction de données de bout en bout sur des sites Web complexes, garantissant une couverture complète, l'exactitude et la fourniture fiable d'ensembles de données structurés.
• Tirez parti des outils disponibles et des flux de travail personnalisés pour accélérer la collecte de données, la validation et l'exécution des tâches tout en répondant aux exigences définies.
• Assurer une extraction fiable à partir de sources Web dynamiques et interactives, en adaptant les approches si nécessaire pour gérer le contenu rendu en JavaScript et en modifiant le comportement du site.
• Appliquer les normes de qualité des données grâce à des contrôles de validation, des contrôles de cohérence entre sources, le respect des spécifications de formatage et une vérification systématique avant la livraison.
• Faites évoluer les opérations de scraping pour de grands ensembles de données à l'aide d'un traitement par lots ou d'une parallélisation efficace, surveillez les pannes et maintenez la stabilité contre les modifications mineures de la structure du site.
Diplôme d'études
• Au moins 5 ans et plus d'expérience pertinente en ingénierie de données, web scraping, automatisation ou développement de logiciels (obligatoire).
• Un baccalauréat ou une maîtrise en ingénierie, en mathématiques appliquées, en informatique ou dans un domaine technique connexe est un plus.
Expérience académique et/ou professionnelle
Les candidats doivent avoir une base technique solide et une expérience pratique des flux de travail de script, d'automatisation et d'extraction de données. Nous recherchons des spécialistes capables de résoudre des problèmes non triviaux, de travailler en toute confiance avec des outils et des technologies de développement modernes et de collecter, structurer et valider systématiquement des données provenant de diverses sources. Une approche méthodique et soucieuse du détail ainsi que la capacité de travailler de manière indépendante sont essentielles.
Compétences techniques (essentielles)
• Forte expérience en web scraping Python (BeautifulSoup, Selenium ou similaire), y compris le contenu dynamique (JS, AJAX, défilement infini) et les API via des proxys
• Capacité avérée à extraire des données de structures complexes (hiérarchies, pages archivées, HTML incohérent)
• Solide expérience en nettoyage, normalisation et validation de données, fournissant des ensembles de données structurés (CSV, JSON, Google Sheets)
Exigences supplémentaires
• Expérience démontrée dans la gestion des mécanismes anti-bots et des structures de sites dynamiques à grande échelle
• Expérience avec l'infrastructure cloud (AWS ou équivalent) et la conteneurisation (Docker) dans le cadre de flux de travail réels
• Expérience pratique avec les frameworks LLM (LangChain, OpenRouter ou similaire) appliqués aux tâches d'automatisation
• Grande attention aux détails et engagement envers l'exactitude des données
• Éthique du travail autonome et capacité à résoudre les problèmes de manière indépendante
• Un lien vers GitHub est un plus
• Maîtrise de l'anglais : intermédiaire supérieur (B2) ou supérieur (obligatoire)
Temps attendus du projet
Pour ce projet, les tâches devraient nécessiter environ 10 à 20 heures par semaine pendant les phases actives, en fonction des exigences du projet. Il s'agit d'une estimation, et non d'une charge de travail garantie, et s'applique uniquement pendant que le projet est actif.
Rémunération
Sur ce projet, les contributeurs peuvent gagner jusqu'à 40 $ de l'heure, en fonction de leur niveau et de leur rythme de contribution. La rémunération varie selon les projets en fonction de la portée, de la complexité et de l'expertise requise. Veuillez noter que d'autres projets sur la plateforme peuvent proposer différents niveaux de gains en fonction de leurs besoins.
Publié initialement sur Himalaya
Source : Himalaya (https://himalayas.app/companies/minndrift/jobs/senior-python-data-scraping-engineer-freelance-5626901476)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Mindrift
Annonce fournie par Mindrift.