Emploi
De la source partenaire
Ingénieur de données fondateur
Prix sur demande
Détails
- Type de contrat
- Temps plein
- À distance
- Non
- Entreprise
- Meetdavis
Description
Traduit automatiquement depuis English. Le texte original fait foi. Traduction automatique — une traduction plus précise est en préparation.
TL;DR Davis recrute un ingénieur de données fondateur pour créer les données derrière notre modèle de fondation, formé à partir de zéro pour générer des bâtiments sous forme de graphiques géométriques. Vous posséderez les données de bout en bout, depuis les plans d'étage bruts et la génération synthétique jusqu'à la représentation canonique, la conservation, le pré-entraînement à grande échelle et les ablations qui nous indiquent quelles données déplacent réellement le modèle. Ici, l'ensemble de données fait partie de l'algorithme.
À propos de Davis
Davis est une société immobilière native de l'IA qui accélère le développement et la conception architecturale à un stade précoce. Aujourd'hui, les développeurs coordonnent quatre à cinq parties prenantes fragmentées sur des semaines ou des mois. Bientôt, ils n’en auront besoin que d’un seul : Davis.
Nous transformons chaque entrée qui façonne une décision de développement en résultats prêts à la décision : études de faisabilité de qualité investisseur, analyse d'investissement et conceptions certifiées par un architecte, livrées en quelques jours. Chaque étape associe nos systèmes d'IA exclusifs à un examen par des experts, de sorte que la rapidité ne se fait jamais au détriment de la fiabilité.
Nous avons clôturé un pré-amorçage de 5,5 millions de dollars codirigé par Heartcore Capital et Balderton Capital, avec Yellow, Evantic et Entrepreneur First, aux côtés d'investisseurs providentiels des équipes fondatrices de Spacemaker, Black Forest Labs, Hugging Face, Supabase, Cleo et Spore Bio. Nous travaillons déjà avec des développeurs de premier plan et prévoyons de soutenir des centaines de projets au cours de l'année à venir, en approfondissant nos recherches, nos recrutements et notre couverture du processus de développement de bout en bout.
Le rôle
Vous serez propriétaire des données dont notre modèle de base apprend, un modèle que nous entraînons à partir de zéro pour générer des bâtiments sous forme de graphiques géométriques. Une partie du corpus provient de plans d'étage réels sous forme d'images et de PDF qui doivent devenir des graphiques épurés et standardisés. Une grande partie sera constituée de graphiques de bâtiments synthétiques générés de manière procédurale, de géométrie et de plans d'étage rendus, avec des variations contrôlées de style, de bruit de numérisation, d'annotations et de mobilier, chacun étant conservé automatiquement avec son graphique de vérité terrain.
Vous réfléchirez à l'ensemble de la boucle, des données brutes et synthétiques à une représentation structurée canonique, en passant par la conservation et la validation, l'ensemble de données de formation, le pré-entraînement à grande échelle, l'évaluation, les ablations de données, et retour à l'amélioration du générateur et du mélange de données. Vous êtes suffisamment expérimenté pour concevoir la pile de données et définir la stratégie de données, et suffisamment pratique pour écrire les pipelines, exécuter les expériences, former les modèles et effectuer les ablations vous-même.
Sur quoi vous travaillerez
• Corpus à partir de sources brutes. Transformez de vrais plans d'étage (images, PDF, scans) en graphiques de bâtiments propres et standardisés, avec la géométrie et la sémantique qui les rendent faciles à entraîner.
• Génération de données synthétiques. Explorez des stratégies pour étendre l'ensemble de données avec des données synthétiques.
• Représentation canonique et conservation. Définissez la représentation standardisée, puis filtrez, dédupliquez, évaluez la qualité et validez à grande échelle, avec la gestion des versions, la provenance et la lignée.
• Données et mélanges de pré-entraînement. Assemblez les ensembles de données de formation, concevez le mélange et le programme, et mélangez des données synthétiques et réelles pour une pré-formation à grande échelle.
• Ablations de données. Entraînez des modèles pour savoir quelles données sont réellement utiles, lisez les résultats et réinjectez-les dans le générateur et le mélange.
• Évaluation. Créez le faisceau d'évaluation (ensembles de données, métriques, tests de régression, surveillance) qui suit la qualité des données et des modèles au fil du temps.
Ce que nous recherchons
• Vous avez construit l'ensemble de données, pas seulement formé dessus. Vous avez personnellement construit ou généré les données utilisées pour une grande exécution de pré-entraînement, à partir de sources brutes ou synthétiques, plutôt que de vous entraîner uniquement sur un ensemble de données que quelqu'un vous a remis.
• Senior et profondément impliqué. Au moins 5 ans d'expérience solide, suffisamment expérimenté pour concevoir la pile de données et définir une stratégie, tout en continuant à coder les pipelines, à exécuter les expériences et à effectuer les ablations vous-même.
• Les données comme problème de premier ordre. Un track record où la donnée elle-même est l'objet : conservation, filtrage, déduplication, scoring de qualité, mélanges, génération synthétique.
• Ingénierie solide. Deep Python, code propre et typé, asynchrone et simultanéité, pipelines de données distribués, culture TDD.
C'est agréable d'avoir
• Vision par ordinateur et compréhension de documents, images vers sortie structurée, OCR, extraction de mise en page, segmentation, extraction de géométrie, vectorisation, raster vers vecteur, image vers graphique de scène, 3D ou CAO.
• Graphiques et données scientifiques structurées, graphiques moléculaires, protéiques ou scéniques, maillages, CAO, BIM, géométrie 3D ou données mondiales relationnelles et structurées.
• Mondes synthétiques et simulation, d'un état structuré à un simulateur, à un moteur de rendu d'images synthétiques avec des étiquettes parfaites, puis un modèle de perception, avec un oeil sur l'écart entre la simulation et le réel.
• Modèles de base à partir de zéro, implication réelle dans un vaste processus de pré-formation, pas seulement de mise au point.
• Preuve publique de propriété des données, leader sur un ensemble de données, une version Hugging Face, une fiche d'ensemble de données, un blog technique sur votre pipeline ou une présentation sur la conservation des données ou les données synthétiques.
• SIG et géométrie, parcelles, couches de zonage, projections, géométrie computationnelle ou optimisation contrainte.
• Données multi-pays, sources hétérogènes, localisation et règles variables.
Pourquoi rejoindre Davis
• Posséder les données de bout en bout, du générateur au mélange de pré-formation, en tant que personne qui définit ce dont le modèle apprend.
• Façonner un modèle de base à partir de zéro, sur une représentation structurée sur laquelle personne d'autre ne s'entraîne.
• Travaillez sur des problèmes véritablement difficiles, de l'image au graphique, des mondes synthétiques et une pré-formation à grande échelle, votre travail atteignant les clients en quelques jours.
• Salaire compétitif et équité significative, au niveau fondateur, dans une entreprise en démarrage.
• Rejoignez une équipe de classe mondiale, un mélange de chercheurs, d'ingénieurs et d'architectes en IA soutenus par des sociétés de capital-risque de classe mondiale.
Plus d'informations sur Davis, l'équipe et le marché que nous recherchons :…
Source : Arbeitnow (https://www.arbeitnow.fr/jobs/companies/meetdavis/founding-data-engineer-paris-399584)
À propos de Davis
Davis est une société immobilière native de l'IA qui accélère le développement et la conception architecturale à un stade précoce. Aujourd'hui, les développeurs coordonnent quatre à cinq parties prenantes fragmentées sur des semaines ou des mois. Bientôt, ils n’en auront besoin que d’un seul : Davis.
Nous transformons chaque entrée qui façonne une décision de développement en résultats prêts à la décision : études de faisabilité de qualité investisseur, analyse d'investissement et conceptions certifiées par un architecte, livrées en quelques jours. Chaque étape associe nos systèmes d'IA exclusifs à un examen par des experts, de sorte que la rapidité ne se fait jamais au détriment de la fiabilité.
Nous avons clôturé un pré-amorçage de 5,5 millions de dollars codirigé par Heartcore Capital et Balderton Capital, avec Yellow, Evantic et Entrepreneur First, aux côtés d'investisseurs providentiels des équipes fondatrices de Spacemaker, Black Forest Labs, Hugging Face, Supabase, Cleo et Spore Bio. Nous travaillons déjà avec des développeurs de premier plan et prévoyons de soutenir des centaines de projets au cours de l'année à venir, en approfondissant nos recherches, nos recrutements et notre couverture du processus de développement de bout en bout.
Le rôle
Vous serez propriétaire des données dont notre modèle de base apprend, un modèle que nous entraînons à partir de zéro pour générer des bâtiments sous forme de graphiques géométriques. Une partie du corpus provient de plans d'étage réels sous forme d'images et de PDF qui doivent devenir des graphiques épurés et standardisés. Une grande partie sera constituée de graphiques de bâtiments synthétiques générés de manière procédurale, de géométrie et de plans d'étage rendus, avec des variations contrôlées de style, de bruit de numérisation, d'annotations et de mobilier, chacun étant conservé automatiquement avec son graphique de vérité terrain.
Vous réfléchirez à l'ensemble de la boucle, des données brutes et synthétiques à une représentation structurée canonique, en passant par la conservation et la validation, l'ensemble de données de formation, le pré-entraînement à grande échelle, l'évaluation, les ablations de données, et retour à l'amélioration du générateur et du mélange de données. Vous êtes suffisamment expérimenté pour concevoir la pile de données et définir la stratégie de données, et suffisamment pratique pour écrire les pipelines, exécuter les expériences, former les modèles et effectuer les ablations vous-même.
Sur quoi vous travaillerez
• Corpus à partir de sources brutes. Transformez de vrais plans d'étage (images, PDF, scans) en graphiques de bâtiments propres et standardisés, avec la géométrie et la sémantique qui les rendent faciles à entraîner.
• Génération de données synthétiques. Explorez des stratégies pour étendre l'ensemble de données avec des données synthétiques.
• Représentation canonique et conservation. Définissez la représentation standardisée, puis filtrez, dédupliquez, évaluez la qualité et validez à grande échelle, avec la gestion des versions, la provenance et la lignée.
• Données et mélanges de pré-entraînement. Assemblez les ensembles de données de formation, concevez le mélange et le programme, et mélangez des données synthétiques et réelles pour une pré-formation à grande échelle.
• Ablations de données. Entraînez des modèles pour savoir quelles données sont réellement utiles, lisez les résultats et réinjectez-les dans le générateur et le mélange.
• Évaluation. Créez le faisceau d'évaluation (ensembles de données, métriques, tests de régression, surveillance) qui suit la qualité des données et des modèles au fil du temps.
Ce que nous recherchons
• Vous avez construit l'ensemble de données, pas seulement formé dessus. Vous avez personnellement construit ou généré les données utilisées pour une grande exécution de pré-entraînement, à partir de sources brutes ou synthétiques, plutôt que de vous entraîner uniquement sur un ensemble de données que quelqu'un vous a remis.
• Senior et profondément impliqué. Au moins 5 ans d'expérience solide, suffisamment expérimenté pour concevoir la pile de données et définir une stratégie, tout en continuant à coder les pipelines, à exécuter les expériences et à effectuer les ablations vous-même.
• Les données comme problème de premier ordre. Un track record où la donnée elle-même est l'objet : conservation, filtrage, déduplication, scoring de qualité, mélanges, génération synthétique.
• Ingénierie solide. Deep Python, code propre et typé, asynchrone et simultanéité, pipelines de données distribués, culture TDD.
C'est agréable d'avoir
• Vision par ordinateur et compréhension de documents, images vers sortie structurée, OCR, extraction de mise en page, segmentation, extraction de géométrie, vectorisation, raster vers vecteur, image vers graphique de scène, 3D ou CAO.
• Graphiques et données scientifiques structurées, graphiques moléculaires, protéiques ou scéniques, maillages, CAO, BIM, géométrie 3D ou données mondiales relationnelles et structurées.
• Mondes synthétiques et simulation, d'un état structuré à un simulateur, à un moteur de rendu d'images synthétiques avec des étiquettes parfaites, puis un modèle de perception, avec un oeil sur l'écart entre la simulation et le réel.
• Modèles de base à partir de zéro, implication réelle dans un vaste processus de pré-formation, pas seulement de mise au point.
• Preuve publique de propriété des données, leader sur un ensemble de données, une version Hugging Face, une fiche d'ensemble de données, un blog technique sur votre pipeline ou une présentation sur la conservation des données ou les données synthétiques.
• SIG et géométrie, parcelles, couches de zonage, projections, géométrie computationnelle ou optimisation contrainte.
• Données multi-pays, sources hétérogènes, localisation et règles variables.
Pourquoi rejoindre Davis
• Posséder les données de bout en bout, du générateur au mélange de pré-formation, en tant que personne qui définit ce dont le modèle apprend.
• Façonner un modèle de base à partir de zéro, sur une représentation structurée sur laquelle personne d'autre ne s'entraîne.
• Travaillez sur des problèmes véritablement difficiles, de l'image au graphique, des mondes synthétiques et une pré-formation à grande échelle, votre travail atteignant les clients en quelques jours.
• Salaire compétitif et équité significative, au niveau fondateur, dans une entreprise en démarrage.
• Rejoignez une équipe de classe mondiale, un mélange de chercheurs, d'ingénieurs et d'architectes en IA soutenus par des sociétés de capital-risque de classe mondiale.
Plus d'informations sur Davis, l'équipe et le marché que nous recherchons :…
Source : Arbeitnow (https://www.arbeitnow.fr/jobs/companies/meetdavis/founding-data-engineer-paris-399584)
Cette annonce provient d'un flux partenaire. Postulez sur le site source.
Source: Meetdavis
Emplacement
Paris, France
Annonce fournie par Meetdavis.