Job
Aus Partner-Feed
Gründungsdateningenieur
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- Meetdavis
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
TL;DR Davis stellt einen Founding Data Engineer ein, um die Daten hinter unserem Fundamentmodell zu erstellen, das von Grund auf darauf trainiert wird, Gebäude als geometrische Diagramme zu generieren. Sie besitzen die gesamten Daten, von Rohgrundrissen und synthetischer Generierung bis hin zu einer kanonischen Darstellung, Kuratierung, umfangreichem Vortraining und den Ablationen, die uns sagen, welche Daten das Modell tatsächlich bewegen. Hier ist der Datensatz Teil des Algorithmus.
Über Davis
Davis ist ein KI-natives Immobilienunternehmen, das die Entwicklung in der Frühphase und das Architekturdesign beschleunigt. Heute koordinieren Entwickler über Wochen oder Monate hinweg vier bis fünf fragmentierte Stakeholder. Bald brauchen sie nur noch einen: Davis.
Wir wandeln jeden Input, der eine Entwicklungsentscheidung prägt, in entscheidungsreife Ergebnisse um: Machbarkeitsstudien auf Investorenebene, Investitionsanalysen und vom Architekten zertifizierte Entwürfe, die innerhalb weniger Tage geliefert werden. In jeder Phase werden unsere proprietären KI-Systeme mit Expertenbewertungen kombiniert, sodass Geschwindigkeit niemals auf Kosten der Zuverlässigkeit geht.
Wir haben unter der gemeinsamen Leitung von Heartcore Capital und Balderton Capital mit Yellow, Evantic und Entrepreneur First sowie Angels aus den Gründerteams von Spacemaker, Black Forest Labs, Hugging Face, Supabase, Cleo und Spore Bio ein Pre-Seed-Projekt im Wert von 5,5 Millionen US-Dollar abgeschlossen. Wir arbeiten bereits mit führenden Entwicklern zusammen und gehen davon aus, im kommenden Jahr Hunderte von Projekten zu unterstützen, indem wir unsere Forschung, unsere Einstellungsverfahren und unsere umfassende Abdeckung des Entwicklungsprozesses vertiefen.
Die Rolle
Sie sind Eigentümer der Daten, aus denen unser Fundamentmodell lernt, ein Modell, das wir von Grund auf trainieren, um Gebäude als geometrische Diagramme zu generieren. Ein Teil des Korpus stammt aus echten Grundrissen in Form von Bildern und PDFs, die in saubere, standardisierte Diagramme umgewandelt werden müssen. Ein großer Teil wird aus synthetischen, prozedural generierten Gebäudediagrammen, Geometrien und gerenderten Grundrissen bestehen, mit kontrollierten Variationen in Stil, Scan-Rauschen, Anmerkungen und Möbeln, die jeweils automatisch mit ihrem Ground-Truth-Diagramm beibehalten werden.
Sie werden über den gesamten Kreislauf nachdenken, von rohen und synthetischen Daten über eine kanonisch strukturierte Darstellung, Kuration und Validierung, den Trainingsdatensatz, umfangreiches Vortraining, Auswertung, Datenablationen und zurück zur Verbesserung des Generators und der Datenmischung. Sie sind erfahren genug, um den Datenstapel zu entwerfen und die Datenstrategie festzulegen, und praktisch genug, um die Pipelines zu schreiben, die Experimente durchzuführen, die Modelle zu trainieren und die Ablationen selbst durchzuführen.
Woran Sie arbeiten werden
• Korpus aus Rohquellen. Verwandeln Sie echte Grundrisse (Bilder, PDFs, Scans) in saubere, standardisierte Gebäudediagramme mit der Geometrie und Semantik, die sie trainierbar machen.
• Synthetische Datengenerierung. Entdecken Sie Strategien zur Erweiterung des Datensatzes mit synthetischen Daten.
• Kanonische Darstellung und Kuration. Definieren Sie die standardisierte Darstellung, filtern Sie sie, deduplizieren Sie sie, führen Sie eine Qualitätsbewertung durch und validieren Sie sie im Maßstab mit Versionierung, Herkunft und Abstammung.
• Daten und Mischungen vor dem Training. Stellen Sie die Trainingsdatensätze zusammen, entwerfen Sie die Mischung und den Lehrplan und kombinieren Sie synthetische und reale Daten für ein groß angelegtes Vortraining.
• Datenablationen. Trainieren Sie Modelle, um herauszufinden, welche Daten tatsächlich helfen, lesen Sie die Ergebnisse aus und geben Sie sie zurück in den Generator und die Mischung.
• Auswertung. Erstellen Sie den Bewertungsrahmen (Datensätze, Metriken, Regressionstests, Überwachung), der die Daten- und Modellqualität im Laufe der Zeit verfolgt.
Was wir suchen
• Sie haben den Datensatz erstellt und nicht nur darauf trainiert. Sie haben die Daten, die für einen großen Vortrainingslauf verwendet wurden, persönlich aus rohen oder synthetischen Quellen erstellt oder generiert, anstatt nur mit einem Datensatz zu trainieren, den Ihnen jemand gegeben hat.
• Älter und sehr praxisorientiert. Mindestens 5 Jahre umfassende Erfahrung, älter genug, um den Datenstapel zu entwerfen und die Strategie festzulegen, aber immer noch die Pipelines zu programmieren, die Experimente durchzuführen und die Ablationen selbst durchzuführen.
• Daten als erstklassiges Problem. Eine Erfolgsbilanz, bei der die Daten selbst das Objekt sind: Kuration, Filterung, Deduplizierung, Qualitätsbewertung, Mischungen, synthetische Generierung.
• Starke Technik. Deep Python, sauberer und typisierter Code, Asynchronität und Parallelität, verteilte Datenpipelines, TDD-Kultur.
Schön zu haben
• Computer Vision und Dokumentenverständnis, Bilder zu strukturierter Ausgabe, OCR, Layout-Extraktion, Segmentierung, Geometrie-Extraktion, Vektorisierung, Raster zu Vektor, Bild zu Szenendiagramm, 3D oder CAD.
• Grafische und strukturierte wissenschaftliche Daten, Molekül-, Protein- oder Szenendiagramme, Netze, CAD, BIM, 3D-Geometrie oder relationale und strukturierte Weltdaten.
• Synthetische Welten und Simulation, ein strukturierter Zustand, ein Simulator, ein Renderer, synthetische Bilder mit perfekten Beschriftungen, dann ein Wahrnehmungsmodell, mit Blick auf die Lücke zwischen Simulation und Realität.
• Grundmodelle von Grund auf, echte Beteiligung an einem großen Vortrainingslauf, nicht nur Feinabstimmung.
• Öffentlicher Nachweis des Dateneigentums, Hinweis auf einen Datensatz, eine Hugging Face-Veröffentlichung, eine Datensatzkarte, ein technischer Blog zu Ihrer Pipeline oder ein Vortrag über Datenkuration oder synthetische Daten.
• GIS und Geometrie, Parzellen, Zonenebenen, Projektionen, rechnerische Geometrie oder eingeschränkte Optimierung.
• Mehrländerdaten, heterogene Quellen, Lokalisierung und unterschiedliche Regeln.
Warum sich Davis anschließen?
• Besitzen Sie die Daten durchgängig, vom Generator bis zur Pre-Training-Mischung, als die Person, die definiert, woraus das Modell lernt.
• Gestalten Sie ein Grundmodell von Grund auf auf der Grundlage einer strukturierten Darstellung, auf der sonst niemand trainiert.
• Arbeiten Sie an wirklich schwierigen Problemen, Bild-zu-Grafik, synthetischen Welten und umfangreichen Vorschulungen, wobei Ihre Arbeit innerhalb weniger Tage beim Kunden ankommt.
• Wettbewerbsfähiges Gehalt und sinnvolles Eigenkapital auf Gründungsebene in einem Unternehmen in der Anfangsphase.
• Treten Sie einem Weltklasse-Team bei, einer Mischung aus KI-Forschern, Ingenieuren und Architekten, unterstützt von erstklassigen VCs.
Weitere Informationen über Davis, das Team und den Markt, den wir anstreben:…
Quelle: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/meetdavis/founding-data-engineer-paris-399584)
Über Davis
Davis ist ein KI-natives Immobilienunternehmen, das die Entwicklung in der Frühphase und das Architekturdesign beschleunigt. Heute koordinieren Entwickler über Wochen oder Monate hinweg vier bis fünf fragmentierte Stakeholder. Bald brauchen sie nur noch einen: Davis.
Wir wandeln jeden Input, der eine Entwicklungsentscheidung prägt, in entscheidungsreife Ergebnisse um: Machbarkeitsstudien auf Investorenebene, Investitionsanalysen und vom Architekten zertifizierte Entwürfe, die innerhalb weniger Tage geliefert werden. In jeder Phase werden unsere proprietären KI-Systeme mit Expertenbewertungen kombiniert, sodass Geschwindigkeit niemals auf Kosten der Zuverlässigkeit geht.
Wir haben unter der gemeinsamen Leitung von Heartcore Capital und Balderton Capital mit Yellow, Evantic und Entrepreneur First sowie Angels aus den Gründerteams von Spacemaker, Black Forest Labs, Hugging Face, Supabase, Cleo und Spore Bio ein Pre-Seed-Projekt im Wert von 5,5 Millionen US-Dollar abgeschlossen. Wir arbeiten bereits mit führenden Entwicklern zusammen und gehen davon aus, im kommenden Jahr Hunderte von Projekten zu unterstützen, indem wir unsere Forschung, unsere Einstellungsverfahren und unsere umfassende Abdeckung des Entwicklungsprozesses vertiefen.
Die Rolle
Sie sind Eigentümer der Daten, aus denen unser Fundamentmodell lernt, ein Modell, das wir von Grund auf trainieren, um Gebäude als geometrische Diagramme zu generieren. Ein Teil des Korpus stammt aus echten Grundrissen in Form von Bildern und PDFs, die in saubere, standardisierte Diagramme umgewandelt werden müssen. Ein großer Teil wird aus synthetischen, prozedural generierten Gebäudediagrammen, Geometrien und gerenderten Grundrissen bestehen, mit kontrollierten Variationen in Stil, Scan-Rauschen, Anmerkungen und Möbeln, die jeweils automatisch mit ihrem Ground-Truth-Diagramm beibehalten werden.
Sie werden über den gesamten Kreislauf nachdenken, von rohen und synthetischen Daten über eine kanonisch strukturierte Darstellung, Kuration und Validierung, den Trainingsdatensatz, umfangreiches Vortraining, Auswertung, Datenablationen und zurück zur Verbesserung des Generators und der Datenmischung. Sie sind erfahren genug, um den Datenstapel zu entwerfen und die Datenstrategie festzulegen, und praktisch genug, um die Pipelines zu schreiben, die Experimente durchzuführen, die Modelle zu trainieren und die Ablationen selbst durchzuführen.
Woran Sie arbeiten werden
• Korpus aus Rohquellen. Verwandeln Sie echte Grundrisse (Bilder, PDFs, Scans) in saubere, standardisierte Gebäudediagramme mit der Geometrie und Semantik, die sie trainierbar machen.
• Synthetische Datengenerierung. Entdecken Sie Strategien zur Erweiterung des Datensatzes mit synthetischen Daten.
• Kanonische Darstellung und Kuration. Definieren Sie die standardisierte Darstellung, filtern Sie sie, deduplizieren Sie sie, führen Sie eine Qualitätsbewertung durch und validieren Sie sie im Maßstab mit Versionierung, Herkunft und Abstammung.
• Daten und Mischungen vor dem Training. Stellen Sie die Trainingsdatensätze zusammen, entwerfen Sie die Mischung und den Lehrplan und kombinieren Sie synthetische und reale Daten für ein groß angelegtes Vortraining.
• Datenablationen. Trainieren Sie Modelle, um herauszufinden, welche Daten tatsächlich helfen, lesen Sie die Ergebnisse aus und geben Sie sie zurück in den Generator und die Mischung.
• Auswertung. Erstellen Sie den Bewertungsrahmen (Datensätze, Metriken, Regressionstests, Überwachung), der die Daten- und Modellqualität im Laufe der Zeit verfolgt.
Was wir suchen
• Sie haben den Datensatz erstellt und nicht nur darauf trainiert. Sie haben die Daten, die für einen großen Vortrainingslauf verwendet wurden, persönlich aus rohen oder synthetischen Quellen erstellt oder generiert, anstatt nur mit einem Datensatz zu trainieren, den Ihnen jemand gegeben hat.
• Älter und sehr praxisorientiert. Mindestens 5 Jahre umfassende Erfahrung, älter genug, um den Datenstapel zu entwerfen und die Strategie festzulegen, aber immer noch die Pipelines zu programmieren, die Experimente durchzuführen und die Ablationen selbst durchzuführen.
• Daten als erstklassiges Problem. Eine Erfolgsbilanz, bei der die Daten selbst das Objekt sind: Kuration, Filterung, Deduplizierung, Qualitätsbewertung, Mischungen, synthetische Generierung.
• Starke Technik. Deep Python, sauberer und typisierter Code, Asynchronität und Parallelität, verteilte Datenpipelines, TDD-Kultur.
Schön zu haben
• Computer Vision und Dokumentenverständnis, Bilder zu strukturierter Ausgabe, OCR, Layout-Extraktion, Segmentierung, Geometrie-Extraktion, Vektorisierung, Raster zu Vektor, Bild zu Szenendiagramm, 3D oder CAD.
• Grafische und strukturierte wissenschaftliche Daten, Molekül-, Protein- oder Szenendiagramme, Netze, CAD, BIM, 3D-Geometrie oder relationale und strukturierte Weltdaten.
• Synthetische Welten und Simulation, ein strukturierter Zustand, ein Simulator, ein Renderer, synthetische Bilder mit perfekten Beschriftungen, dann ein Wahrnehmungsmodell, mit Blick auf die Lücke zwischen Simulation und Realität.
• Grundmodelle von Grund auf, echte Beteiligung an einem großen Vortrainingslauf, nicht nur Feinabstimmung.
• Öffentlicher Nachweis des Dateneigentums, Hinweis auf einen Datensatz, eine Hugging Face-Veröffentlichung, eine Datensatzkarte, ein technischer Blog zu Ihrer Pipeline oder ein Vortrag über Datenkuration oder synthetische Daten.
• GIS und Geometrie, Parzellen, Zonenebenen, Projektionen, rechnerische Geometrie oder eingeschränkte Optimierung.
• Mehrländerdaten, heterogene Quellen, Lokalisierung und unterschiedliche Regeln.
Warum sich Davis anschließen?
• Besitzen Sie die Daten durchgängig, vom Generator bis zur Pre-Training-Mischung, als die Person, die definiert, woraus das Modell lernt.
• Gestalten Sie ein Grundmodell von Grund auf auf der Grundlage einer strukturierten Darstellung, auf der sonst niemand trainiert.
• Arbeiten Sie an wirklich schwierigen Problemen, Bild-zu-Grafik, synthetischen Welten und umfangreichen Vorschulungen, wobei Ihre Arbeit innerhalb weniger Tage beim Kunden ankommt.
• Wettbewerbsfähiges Gehalt und sinnvolles Eigenkapital auf Gründungsebene in einem Unternehmen in der Anfangsphase.
• Treten Sie einem Weltklasse-Team bei, einer Mischung aus KI-Forschern, Ingenieuren und Architekten, unterstützt von erstklassigen VCs.
Weitere Informationen über Davis, das Team und den Markt, den wir anstreben:…
Quelle: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/meetdavis/founding-data-engineer-paris-399584)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Meetdavis
Standort
Paris, Frankreich
Inserat bereitgestellt von Meetdavis.