Job
Aus Partner-Feed
ML-Ingenieur, Infrastruktur
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- Prior Labs
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Wer wir sind
Foundation-Modelle transformierten Text und Bilder. Strukturierte Daten – das größte und folgenreichste Datenformat der Welt – blieben bisher unangetastet. Was LLMs für die Sprache getan haben, tun wir für Tabellen.
Wir waren Vorreiter bei tabellarischen Fundamentmodellen: TabPFN v2 war eine Nature-Titelgeschichte, hat über 3,5 Millionen Downloads und über 7.500 GitHub-Sterne bestanden und läuft in der Produktion von der Erkennung von Lungenkrankheiten mit Oxford Cancer Analytics bis zur Verhinderung von Zugausfällen mit Hitachi. Die schwierigsten Probleme – Millionen von Zeilen, Echtzeit-Inferenz, völlig neue Modalitäten – sind noch offen, und niemand sonst arbeitet auf dieser Ebene daran.
Wir sind ein kleines, hochselektives Team von über 40 Personen mit Erfahrungen bei Google, DeepMind, Meta, Apple, Amazon, Jane Street und CERN, geleitet von Frank Hutter, Noah Hollmann und Sauraj Gambhir und beraten von Bernhard Schölkopf und Turing-Award-Gewinner Yann LeCun.
Im Juli 2026, weniger als 18 Monate nach unserem 9-Millionen-Euro-Pre-Seed, sind wir als unabhängiges Frontier-KI-Labor zu SAP gekommen – mit dem gleichen Team, der gleichen Mission und den gleichen Open-Weights-Modellen, jetzt unterstützt durch mehr als 1 Milliarde Euro über vier Jahre.
Über die Rolle
Wir geben jedes Jahr zig Millionen für GPU-Rechen aus, um tabellarische Basismodelle zu trainieren. Das ist kein Ziel, sondern das, was wir heute verfolgen, und es wächst. Die Person, die diese Infrastruktur besitzt, trifft Entscheidungen, die Millionen von Dollar wert sind: Cluster-Architektur, Planungseffizienz, Anbieterstrategie, Hardware-Auswahl. Ein falscher Anruf kostet sechsstellige Beträge.
Heute betreiben wir Slurm auf GCP über mehrere Cluster hinweg. Wir skalieren auf eine Multi-Cluster- und Multi-Provider-Infrastruktur und evaluieren neue Hardware-Generationen, sobald sie online gehen. Sie besitzen den gesamten Stack, vom Clusterbetrieb und der Kostenoptimierung bis hin zur verteilten Trainingsleistung und der Tooling-Ebene, die dafür sorgt, dass Forscher schnell vorankommen. Sie arbeiten direkt mit dem Forschungsteam zusammen und verstehen gut genug, was es tut, um Infrastrukturentscheidungen zu treffen, die ihm tatsächlich helfen. Und das ist keine reine Support-Rolle. Wir betreiben eine offene Umgebung. Wenn Sie die nächste tabellarische SOTA-Architektur in petto haben, trainieren Sie sie.
Woran Sie arbeiten werden:
• Besitzen und entwickeln Sie eine Multi-Cluster-GPU-Infrastruktur. Nutzen Sie heute GCP, morgen Multi-Provider und neue Hardware. Architektur, Terminplanung, Zuverlässigkeit, Kostenoptimierung
• Steigern Sie die GPU-Nutzung und den Trainingsdurchsatz: Profilerstellung, Speicheroptimierung, Kommunikationsengpässe, Debugging von verteiltem Training auf Systemebene über große Läufe hinweg
• Entwerfen Sie die nächste Generation unserer Infrastruktur: Multi-Cluster-Orchestrierung, neue GPU-Generationen, Anbieterdiversifizierung, Kapazitätsplanung für wachsende Rechenanforderungen
• Bauen Sie die Ebene der Entwicklerproduktivität auf: CI-Pipelines, Experimentverfolgung, Modellregistrierung, Datenverarbeitung und interne Tools, die die Forschungsiterationsgeschwindigkeit hoch halten
• Besitzen Sie das Rechenbudget. Sie verstehen die Kosten pro FLOP über Anbieter und Hardware hinweg und hassen die Verschwendung von Rechenleistung
Tech-Stack: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Vielleicht passen Sie gut zu Ihnen, wenn Sie Folgendes haben:
• 3+ Jahre Aufbau und Betrieb einer Produktions-GPU-Infrastruktur oder verteilter Schulungssysteme im großen Maßstab. In einem großen KI-Labor, einem gut finanzierten ML-Startup oder einer HPC-Umgebung
• Umfangreiche praktische Erfahrung mit Slurm und Cluster-Management. Sie haben Planungsfehler behoben, die Auslastung für mehrmandantenfähige GPU-Workloads optimiert und eine Infrastruktur betrieben, bei der Ausfallzeiten echte Kosten verursachen
• Systemdenken auf Expertenebene: Speicherbandbreite, GPU-Profilierung. Sie denken über Hardware nach, nicht über Konfigurationen
• Starkes Python und echte Beherrschung der PyTorch-Interna. Genug, um ein Profil eines Trainingslaufs zu erstellen und festzustellen, ob der Engpass beim Laden von Daten, bei der Kommunikation oder bei der Berechnung liegt
• Erfolgsbilanz bei Infrastrukturentscheidungen, die den Schulungsdurchsatz oder die Kosteneffizienz messbar verbesserten
• Starke KI-Werkzeugkenntnisse. Sie verwenden Claude Code, Cursor oder ähnliches fließend, um sich schnell zu bewegen, ohne Abstriche bei der Qualität zu machen
Bonus:
• Erleben Sie den Betrieb mit GPU-Ausgaben im zweistelligen Millionenbereich
• Erfahrung mit Multi-Cloud- oder Hybrid-HPC/Cloud-Infrastruktur
• Triton-, CUDA- oder benutzerdefinierte Kernel-Erfahrung
• Erleben Sie die Skalierung von der Einzel-Cluster- zur Multi-Cluster-Orchestrierung
• Nachverfolgung von Experimenten im Hintergrund, Modellregistrierung oder ML-Pipeline-Tools
Leben bei Prior Labs
Sie arbeiten mit Forschern und Bauherren zusammen, die höchste Ansprüche an die Qualität ihrer Arbeit und die Art und Weise der Zusammenarbeit stellen. Wir handeln schnell und nehmen uns trotzdem die Zeit, die Dinge richtig zu machen.
Unsere Teams sind in Berlin, Freiburg und New York ansässig – wenn Sie an etwas so Schwierigem wie TabPFN arbeiten, ist es wichtig, im selben Raum zu sein. Aber tolle Leute kommen von überall, und in Ausnahmefällen sind wir offen für Remote-Arbeit, was in der Regel häufige Reisen zu einem unserer Büros bedeutet. Wo auch immer Sie ansässig sind, das gesamte Unternehmen trifft sich regelmäßig zu Offsites, um gemeinsam zu bauen und zu feiern.
Unsere Verpflichtungen
Die besten Produkte und Teams werden von Menschen mit den unterschiedlichsten Perspektiven und Hintergründen aufgebaut. Wir freuen uns über Bewerbungen aus allen Identitäten und Lebensbereichen – insbesondere, wenn Sie sich jemals entmutigt gefühlt haben, weil Sie „nicht jedes Kästchen ankreuzen“ – und bieten Ihnen Chancengleichheit, unabhängig von Geschlecht, sexueller Orientierung, Herkunft, Behinderung oder anderen Merkmalen, die Sie zu dem machen, was Sie sind.
Der Umgang mit Ihren Daten ist uns wichtig – siehe unsere Seite zum Datenschutz bei der Personalbeschaffung
Weitere englischsprachige Jobs in Deutschland finden Sie auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Foundation-Modelle transformierten Text und Bilder. Strukturierte Daten – das größte und folgenreichste Datenformat der Welt – blieben bisher unangetastet. Was LLMs für die Sprache getan haben, tun wir für Tabellen.
Wir waren Vorreiter bei tabellarischen Fundamentmodellen: TabPFN v2 war eine Nature-Titelgeschichte, hat über 3,5 Millionen Downloads und über 7.500 GitHub-Sterne bestanden und läuft in der Produktion von der Erkennung von Lungenkrankheiten mit Oxford Cancer Analytics bis zur Verhinderung von Zugausfällen mit Hitachi. Die schwierigsten Probleme – Millionen von Zeilen, Echtzeit-Inferenz, völlig neue Modalitäten – sind noch offen, und niemand sonst arbeitet auf dieser Ebene daran.
Wir sind ein kleines, hochselektives Team von über 40 Personen mit Erfahrungen bei Google, DeepMind, Meta, Apple, Amazon, Jane Street und CERN, geleitet von Frank Hutter, Noah Hollmann und Sauraj Gambhir und beraten von Bernhard Schölkopf und Turing-Award-Gewinner Yann LeCun.
Im Juli 2026, weniger als 18 Monate nach unserem 9-Millionen-Euro-Pre-Seed, sind wir als unabhängiges Frontier-KI-Labor zu SAP gekommen – mit dem gleichen Team, der gleichen Mission und den gleichen Open-Weights-Modellen, jetzt unterstützt durch mehr als 1 Milliarde Euro über vier Jahre.
Über die Rolle
Wir geben jedes Jahr zig Millionen für GPU-Rechen aus, um tabellarische Basismodelle zu trainieren. Das ist kein Ziel, sondern das, was wir heute verfolgen, und es wächst. Die Person, die diese Infrastruktur besitzt, trifft Entscheidungen, die Millionen von Dollar wert sind: Cluster-Architektur, Planungseffizienz, Anbieterstrategie, Hardware-Auswahl. Ein falscher Anruf kostet sechsstellige Beträge.
Heute betreiben wir Slurm auf GCP über mehrere Cluster hinweg. Wir skalieren auf eine Multi-Cluster- und Multi-Provider-Infrastruktur und evaluieren neue Hardware-Generationen, sobald sie online gehen. Sie besitzen den gesamten Stack, vom Clusterbetrieb und der Kostenoptimierung bis hin zur verteilten Trainingsleistung und der Tooling-Ebene, die dafür sorgt, dass Forscher schnell vorankommen. Sie arbeiten direkt mit dem Forschungsteam zusammen und verstehen gut genug, was es tut, um Infrastrukturentscheidungen zu treffen, die ihm tatsächlich helfen. Und das ist keine reine Support-Rolle. Wir betreiben eine offene Umgebung. Wenn Sie die nächste tabellarische SOTA-Architektur in petto haben, trainieren Sie sie.
Woran Sie arbeiten werden:
• Besitzen und entwickeln Sie eine Multi-Cluster-GPU-Infrastruktur. Nutzen Sie heute GCP, morgen Multi-Provider und neue Hardware. Architektur, Terminplanung, Zuverlässigkeit, Kostenoptimierung
• Steigern Sie die GPU-Nutzung und den Trainingsdurchsatz: Profilerstellung, Speicheroptimierung, Kommunikationsengpässe, Debugging von verteiltem Training auf Systemebene über große Läufe hinweg
• Entwerfen Sie die nächste Generation unserer Infrastruktur: Multi-Cluster-Orchestrierung, neue GPU-Generationen, Anbieterdiversifizierung, Kapazitätsplanung für wachsende Rechenanforderungen
• Bauen Sie die Ebene der Entwicklerproduktivität auf: CI-Pipelines, Experimentverfolgung, Modellregistrierung, Datenverarbeitung und interne Tools, die die Forschungsiterationsgeschwindigkeit hoch halten
• Besitzen Sie das Rechenbudget. Sie verstehen die Kosten pro FLOP über Anbieter und Hardware hinweg und hassen die Verschwendung von Rechenleistung
Tech-Stack: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Vielleicht passen Sie gut zu Ihnen, wenn Sie Folgendes haben:
• 3+ Jahre Aufbau und Betrieb einer Produktions-GPU-Infrastruktur oder verteilter Schulungssysteme im großen Maßstab. In einem großen KI-Labor, einem gut finanzierten ML-Startup oder einer HPC-Umgebung
• Umfangreiche praktische Erfahrung mit Slurm und Cluster-Management. Sie haben Planungsfehler behoben, die Auslastung für mehrmandantenfähige GPU-Workloads optimiert und eine Infrastruktur betrieben, bei der Ausfallzeiten echte Kosten verursachen
• Systemdenken auf Expertenebene: Speicherbandbreite, GPU-Profilierung. Sie denken über Hardware nach, nicht über Konfigurationen
• Starkes Python und echte Beherrschung der PyTorch-Interna. Genug, um ein Profil eines Trainingslaufs zu erstellen und festzustellen, ob der Engpass beim Laden von Daten, bei der Kommunikation oder bei der Berechnung liegt
• Erfolgsbilanz bei Infrastrukturentscheidungen, die den Schulungsdurchsatz oder die Kosteneffizienz messbar verbesserten
• Starke KI-Werkzeugkenntnisse. Sie verwenden Claude Code, Cursor oder ähnliches fließend, um sich schnell zu bewegen, ohne Abstriche bei der Qualität zu machen
Bonus:
• Erleben Sie den Betrieb mit GPU-Ausgaben im zweistelligen Millionenbereich
• Erfahrung mit Multi-Cloud- oder Hybrid-HPC/Cloud-Infrastruktur
• Triton-, CUDA- oder benutzerdefinierte Kernel-Erfahrung
• Erleben Sie die Skalierung von der Einzel-Cluster- zur Multi-Cluster-Orchestrierung
• Nachverfolgung von Experimenten im Hintergrund, Modellregistrierung oder ML-Pipeline-Tools
Leben bei Prior Labs
Sie arbeiten mit Forschern und Bauherren zusammen, die höchste Ansprüche an die Qualität ihrer Arbeit und die Art und Weise der Zusammenarbeit stellen. Wir handeln schnell und nehmen uns trotzdem die Zeit, die Dinge richtig zu machen.
Unsere Teams sind in Berlin, Freiburg und New York ansässig – wenn Sie an etwas so Schwierigem wie TabPFN arbeiten, ist es wichtig, im selben Raum zu sein. Aber tolle Leute kommen von überall, und in Ausnahmefällen sind wir offen für Remote-Arbeit, was in der Regel häufige Reisen zu einem unserer Büros bedeutet. Wo auch immer Sie ansässig sind, das gesamte Unternehmen trifft sich regelmäßig zu Offsites, um gemeinsam zu bauen und zu feiern.
Unsere Verpflichtungen
Die besten Produkte und Teams werden von Menschen mit den unterschiedlichsten Perspektiven und Hintergründen aufgebaut. Wir freuen uns über Bewerbungen aus allen Identitäten und Lebensbereichen – insbesondere, wenn Sie sich jemals entmutigt gefühlt haben, weil Sie „nicht jedes Kästchen ankreuzen“ – und bieten Ihnen Chancengleichheit, unabhängig von Geschlecht, sexueller Orientierung, Herkunft, Behinderung oder anderen Merkmalen, die Sie zu dem machen, was Sie sind.
Der Umgang mit Ihren Daten ist uns wichtig – siehe unsere Seite zum Datenschutz bei der Personalbeschaffung
Weitere englischsprachige Jobs in Deutschland finden Sie auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Prior Labs
Standort
Berlin, Deutschland
Inserat bereitgestellt von Prior Labs.