Praca
Z kanału partnera
Inżynier ML, Infrastruktura
Cena na życzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Nie
- Firma
- Prior Labs
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
Kim jesteśmy
Modele podstawowe zmieniły tekst i obrazy. Dane strukturalne – największy i najbardziej znaczący format danych na świecie – pozostały niezmienione aż do teraz. To, co LLM zrobiły dla języka, my robimy dla stołów.
Jesteśmy pionierami tabelarycznych modeli podstawowych: TabPFN v2 był historią z okładki Nature, pobrano ponad 3,5 miliona plików i ponad 7500 gwiazdek na GitHubie, a także działa w środowisku produkcyjnym, począwszy od wykrywania chorób płuc za pomocą Oxford Cancer Analytics po zapobieganie awariom pociągów dzięki Hitachi. Najtrudniejsze problemy – miliony wierszy, wnioskowanie w czasie rzeczywistym, zupełnie nowe modalności – są nadal otwarte i nikt inny nie pracuje nad nimi na tym poziomie.
Jesteśmy małym, wysoce selektywnym zespołem składającym się z ponad 40 osób, mającym doświadczenie w Google, DeepMind, Meta, Apple, Amazon, Jane Street i CERN, kierowanym przez Franka Huttera, Noaha Hollmanna i Sauraja Gambhira, któremu doradzają Bernhard Schölkopf i zdobywca nagrody Turinga Yann LeCun.
W lipcu 2026 r., niecałe 18 miesięcy po przedsprzedaży o wartości 9 mln euro, dołączyliśmy do SAP jako niezależne, pionierskie laboratorium sztucznej inteligencji – ten sam zespół, misja i modele według wagi otwartej, obecnie wspierane kwotą ponad 1 miliarda euro w ciągu czterech lat.
O roli
Wydajemy dziesiątki milionów rocznie na obliczenia GPU w celu uczenia podstawowych modeli tabelarycznych. To nie jest cel, tym się dzisiaj zajmujemy i to rośnie. Osoba będąca właścicielem tej infrastruktury podejmuje decyzje warte miliony dolarów: architektura klastra, efektywność planowania, strategia dostawcy, wybór sprzętu. Błędne połączenie kosztuje sześć cyfr.
Dzisiaj uruchamiamy Slum na GCP w wielu klastrach. Skalujemy się do infrastruktury obejmującej wiele klastrów i wielu dostawców oraz oceniamy nowe generacje sprzętu, gdy tylko zostaną udostępnione online. Jesteś właścicielem całego stosu, od operacji klastrów i optymalizacji kosztów po wydajność rozproszonego szkolenia i warstwę narzędzi, która pozwala badaczom szybko działać. Współpracujesz bezpośrednio z zespołem badawczym i rozumiesz, co robią, na tyle dobrze, że podejmujesz decyzje dotyczące infrastruktury, które faktycznie im pomagają. I nie jest to rola czysto wspierająca. Działamy w otwartym środowisku. Jeśli masz w zanadrzu następną architekturę tabelaryczną SOTA, śmiało ją przeszkol.
Nad czym będziesz pracować:
• Posiadaj i rozwijaj wieloklastrową infrastrukturę GPU. Dzisiaj Slum na GCP, jutro wielu dostawców i nowy sprzęt. Architektura, harmonogramowanie, niezawodność, optymalizacja kosztów
• Zwiększ wykorzystanie procesora graficznego i przepustowość szkolenia: profilowanie, optymalizacja pamięci, wąskie gardła w komunikacji, debugowanie na poziomie systemu rozproszonego szkolenia w dużych seriach
• Zaprojektuj następną generację naszej infrastruktury: orkiestracja wielu klastrów, nowe generacje procesorów graficznych, dywersyfikacja dostawców, planowanie wydajności pod kątem rosnących wymagań obliczeniowych
• Zbuduj warstwę produktywności programistów: potoki CI, śledzenie eksperymentów, rejestr modeli, przetwarzanie danych i narzędzia wewnętrzne, które utrzymują wysoką prędkość iteracji badań
• Posiadaj budżet obliczeniowy. Rozumiesz koszt FLOP u różnych dostawców i sprzętu, i nienawidzisz marnowania mocy obliczeniowej
Stos technologiczny: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Możesz być dobrym kandydatem, jeśli masz:
• Ponad 3 lata tworzenia i obsługi produkcyjnej infrastruktury GPU lub rozproszonych systemów szkoleniowych na dużą skalę. W dużym laboratorium AI, dobrze finansowanym startupie ML lub w środowisku HPC
• Głębokie, praktyczne doświadczenie w zarządzaniu slumsami i klastrami. Naprawiłeś błędy w harmonogramie, zoptymalizowałeś wykorzystanie obciążeń GPU obsługujących wielu dzierżawców i obsługiwałeś infrastrukturę, w której przestoje mają realne koszty
• Myślenie systemowe na poziomie eksperckim: przepustowość pamięci, profilowanie GPU. Mówisz o sprzęcie, a nie o konfiguracji
• Silny język Python i prawdziwa płynność dzięki funkcjom wewnętrznym PyTorch. Wystarczające, aby sprofilować przebieg szkolenia i stwierdzić, czy wąskim gardłem jest ładowanie danych, komunikacja czy obliczenia
• Historia podejmowania decyzji dotyczących infrastruktury, które wymiernie poprawiły wydajność szkoleń lub efektywność kosztową
• Silne umiejętności w zakresie narzędzi AI. Płynnie używasz kodu Claude'a, kursora lub podobnego rozwiązania, aby poruszać się szybko bez utraty jakości
Bonus:
• Doświadczenie w pracy przy wydatkach na procesory graficzne rzędu dziesiątek milionów
• Możliwość pracy w wielu chmurach lub w hybrydowej infrastrukturze HPC/chmurze
• Triton, CUDA lub niestandardowe doświadczenie jądra
• Możliwość skalowania od pojedynczego klastra do orkiestracji wieloklastrowej
• Śledzenie eksperymentów w tle, rejestr modeli lub narzędzia potoku uczenia maszynowego
Życie w wcześniejszych laboratoriach
Będziesz pracować z badaczami i konstruktorami, którzy stawiają sobie poprzeczkę bardzo wysoko – jeśli chodzi o jakość swojej pracy i sposób, w jaki ze sobą współpracują. Działamy szybko i wciąż poświęcamy czas na zrobienie wszystkiego dobrze.
Nasze zespoły mieszczą się w Berlinie, Fryburgu i Nowym Jorku – kiedy pracujesz nad czymś tak trudnym jak TabPFN, przebywanie w tym samym pomieszczeniu ma znaczenie. Ale wspaniali ludzie przyjeżdżają zewsząd, a w wyjątkowych przypadkach jesteśmy otwarci na współpracę zdalną, co zwykle oznacza częste dojazdy do jednego z naszych biur. Bez względu na to, gdzie się znajdujesz, cała firma regularnie spotyka się poza siedzibą firmy, aby wspólnie budować i świętować.
Nasze zobowiązania
Najlepsze produkty i zespoły tworzą ludzie o różnych perspektywach i różnych doświadczeniach. Przyjmujemy zgłoszenia od osób o różnej tożsamości i o różnej drodze życia – zwłaszcza jeśli kiedykolwiek poczułeś się zniechęcony „nie zaznaczaniem każdego pola” – i zapewniamy równe szanse bez względu na płeć, orientację seksualną, pochodzenie, niepełnosprawność lub jakąkolwiek inną cechę, która decyduje o tym, kim jesteś.
Dbamy o to, jak obchodzimy się z Twoimi danymi – zobacz naszą stronę dotyczącą prywatności danych rekrutacyjnych
Znajdź więcej anglojęzycznych ofert pracy w Niemczech na Arbeitnow
Źródło: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
Modele podstawowe zmieniły tekst i obrazy. Dane strukturalne – największy i najbardziej znaczący format danych na świecie – pozostały niezmienione aż do teraz. To, co LLM zrobiły dla języka, my robimy dla stołów.
Jesteśmy pionierami tabelarycznych modeli podstawowych: TabPFN v2 był historią z okładki Nature, pobrano ponad 3,5 miliona plików i ponad 7500 gwiazdek na GitHubie, a także działa w środowisku produkcyjnym, począwszy od wykrywania chorób płuc za pomocą Oxford Cancer Analytics po zapobieganie awariom pociągów dzięki Hitachi. Najtrudniejsze problemy – miliony wierszy, wnioskowanie w czasie rzeczywistym, zupełnie nowe modalności – są nadal otwarte i nikt inny nie pracuje nad nimi na tym poziomie.
Jesteśmy małym, wysoce selektywnym zespołem składającym się z ponad 40 osób, mającym doświadczenie w Google, DeepMind, Meta, Apple, Amazon, Jane Street i CERN, kierowanym przez Franka Huttera, Noaha Hollmanna i Sauraja Gambhira, któremu doradzają Bernhard Schölkopf i zdobywca nagrody Turinga Yann LeCun.
W lipcu 2026 r., niecałe 18 miesięcy po przedsprzedaży o wartości 9 mln euro, dołączyliśmy do SAP jako niezależne, pionierskie laboratorium sztucznej inteligencji – ten sam zespół, misja i modele według wagi otwartej, obecnie wspierane kwotą ponad 1 miliarda euro w ciągu czterech lat.
O roli
Wydajemy dziesiątki milionów rocznie na obliczenia GPU w celu uczenia podstawowych modeli tabelarycznych. To nie jest cel, tym się dzisiaj zajmujemy i to rośnie. Osoba będąca właścicielem tej infrastruktury podejmuje decyzje warte miliony dolarów: architektura klastra, efektywność planowania, strategia dostawcy, wybór sprzętu. Błędne połączenie kosztuje sześć cyfr.
Dzisiaj uruchamiamy Slum na GCP w wielu klastrach. Skalujemy się do infrastruktury obejmującej wiele klastrów i wielu dostawców oraz oceniamy nowe generacje sprzętu, gdy tylko zostaną udostępnione online. Jesteś właścicielem całego stosu, od operacji klastrów i optymalizacji kosztów po wydajność rozproszonego szkolenia i warstwę narzędzi, która pozwala badaczom szybko działać. Współpracujesz bezpośrednio z zespołem badawczym i rozumiesz, co robią, na tyle dobrze, że podejmujesz decyzje dotyczące infrastruktury, które faktycznie im pomagają. I nie jest to rola czysto wspierająca. Działamy w otwartym środowisku. Jeśli masz w zanadrzu następną architekturę tabelaryczną SOTA, śmiało ją przeszkol.
Nad czym będziesz pracować:
• Posiadaj i rozwijaj wieloklastrową infrastrukturę GPU. Dzisiaj Slum na GCP, jutro wielu dostawców i nowy sprzęt. Architektura, harmonogramowanie, niezawodność, optymalizacja kosztów
• Zwiększ wykorzystanie procesora graficznego i przepustowość szkolenia: profilowanie, optymalizacja pamięci, wąskie gardła w komunikacji, debugowanie na poziomie systemu rozproszonego szkolenia w dużych seriach
• Zaprojektuj następną generację naszej infrastruktury: orkiestracja wielu klastrów, nowe generacje procesorów graficznych, dywersyfikacja dostawców, planowanie wydajności pod kątem rosnących wymagań obliczeniowych
• Zbuduj warstwę produktywności programistów: potoki CI, śledzenie eksperymentów, rejestr modeli, przetwarzanie danych i narzędzia wewnętrzne, które utrzymują wysoką prędkość iteracji badań
• Posiadaj budżet obliczeniowy. Rozumiesz koszt FLOP u różnych dostawców i sprzętu, i nienawidzisz marnowania mocy obliczeniowej
Stos technologiczny: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Możesz być dobrym kandydatem, jeśli masz:
• Ponad 3 lata tworzenia i obsługi produkcyjnej infrastruktury GPU lub rozproszonych systemów szkoleniowych na dużą skalę. W dużym laboratorium AI, dobrze finansowanym startupie ML lub w środowisku HPC
• Głębokie, praktyczne doświadczenie w zarządzaniu slumsami i klastrami. Naprawiłeś błędy w harmonogramie, zoptymalizowałeś wykorzystanie obciążeń GPU obsługujących wielu dzierżawców i obsługiwałeś infrastrukturę, w której przestoje mają realne koszty
• Myślenie systemowe na poziomie eksperckim: przepustowość pamięci, profilowanie GPU. Mówisz o sprzęcie, a nie o konfiguracji
• Silny język Python i prawdziwa płynność dzięki funkcjom wewnętrznym PyTorch. Wystarczające, aby sprofilować przebieg szkolenia i stwierdzić, czy wąskim gardłem jest ładowanie danych, komunikacja czy obliczenia
• Historia podejmowania decyzji dotyczących infrastruktury, które wymiernie poprawiły wydajność szkoleń lub efektywność kosztową
• Silne umiejętności w zakresie narzędzi AI. Płynnie używasz kodu Claude'a, kursora lub podobnego rozwiązania, aby poruszać się szybko bez utraty jakości
Bonus:
• Doświadczenie w pracy przy wydatkach na procesory graficzne rzędu dziesiątek milionów
• Możliwość pracy w wielu chmurach lub w hybrydowej infrastrukturze HPC/chmurze
• Triton, CUDA lub niestandardowe doświadczenie jądra
• Możliwość skalowania od pojedynczego klastra do orkiestracji wieloklastrowej
• Śledzenie eksperymentów w tle, rejestr modeli lub narzędzia potoku uczenia maszynowego
Życie w wcześniejszych laboratoriach
Będziesz pracować z badaczami i konstruktorami, którzy stawiają sobie poprzeczkę bardzo wysoko – jeśli chodzi o jakość swojej pracy i sposób, w jaki ze sobą współpracują. Działamy szybko i wciąż poświęcamy czas na zrobienie wszystkiego dobrze.
Nasze zespoły mieszczą się w Berlinie, Fryburgu i Nowym Jorku – kiedy pracujesz nad czymś tak trudnym jak TabPFN, przebywanie w tym samym pomieszczeniu ma znaczenie. Ale wspaniali ludzie przyjeżdżają zewsząd, a w wyjątkowych przypadkach jesteśmy otwarci na współpracę zdalną, co zwykle oznacza częste dojazdy do jednego z naszych biur. Bez względu na to, gdzie się znajdujesz, cała firma regularnie spotyka się poza siedzibą firmy, aby wspólnie budować i świętować.
Nasze zobowiązania
Najlepsze produkty i zespoły tworzą ludzie o różnych perspektywach i różnych doświadczeniach. Przyjmujemy zgłoszenia od osób o różnej tożsamości i o różnej drodze życia – zwłaszcza jeśli kiedykolwiek poczułeś się zniechęcony „nie zaznaczaniem każdego pola” – i zapewniamy równe szanse bez względu na płeć, orientację seksualną, pochodzenie, niepełnosprawność lub jakąkolwiek inną cechę, która decyduje o tym, kim jesteś.
Dbamy o to, jak obchodzimy się z Twoimi danymi – zobacz naszą stronę dotyczącą prywatności danych rekrutacyjnych
Znajdź więcej anglojęzycznych ofert pracy w Niemczech na Arbeitnow
Źródło: Arbeitnow (https://www.arbeitnow.com/jobs/companies/prior-labs/ml-engineer-infrastructure-berlin-413317)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Prior Labs
Lokalizacja
Berlin, Niemcy
Ogłoszenie pochodzi od Prior Labs.