Praca
Z kanału partnera
Inżynier wnioskowania wdrożonego do przodu
Cena na życzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Nie
- Firma
- Tensordyne
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
O Tensordyne
Tensordyne buduje nową klasę systemu wnioskowania AI, zaprojektowanego z myślą o wysokowydajnym i energooszczędnym wdrażaniu najbardziej wymagających na świecie obciążeń generatywnych AI.
Nasza platforma łączy specjalnie zaprojektowany układ krzemowy, nową matematykę sztucznej inteligencji, zoptymalizowane sieci o zwiększonej skali i architekturę pamięci w ściśle zintegrowany system stworzony z myślą o wnioskowaniu AI na dużą skalę. Współpracujemy z hiperskalerami, Neocloudami, twórcami modeli pionierskich, przedsiębiorstwami i partnerami infrastrukturalnymi działającymi w czołówce AI.
W miarę jak Tensordyne przechodzi od rozwoju systemu do dostarczania krzemu, sprawdzania poprawności u klientów, wdrażania wersji beta i wdrażania produkcyjnego, budujemy techniczną organizację klienta, która będzie pośredniczyć bezpośrednio między naszymi zespołami inżynieryjnymi a firmami wdrażającymi platformę.
Podsumowanie roli
Poszukujemy inżyniera ds. wnioskowania w przód, który łączy głęboką wiedzę specjalistyczną w zakresie systemów AI z silnymi instynktami klienta. Osoba ta będzie właścicielem ścieżki od obciążenia pracą klienta lub żądania modelu do wyniku technicznego oraz, w razie potrzeby, do zoptymalizowanego modelu działającego pomyślnie na sprzęcie i oprogramowaniu Tensordyne.
Rola ta wiąże się z architekturą modelu, wydajnością wnioskowania, optymalizacją systemów, narzędziami programistycznymi i wdrażaniem u klientów. Będziesz pracować bezpośrednio z inżynierią, pełniąc jednocześnie rolę technicznego pomostu do produktu, BizDev, sprzedaży i klientów.
Co zrobisz
• Zamień obciążenia klientów w szybkie i wiarygodne odpowiedzi dotyczące wydajności poprzez profilowanie i testy porównawcze. Zdefiniuj odpowiednie KPI, porównaj z konkurencyjnymi punktami odniesienia i utrzymuj aktualność naszej metodologii oceny w oparciu o zewnętrzne standardy.
• Włączanie i optymalizacja modeli: konwertowanie i wyświetlanie modeli klientów na stosie Tensordyne, sprawdzanie jakości numerycznej, identyfikowanie wąskich gardeł wydajności oraz współpraca z zespołami zajmującymi się kompilatorem, środowiskiem wykonawczym, jądrem i systemem w celu poprawy wyników.
• Inżynieria wdrożeniowa/przyszła: współpracuj bezpośrednio z klientami i partnerami w zakresie technicznych PoC, integracji, wdrażania i debugowania; przełożyć wymagania na mierzalne kryteria akceptacji dotyczące jakości, opóźnień, przepustowości i innych istotnych wskaźników KPI.
• Śledź dokładność profilowania do sprzętu, stale porównując wyniki profilowania/symulacji z rzeczywistymi wdrożeniami sprzętu, wyjaśniaj istotne luki i sygnalizuj brakujące możliwości w kompilatorze, zestawie SDK, serwerze wnioskowania, zarządzaniu pamięcią podręczną KV lub systemach sąsiadujących z zespołami będącymi właścicielami.
• Zamień powtarzane doświadczenia specyficzne dla klienta w narzędzia, dokumentację, testy porównawcze lub ulepszenia produktu, które można ponownie wykorzystać.
Podstawowe kwalifikacje
• Duże, praktyczne doświadczenie z modelami AI i systemami wnioskowania, szczególnie gęstymi i MoE LLM (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM) oraz VLM, modelami mowy i dyfuzji.
• Silne umiejętności Pythona i PyTorcha oraz umiejętność zrozumienia i modyfikowania kodu modelu.
• Doświadczenie w profilowaniu, testowaniu porównawczym lub optymalizacji wnioskowania o modelu i wnioskowania na temat opóźnień, przepustowości, pamięci i wykorzystania.
• Silne umiejętności rozwiązywania problemów i komunikacji, ze zdolnością do rozwiązywania niejednoznacznych problemów technicznych ponad granicami zespołu.
• Biegłość w korzystaniu z narzędzi programistycznych opartych na sztucznej inteligencji (np. Claude Code, Cursor).
Mocne plusy
• Doświadczenie w obsłudze i wdrażaniu stosów LLM, takich jak vLLM, SGLang lub podobne systemy.
• Doświadczenie w bezpośredniej pracy z klientami lub zewnętrznymi partnerami technicznymi.
• Doświadczenie w tworzeniu modeli na nowych akceleratorach lub niestandardowym sprzęcie, w tym debugowanie wydajności w granicach frameworku/środowiska wykonawczego/sprzętu.
• Praktyczne doświadczenie z technikami lub środowiskami wnioskowania produkcyjnego, takimi jak kwantyzacja, wnioskowanie rozproszone lub Kubernetes.
• Doświadczenie w nawigacji i współtworzeniu baz kodu Rust.
Wartości Tensordyne
• Myśl odważnie. Realizuj ambitne cele techniczne i biznesowe.
• Dąż do doskonałości. Jakość ma znaczenie we wszystkim, co tworzymy i dostarczamy.
• Posiadaj to i zrób to. Weź odpowiedzialność i osiągaj wyniki.
• Działaj uczciwie. Bądź bezpośredni, przejrzysty i pełen szacunku.
• Wygraj jako zespół. Spraw, aby ludzie wokół ciebie byli bardziej efektywni.
• Doceniaj różne perspektywy. Najsilniejsze zespoły kwestionują założenia i wnoszą różnorodne doświadczenia do trudnych problemów.
Tensordyne jest pracodawcą zapewniającym równe szanse. Wierzymy, że zróżnicowane zespoły są lepiej przygotowane do rozwiązywania złożonych problemów i tworzenia wyjątkowych technologii. Wszyscy wykwalifikowani kandydaci otrzymają wynagrodzenie za zatrudnienie bez względu na wiek, kolor skóry, tożsamość lub ekspresję płciową, stan cywilny, pochodzenie narodowe, niepełnosprawność, chroniony status weterana, rasę, religię, ciążę, orientację seksualną lub jakąkolwiek inną cechę chronioną przez obowiązujące przepisy, regulacje i rozporządzenia.
Uwaga dla agencji rekrutacyjnych: Prosimy nie kontaktować się z pracownikami ani liderami Tensordyne w sprawie tej roli. Nie przyjmujemy niezamówionych życiorysów agencji i nie ponosimy odpowiedzialności za opłaty związane z niezamówionymi zgłoszeniami.
Znajdź więcej anglojęzycznych ofert pracy w Niemczech na Arbeitnow
Źródło: Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-481912)
Tensordyne buduje nową klasę systemu wnioskowania AI, zaprojektowanego z myślą o wysokowydajnym i energooszczędnym wdrażaniu najbardziej wymagających na świecie obciążeń generatywnych AI.
Nasza platforma łączy specjalnie zaprojektowany układ krzemowy, nową matematykę sztucznej inteligencji, zoptymalizowane sieci o zwiększonej skali i architekturę pamięci w ściśle zintegrowany system stworzony z myślą o wnioskowaniu AI na dużą skalę. Współpracujemy z hiperskalerami, Neocloudami, twórcami modeli pionierskich, przedsiębiorstwami i partnerami infrastrukturalnymi działającymi w czołówce AI.
W miarę jak Tensordyne przechodzi od rozwoju systemu do dostarczania krzemu, sprawdzania poprawności u klientów, wdrażania wersji beta i wdrażania produkcyjnego, budujemy techniczną organizację klienta, która będzie pośredniczyć bezpośrednio między naszymi zespołami inżynieryjnymi a firmami wdrażającymi platformę.
Podsumowanie roli
Poszukujemy inżyniera ds. wnioskowania w przód, który łączy głęboką wiedzę specjalistyczną w zakresie systemów AI z silnymi instynktami klienta. Osoba ta będzie właścicielem ścieżki od obciążenia pracą klienta lub żądania modelu do wyniku technicznego oraz, w razie potrzeby, do zoptymalizowanego modelu działającego pomyślnie na sprzęcie i oprogramowaniu Tensordyne.
Rola ta wiąże się z architekturą modelu, wydajnością wnioskowania, optymalizacją systemów, narzędziami programistycznymi i wdrażaniem u klientów. Będziesz pracować bezpośrednio z inżynierią, pełniąc jednocześnie rolę technicznego pomostu do produktu, BizDev, sprzedaży i klientów.
Co zrobisz
• Zamień obciążenia klientów w szybkie i wiarygodne odpowiedzi dotyczące wydajności poprzez profilowanie i testy porównawcze. Zdefiniuj odpowiednie KPI, porównaj z konkurencyjnymi punktami odniesienia i utrzymuj aktualność naszej metodologii oceny w oparciu o zewnętrzne standardy.
• Włączanie i optymalizacja modeli: konwertowanie i wyświetlanie modeli klientów na stosie Tensordyne, sprawdzanie jakości numerycznej, identyfikowanie wąskich gardeł wydajności oraz współpraca z zespołami zajmującymi się kompilatorem, środowiskiem wykonawczym, jądrem i systemem w celu poprawy wyników.
• Inżynieria wdrożeniowa/przyszła: współpracuj bezpośrednio z klientami i partnerami w zakresie technicznych PoC, integracji, wdrażania i debugowania; przełożyć wymagania na mierzalne kryteria akceptacji dotyczące jakości, opóźnień, przepustowości i innych istotnych wskaźników KPI.
• Śledź dokładność profilowania do sprzętu, stale porównując wyniki profilowania/symulacji z rzeczywistymi wdrożeniami sprzętu, wyjaśniaj istotne luki i sygnalizuj brakujące możliwości w kompilatorze, zestawie SDK, serwerze wnioskowania, zarządzaniu pamięcią podręczną KV lub systemach sąsiadujących z zespołami będącymi właścicielami.
• Zamień powtarzane doświadczenia specyficzne dla klienta w narzędzia, dokumentację, testy porównawcze lub ulepszenia produktu, które można ponownie wykorzystać.
Podstawowe kwalifikacje
• Duże, praktyczne doświadczenie z modelami AI i systemami wnioskowania, szczególnie gęstymi i MoE LLM (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM) oraz VLM, modelami mowy i dyfuzji.
• Silne umiejętności Pythona i PyTorcha oraz umiejętność zrozumienia i modyfikowania kodu modelu.
• Doświadczenie w profilowaniu, testowaniu porównawczym lub optymalizacji wnioskowania o modelu i wnioskowania na temat opóźnień, przepustowości, pamięci i wykorzystania.
• Silne umiejętności rozwiązywania problemów i komunikacji, ze zdolnością do rozwiązywania niejednoznacznych problemów technicznych ponad granicami zespołu.
• Biegłość w korzystaniu z narzędzi programistycznych opartych na sztucznej inteligencji (np. Claude Code, Cursor).
Mocne plusy
• Doświadczenie w obsłudze i wdrażaniu stosów LLM, takich jak vLLM, SGLang lub podobne systemy.
• Doświadczenie w bezpośredniej pracy z klientami lub zewnętrznymi partnerami technicznymi.
• Doświadczenie w tworzeniu modeli na nowych akceleratorach lub niestandardowym sprzęcie, w tym debugowanie wydajności w granicach frameworku/środowiska wykonawczego/sprzętu.
• Praktyczne doświadczenie z technikami lub środowiskami wnioskowania produkcyjnego, takimi jak kwantyzacja, wnioskowanie rozproszone lub Kubernetes.
• Doświadczenie w nawigacji i współtworzeniu baz kodu Rust.
Wartości Tensordyne
• Myśl odważnie. Realizuj ambitne cele techniczne i biznesowe.
• Dąż do doskonałości. Jakość ma znaczenie we wszystkim, co tworzymy i dostarczamy.
• Posiadaj to i zrób to. Weź odpowiedzialność i osiągaj wyniki.
• Działaj uczciwie. Bądź bezpośredni, przejrzysty i pełen szacunku.
• Wygraj jako zespół. Spraw, aby ludzie wokół ciebie byli bardziej efektywni.
• Doceniaj różne perspektywy. Najsilniejsze zespoły kwestionują założenia i wnoszą różnorodne doświadczenia do trudnych problemów.
Tensordyne jest pracodawcą zapewniającym równe szanse. Wierzymy, że zróżnicowane zespoły są lepiej przygotowane do rozwiązywania złożonych problemów i tworzenia wyjątkowych technologii. Wszyscy wykwalifikowani kandydaci otrzymają wynagrodzenie za zatrudnienie bez względu na wiek, kolor skóry, tożsamość lub ekspresję płciową, stan cywilny, pochodzenie narodowe, niepełnosprawność, chroniony status weterana, rasę, religię, ciążę, orientację seksualną lub jakąkolwiek inną cechę chronioną przez obowiązujące przepisy, regulacje i rozporządzenia.
Uwaga dla agencji rekrutacyjnych: Prosimy nie kontaktować się z pracownikami ani liderami Tensordyne w sprawie tej roli. Nie przyjmujemy niezamówionych życiorysów agencji i nie ponosimy odpowiedzialności za opłaty związane z niezamówionymi zgłoszeniami.
Znajdź więcej anglojęzycznych ofert pracy w Niemczech na Arbeitnow
Źródło: Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-481912)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Tensordyne
Lokalizacja
Monachium, Niemcy
Ogłoszenie pochodzi od Tensordyne.