Praca
Z kanału partnera
Inżynier ds. badań AI (optymalizacja jądra i wnioskowania)
Cena na życzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Nie
- Firma
- Jobgether
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
Stanowisko to wystawiane jest w imieniu firmy partnerskiej, która zarządza wszystkimi aplikacjami i kolejnymi krokami. Nasz partner poszukuje inżyniera ds. badań AI (optymalizacja jądra i wnioskowania) z siedzibą w Wielkiej Brytanii.
Będziesz pracować na skrzyżowaniu badań nad sztuczną inteligencją, inżynierii systemów i wnioskowania o modelach o wysokiej wydajności.
Skupisz się na opracowywaniu i optymalizacji architektur obsługujących modele dla zaawansowanych systemów AI w różnych środowiskach sprzętowych.
Będziesz stawić czoła wyzwaniom związanym z opóźnieniami, przepustowością, wydajnością pamięci i skalowalnością, w tym wdrażaniem na urządzeniach mobilnych i brzegowych o ograniczonych zasobach.
Stanowisko łączy praktyczne badania z inżynierią niskiego poziomu, dając możliwość opracowania nowatorskich strategii wnioskowania i jąder GPU.
Będziesz pracować ze złożonymi architekturami obejmującymi tekst, obraz, dźwięk, modele dyfuzji i transformatory wizyjne.
Twoja praca będzie obejmować rygorystyczne testy porównawcze, testy produkcyjne i optymalizację iteracyjną, aby przełożyć badania na wymierną poprawę wydajności.
Będziesz współpracować z zespołami wielofunkcyjnymi w wysoce technicznym, zdalnym środowisku, którego celem jest przesuwanie granic wydajnych systemów sztucznej inteligencji.
Odpowiedzialność
• Projektuj i wdrażaj zaawansowane architektury obsługujące modele, zoptymalizowane pod kątem wysokiej przepustowości, małych opóźnień i wydajnego wykorzystania pamięci.
• Opracuj potoki wnioskowania zdolne do skutecznego działania w różnorodnych środowiskach, w tym na urządzeniach mobilnych o ograniczonych zasobach i platformach brzegowych.
• Ustal jasne cele w zakresie wydajności obejmujące opóźnienia odpowiedzi, szybkość generowania tokenów, przepustowość, wykorzystanie pamięci i niezawodność.
• Twórz i wykonuj testy porównawcze kontrolowanego wnioskowania w środowiskach symulacyjnych i produkcyjnych, śledząc opóźnienia, przepustowość, zużycie pamięci i poziomy błędów.
• Tworzenie i utrzymywanie reprezentatywnych zbiorów danych i scenariuszy symulacyjnych w celu oceny wydajności modelu w warunkach rzeczywistych i przy ograniczonych zasobach.
• Identyfikuj wąskie gardła obliczeniowe i pamięciowe w potokach wnioskowania i wdrażaj rozwiązania obejmujące przetwarzanie wsadowe, tworzenie sieci, zarządzanie pamięcią i inne optymalizacje na poziomie systemu.
• Twórz niestandardowe jądra GPU i shadery obliczeniowe dla sprzętu mobilnego, w tym rozwiązania napisane w języku Metal Shading Language (MSL).
• Stosowanie zaawansowanych technik optymalizacji wnioskowania, takich jak oczyszczanie, kwantyzacja, Flash Attention, buforowanie KV i dekodowanie spekulatywne.
• Projektuj i optymalizuj rozproszone systemy wnioskowania, stosując podejścia takie jak równoległość tensorów, równoległość potoków i równoległość ekspercka dla dużych obciążeń GPU.
• Współpraca z interdyscyplinarnymi zespołami inżynieryjnymi i badawczymi w celu integracji zoptymalizowanych struktur wnioskowania z aplikacjami produkcyjnymi i urządzeniami brzegowymi.
• Definiowanie metodologii oceny, dokumentowanie wyników eksperymentów, porównywanie wydajności z ustalonymi wzorcami i ciągłe udoskonalanie strategii optymalizacji.
• Monitoruj wydajność produkcji i korzystaj z badań empirycznych, aby zidentyfikować możliwości dalszej poprawy skalowalności, wydajności i niezawodności.
Wymagania:
• Wykształcenie z informatyki lub pokrewnej dziedziny technicznej; doktorat z NLP, uczenia maszynowego lub dyscypliny pokrewnej jest bardzo istotny, szczególnie w przypadku dużego doświadczenia w badaniach nad sztuczną inteligencją i publikacjami na wiodących konferencjach.
• Sprawdzona wiedza na temat języka Metal Shading Language (MSL), w tym umiejętność pisania od podstaw niestandardowych shaderów obliczeniowych.
• Udokumentowane doświadczenie w optymalizacji jądra niskiego poziomu i optymalizacji wnioskowania na urządzeniach mobilnych lub innych urządzeniach o ograniczonych zasobach.
• Historia dostarczania mierzalnych ulepszeń w zakresie opóźnień wnioskowania, przepustowości i zużycia pamięci dla aplikacji specyficznych dla domeny.
• Głębokie zrozumienie nowoczesnych architektur obsługujących modele, silników wnioskowania i technik optymalizacji w celu wdrożenia wysokowydajnej sztucznej inteligencji.
• Duże doświadczenie w pisaniu jąder GPU dla urządzeń mobilnych, takich jak smartfony.
• Praktyczne doświadczenie w opracowywaniu i wdrażaniu kompleksowych potoków wnioskowania, od optymalizacji modelu po integrację produkcyjną na ograniczonym sprzęcie.
• Silna umiejętność stosowania badań empirycznych i systematycznych eksperymentów w celu rozwiązania problemów związanych z opóźnieniami, obliczeniami i pamięcią.
• Doświadczenie w projektowaniu solidnych ram oceny i benchmarkingu dla systemów wnioskowania.
• Znajomość technik wnioskowania rozproszonego, w tym równoległości tensorów, równoległości potoków i równoległości eksperckiej dla klastrów GPU na dużą skalę.
• Głębokie zrozumienie podstaw matematycznych i architektury modeli dyfuzyjnych i transformatorów wizyjnych.
• Znajomość nowoczesnych technik optymalizacji wnioskowania, w tym przycinania, kwantyzacji, Flash Attention, optymalizacji KV Cache i dekodowania spekulatywnego, takiego jak EAGLE.
• Silne zdolności analityczne i rozwiązywania problemów, ze zdolnością do badania wąskich gardeł złożonych systemów i przekształcania wyników badań w praktyczne rozwiązania inżynieryjne.
• Doskonałe umiejętności komunikacyjne w języku angielskim i umiejętność skutecznej współpracy z rozproszonymi, interdyscyplinarnymi zespołami technicznymi.
Korzyści:
• Możliwość pracy nad zaawansowanymi systemami AI obejmującymi obsługę modeli, optymalizację wnioskowania, przetwarzanie mobilne, wdrażanie brzegowe i wnioskowanie rozproszone na dużą skalę.
• Zdalne środowisko pracy w międzynarodowym zespole.
• Ekspozycja na najnowocześniejsze badania nad sztuczną inteligencją i praktyczne wyzwania związane z inżynierią systemów.
• Możliwość wniesienia wkładu w infrastrukturę o krytycznym znaczeniu dla wydajności, w której ulepszenia mogą mieć wymierny wpływ na rzeczywiste aplikacje AI.
• Środowisko współpracy łączące eksperymenty oparte na badaniach z praktyczną inżynierią.
• Możliwość pracy z zaawansowanymi architekturami modeli, w tym modelami dyfuzyjnymi, transformatorami wizyjnymi i systemami multimodalnymi.…
Źródło: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-uk-187924)
Będziesz pracować na skrzyżowaniu badań nad sztuczną inteligencją, inżynierii systemów i wnioskowania o modelach o wysokiej wydajności.
Skupisz się na opracowywaniu i optymalizacji architektur obsługujących modele dla zaawansowanych systemów AI w różnych środowiskach sprzętowych.
Będziesz stawić czoła wyzwaniom związanym z opóźnieniami, przepustowością, wydajnością pamięci i skalowalnością, w tym wdrażaniem na urządzeniach mobilnych i brzegowych o ograniczonych zasobach.
Stanowisko łączy praktyczne badania z inżynierią niskiego poziomu, dając możliwość opracowania nowatorskich strategii wnioskowania i jąder GPU.
Będziesz pracować ze złożonymi architekturami obejmującymi tekst, obraz, dźwięk, modele dyfuzji i transformatory wizyjne.
Twoja praca będzie obejmować rygorystyczne testy porównawcze, testy produkcyjne i optymalizację iteracyjną, aby przełożyć badania na wymierną poprawę wydajności.
Będziesz współpracować z zespołami wielofunkcyjnymi w wysoce technicznym, zdalnym środowisku, którego celem jest przesuwanie granic wydajnych systemów sztucznej inteligencji.
Odpowiedzialność
• Projektuj i wdrażaj zaawansowane architektury obsługujące modele, zoptymalizowane pod kątem wysokiej przepustowości, małych opóźnień i wydajnego wykorzystania pamięci.
• Opracuj potoki wnioskowania zdolne do skutecznego działania w różnorodnych środowiskach, w tym na urządzeniach mobilnych o ograniczonych zasobach i platformach brzegowych.
• Ustal jasne cele w zakresie wydajności obejmujące opóźnienia odpowiedzi, szybkość generowania tokenów, przepustowość, wykorzystanie pamięci i niezawodność.
• Twórz i wykonuj testy porównawcze kontrolowanego wnioskowania w środowiskach symulacyjnych i produkcyjnych, śledząc opóźnienia, przepustowość, zużycie pamięci i poziomy błędów.
• Tworzenie i utrzymywanie reprezentatywnych zbiorów danych i scenariuszy symulacyjnych w celu oceny wydajności modelu w warunkach rzeczywistych i przy ograniczonych zasobach.
• Identyfikuj wąskie gardła obliczeniowe i pamięciowe w potokach wnioskowania i wdrażaj rozwiązania obejmujące przetwarzanie wsadowe, tworzenie sieci, zarządzanie pamięcią i inne optymalizacje na poziomie systemu.
• Twórz niestandardowe jądra GPU i shadery obliczeniowe dla sprzętu mobilnego, w tym rozwiązania napisane w języku Metal Shading Language (MSL).
• Stosowanie zaawansowanych technik optymalizacji wnioskowania, takich jak oczyszczanie, kwantyzacja, Flash Attention, buforowanie KV i dekodowanie spekulatywne.
• Projektuj i optymalizuj rozproszone systemy wnioskowania, stosując podejścia takie jak równoległość tensorów, równoległość potoków i równoległość ekspercka dla dużych obciążeń GPU.
• Współpraca z interdyscyplinarnymi zespołami inżynieryjnymi i badawczymi w celu integracji zoptymalizowanych struktur wnioskowania z aplikacjami produkcyjnymi i urządzeniami brzegowymi.
• Definiowanie metodologii oceny, dokumentowanie wyników eksperymentów, porównywanie wydajności z ustalonymi wzorcami i ciągłe udoskonalanie strategii optymalizacji.
• Monitoruj wydajność produkcji i korzystaj z badań empirycznych, aby zidentyfikować możliwości dalszej poprawy skalowalności, wydajności i niezawodności.
Wymagania:
• Wykształcenie z informatyki lub pokrewnej dziedziny technicznej; doktorat z NLP, uczenia maszynowego lub dyscypliny pokrewnej jest bardzo istotny, szczególnie w przypadku dużego doświadczenia w badaniach nad sztuczną inteligencją i publikacjami na wiodących konferencjach.
• Sprawdzona wiedza na temat języka Metal Shading Language (MSL), w tym umiejętność pisania od podstaw niestandardowych shaderów obliczeniowych.
• Udokumentowane doświadczenie w optymalizacji jądra niskiego poziomu i optymalizacji wnioskowania na urządzeniach mobilnych lub innych urządzeniach o ograniczonych zasobach.
• Historia dostarczania mierzalnych ulepszeń w zakresie opóźnień wnioskowania, przepustowości i zużycia pamięci dla aplikacji specyficznych dla domeny.
• Głębokie zrozumienie nowoczesnych architektur obsługujących modele, silników wnioskowania i technik optymalizacji w celu wdrożenia wysokowydajnej sztucznej inteligencji.
• Duże doświadczenie w pisaniu jąder GPU dla urządzeń mobilnych, takich jak smartfony.
• Praktyczne doświadczenie w opracowywaniu i wdrażaniu kompleksowych potoków wnioskowania, od optymalizacji modelu po integrację produkcyjną na ograniczonym sprzęcie.
• Silna umiejętność stosowania badań empirycznych i systematycznych eksperymentów w celu rozwiązania problemów związanych z opóźnieniami, obliczeniami i pamięcią.
• Doświadczenie w projektowaniu solidnych ram oceny i benchmarkingu dla systemów wnioskowania.
• Znajomość technik wnioskowania rozproszonego, w tym równoległości tensorów, równoległości potoków i równoległości eksperckiej dla klastrów GPU na dużą skalę.
• Głębokie zrozumienie podstaw matematycznych i architektury modeli dyfuzyjnych i transformatorów wizyjnych.
• Znajomość nowoczesnych technik optymalizacji wnioskowania, w tym przycinania, kwantyzacji, Flash Attention, optymalizacji KV Cache i dekodowania spekulatywnego, takiego jak EAGLE.
• Silne zdolności analityczne i rozwiązywania problemów, ze zdolnością do badania wąskich gardeł złożonych systemów i przekształcania wyników badań w praktyczne rozwiązania inżynieryjne.
• Doskonałe umiejętności komunikacyjne w języku angielskim i umiejętność skutecznej współpracy z rozproszonymi, interdyscyplinarnymi zespołami technicznymi.
Korzyści:
• Możliwość pracy nad zaawansowanymi systemami AI obejmującymi obsługę modeli, optymalizację wnioskowania, przetwarzanie mobilne, wdrażanie brzegowe i wnioskowanie rozproszone na dużą skalę.
• Zdalne środowisko pracy w międzynarodowym zespole.
• Ekspozycja na najnowocześniejsze badania nad sztuczną inteligencją i praktyczne wyzwania związane z inżynierią systemów.
• Możliwość wniesienia wkładu w infrastrukturę o krytycznym znaczeniu dla wydajności, w której ulepszenia mogą mieć wymierny wpływ na rzeczywiste aplikacje AI.
• Środowisko współpracy łączące eksperymenty oparte na badaniach z praktyczną inżynierią.
• Możliwość pracy z zaawansowanymi architekturami modeli, w tym modelami dyfuzyjnymi, transformatorami wizyjnymi i systemami multimodalnymi.…
Źródło: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-uk-187924)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Jobgether
Ogłoszenie pochodzi od Jobgether.