Praca
Z kanału partnera
Inżynier kompilatora agenta
Cena na życzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Nie
- Firma
- Kog
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
O KOGU
Kog buduje wspólnie zaprojektowany stos wnioskowania dla agentów AI w czasie rzeczywistym na standardowych procesorach graficznych dla centrów danych, obejmujący architekturę modelu, silnik wnioskowania, kompilatory i jądra GPU niskiego poziomu.
Po stronie modelu opracowaliśmy Laneformer 2B i Delayed Tensor Parallelism (DTP), architekturę transformatora, która łączy komunikację z użytecznymi obliczeniami i strumieniowaniem wag.
Po stronie systemowej silnik Kog Inference Engine obsługuje ten stos na standardowych procesorach graficznych AMD i NVIDIA dla centrów danych.
Kog generuje 3500 tokenów/s na żądanie na 8 procesorach graficznych AMD MI300X i 2100 tokenów/s na żądanie na 8 procesorach graficznych NVIDIA H200, w FP16 w rozmiarze wsadowym 1, z wyłączoną kwantyzacją i dekodowaniem spekulatywnym.
Naszym kolejnym dużym projektem jest AGCO, nasz kompilator agentów. AGCO zaprojektowano z myślą o optymalizacji LLM dla różnych procesorów graficznych i celów optymalizacji, w tym bardzo szybkiego wnioskowania.
Zespół liczy 10 osób, w tym 9 inżynierów i badaczy oraz 4 doktorów.
Przetestuj na stronie plac zabaw.kog.ai. Przeczytaj szczegóły techniczne na blogu Kog Labs.
NAD CZYM BĘDZIESZ PRACOWAĆ
Będziesz pracować bezpośrednio w AGCO.
Celem jest zbudowanie systemu, który będzie w stanie zbadać sposoby optymalizacji wykonania LLM, wygenerować zmiany, skompilować je, sprawdzić poprawność, uruchomić je na rzeczywistym sprzęcie, zmierzyć wyniki i wykorzystać tę informację zwrotną do poprowadzenia kolejnej optymalizacji.
Będziesz przyczyniać się do takich obszarów jak:
• Kompilator i projekt IR do reprezentowania i przekształcania obliczeń LLM.
• Optymalizacja przebiega, obniżanie i generowanie kodu.
• Metody wyszukiwania w celu zbadania różnych wdrożeń i strategii wykonania.
• Weryfikacja i kontrola poprawności wygenerowanych zmian.
• Wykonywanie, profilowanie i optymalizacja wydajności procesora graficznego.
• Wnioskowanie LLM pomiędzy operatorami, pamięcią, równoległością i komunikacją.
• Pętle optymalizacyjne, które łączą wygenerowane zmiany z pomiarami na rzeczywistych procesorach graficznych.
Jeden z kierunków, który badamy, łączy IR, weryfikator, kompilator i optymalizator wyszukiwania. Planujemy zacząć od konkretnych problemów, zbudować działające prototypy i rozszerzyć system na podstawie zdobytej wiedzy.
Twój główny obszar będzie zależał od Twojego doświadczenia, umiejętności i zainteresowań. Możesz skupić się bardziej na kompilatorach, systemach GPU lub wnioskowaniu LLM, ściśle współpracując z ludźmi z całego stosu.
CZEGO SZUKAMY
Poszukujemy inżynierów posiadających głęboką wiedzę techniczną i oryginalne prace w co najmniej jednym obszarze istotnym dla AGCO.
Odpowiednie doświadczenie obejmuje:
• Inżynieria kompilatora, w tym przebiegi optymalizacyjne, IR, obniżanie, generowanie kodu, LLVM lub MLIR.
• Programowanie GPU w technologiach CUDA, HIP, Metal, Vulkan lub podobnych.
• Praca związana z wydajnością procesora graficznego obejmująca jądra, pamięć, synchronizację, profilowanie lub zachowanie sprzętu.
• Silniki wnioskowania LLM i optymalizacja wydajności.
• Uwaga, MoE, równoległość, komunikacja lub inne części wykonania LLM na poziomie systemowym.
• Weryfikacja formalna, sprawdzanie równoważności, SAT/SMT lub metody pokrewne.
• Systemy, które automatycznie generują, wyszukują, testują, porównują lub optymalizują kod.
Dbamy o to, co osobiście zbudowałeś i stojące za tym decyzje techniczne. Silni kandydaci potrafią wyjaśnić problem, swoje podejście, zbadane alternatywy i sposób pomiaru wyniku.
W trakcie procesu dokonujemy przeglądu prac technicznych. Może to być kod publiczny, wkład początkowy, artykuł, teza, projekt techniczny lub szczegółowy opis oparty na pracy, którą możesz udostępnić.
CO OFERUJEMY
Dołączysz do małego zespołu budującego AGCO, będącego podstawową częścią technologii Kog.
• Praca na styku kompilatorów, systemów GPU i wnioskowania LLM.
• Bezpośredni dostęp do inżynierów pracujących nad pełnym stosem wnioskowania.
• Szybka pętla od pomysłu na optymalizację do kompilacji, wykonania, weryfikacji i pomiaru na rzeczywistych procesorach graficznych.
• Możliwość zagłębienia się w najmocniejszy obszar techniczny, jednocześnie rozszerzając się na inne części stosu.
• Wysoka odpowiedzialność za decyzje techniczne i systemy, które będą kształtować sposób, w jaki Kog optymalizuje wnioskowanie LLM.
Stanowisko to zlokalizowane jest w Paryżu i poszukujemy kandydatów, którzy mogą przenieść się do Paryża i ściśle współpracować z zespołem.
Znajdź oferty pracy we Francji na Arbeitnow
Źródło: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Kog buduje wspólnie zaprojektowany stos wnioskowania dla agentów AI w czasie rzeczywistym na standardowych procesorach graficznych dla centrów danych, obejmujący architekturę modelu, silnik wnioskowania, kompilatory i jądra GPU niskiego poziomu.
Po stronie modelu opracowaliśmy Laneformer 2B i Delayed Tensor Parallelism (DTP), architekturę transformatora, która łączy komunikację z użytecznymi obliczeniami i strumieniowaniem wag.
Po stronie systemowej silnik Kog Inference Engine obsługuje ten stos na standardowych procesorach graficznych AMD i NVIDIA dla centrów danych.
Kog generuje 3500 tokenów/s na żądanie na 8 procesorach graficznych AMD MI300X i 2100 tokenów/s na żądanie na 8 procesorach graficznych NVIDIA H200, w FP16 w rozmiarze wsadowym 1, z wyłączoną kwantyzacją i dekodowaniem spekulatywnym.
Naszym kolejnym dużym projektem jest AGCO, nasz kompilator agentów. AGCO zaprojektowano z myślą o optymalizacji LLM dla różnych procesorów graficznych i celów optymalizacji, w tym bardzo szybkiego wnioskowania.
Zespół liczy 10 osób, w tym 9 inżynierów i badaczy oraz 4 doktorów.
Przetestuj na stronie plac zabaw.kog.ai. Przeczytaj szczegóły techniczne na blogu Kog Labs.
NAD CZYM BĘDZIESZ PRACOWAĆ
Będziesz pracować bezpośrednio w AGCO.
Celem jest zbudowanie systemu, który będzie w stanie zbadać sposoby optymalizacji wykonania LLM, wygenerować zmiany, skompilować je, sprawdzić poprawność, uruchomić je na rzeczywistym sprzęcie, zmierzyć wyniki i wykorzystać tę informację zwrotną do poprowadzenia kolejnej optymalizacji.
Będziesz przyczyniać się do takich obszarów jak:
• Kompilator i projekt IR do reprezentowania i przekształcania obliczeń LLM.
• Optymalizacja przebiega, obniżanie i generowanie kodu.
• Metody wyszukiwania w celu zbadania różnych wdrożeń i strategii wykonania.
• Weryfikacja i kontrola poprawności wygenerowanych zmian.
• Wykonywanie, profilowanie i optymalizacja wydajności procesora graficznego.
• Wnioskowanie LLM pomiędzy operatorami, pamięcią, równoległością i komunikacją.
• Pętle optymalizacyjne, które łączą wygenerowane zmiany z pomiarami na rzeczywistych procesorach graficznych.
Jeden z kierunków, który badamy, łączy IR, weryfikator, kompilator i optymalizator wyszukiwania. Planujemy zacząć od konkretnych problemów, zbudować działające prototypy i rozszerzyć system na podstawie zdobytej wiedzy.
Twój główny obszar będzie zależał od Twojego doświadczenia, umiejętności i zainteresowań. Możesz skupić się bardziej na kompilatorach, systemach GPU lub wnioskowaniu LLM, ściśle współpracując z ludźmi z całego stosu.
CZEGO SZUKAMY
Poszukujemy inżynierów posiadających głęboką wiedzę techniczną i oryginalne prace w co najmniej jednym obszarze istotnym dla AGCO.
Odpowiednie doświadczenie obejmuje:
• Inżynieria kompilatora, w tym przebiegi optymalizacyjne, IR, obniżanie, generowanie kodu, LLVM lub MLIR.
• Programowanie GPU w technologiach CUDA, HIP, Metal, Vulkan lub podobnych.
• Praca związana z wydajnością procesora graficznego obejmująca jądra, pamięć, synchronizację, profilowanie lub zachowanie sprzętu.
• Silniki wnioskowania LLM i optymalizacja wydajności.
• Uwaga, MoE, równoległość, komunikacja lub inne części wykonania LLM na poziomie systemowym.
• Weryfikacja formalna, sprawdzanie równoważności, SAT/SMT lub metody pokrewne.
• Systemy, które automatycznie generują, wyszukują, testują, porównują lub optymalizują kod.
Dbamy o to, co osobiście zbudowałeś i stojące za tym decyzje techniczne. Silni kandydaci potrafią wyjaśnić problem, swoje podejście, zbadane alternatywy i sposób pomiaru wyniku.
W trakcie procesu dokonujemy przeglądu prac technicznych. Może to być kod publiczny, wkład początkowy, artykuł, teza, projekt techniczny lub szczegółowy opis oparty na pracy, którą możesz udostępnić.
CO OFERUJEMY
Dołączysz do małego zespołu budującego AGCO, będącego podstawową częścią technologii Kog.
• Praca na styku kompilatorów, systemów GPU i wnioskowania LLM.
• Bezpośredni dostęp do inżynierów pracujących nad pełnym stosem wnioskowania.
• Szybka pętla od pomysłu na optymalizację do kompilacji, wykonania, weryfikacji i pomiaru na rzeczywistych procesorach graficznych.
• Możliwość zagłębienia się w najmocniejszy obszar techniczny, jednocześnie rozszerzając się na inne części stosu.
• Wysoka odpowiedzialność za decyzje techniczne i systemy, które będą kształtować sposób, w jaki Kog optymalizuje wnioskowanie LLM.
Stanowisko to zlokalizowane jest w Paryżu i poszukujemy kandydatów, którzy mogą przenieść się do Paryża i ściśle współpracować z zespołem.
Znajdź oferty pracy we Francji na Arbeitnow
Źródło: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Kog
Lokalizacja
Paryż, Francja
Ogłoszenie pochodzi od Kog.