Praca
Z kanału partnera
Starszy inżynier oprogramowania, Compute Platform
165 000 USD Wynagrodzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Tak
- Wynagrodzenie od
- 165 000
- Wynagrodzenie do
- 225 000
- Firma
- Moonlite
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
Moonlite zapewnia wysokowydajną infrastrukturę sztucznej inteligencji dla organizacji prowadzących intensywne badania obliczeniowe, szkolenia z modeli na dużą skalę i wymagające obciążenia związane z przetwarzaniem danych. Zapewniamy infrastrukturę wdrożoną w naszych obiektach lub zlokalizowaną w Twojej lokalizacji, zapewniając elastyczną moc obliczeniową na żądanie lub zarezerwowaną, która wydaje się być przedłużeniem istniejącego centrum danych. Nasz zespół specjalistów ds. infrastruktury sztucznej inteligencji łączy wydajność systemu bare-metal z prostotą operacyjną natywną w chmurze, umożliwiając zespołom badawczym i przedsiębiorstwom wdrażanie wymagających obciążeń AI z niezawodnością i zgodnością na poziomie korporacyjnym.
Twoja rola:
Odegrasz kluczową rolę w budowaniu naszej platformy obliczeniowej akcelerowanej przez procesor graficzny, która umożliwia rozproszone szkolenie i wnioskowanie w zakresie sztucznej inteligencji, symulacje na dużą skalę oraz obciążenia badawcze w zakresie obliczeń obliczeniowych. Ściśle współpracując z produktem, członkami zespołu ds. platformy i specjalistami ds. infrastruktury, zaprojektujesz i wdrożysz warstwę orkiestracji obliczeniowej, która zarządza klastrami GPU, udostępnianiem typu bare-metal i planowaniem zasobów, umożliwiając badaczom i inżynierom programowy dostęp do wysokowydajnych zasobów obliczeniowych z prostotą przypominającą chmurę.
Obowiązki zawodowe
•
Systemy orkiestracji obliczeniowej: projektuj i buduj skalowalne platformy orkiestracji obliczeniowej, które zarządzają klastrami GPU, udostępnianiem serwerów typu bare-metal i alokacją zasobów w kolokowanych środowiskach infrastrukturalnych.
•
Zarządzanie zasobami i planowanie: wdrażaj inteligentne algorytmy planowania obciążenia, alokacji zasobów i optymalizacji, które maksymalizują wykorzystanie procesora graficznego, zachowując jednocześnie gwarancje wydajności w przypadku obciążeń badawczych i szkoleniowych.
•
Dostarczanie klastrów badawczych: Projektuj i wdrażaj systemy do udostępniania i zarządzania badawczymi środowiskami obliczeniowymi, w tym klastrami Kubernetes i SLURM, umożliwiające automatyczne wdrażanie, planowanie zasobów i orkiestrację obciążeń na potrzeby rozproszonych szkoleń AI i obciążeń HPC.
•
Inżynieria platformy GPU: Rozwijaj możliwości platformy do zarządzania konfiguracjami procesorów graficznych NVIDIA najnowszej generacji (H100, H200, B200, B300), w tym zarządzanie zasobami GPU, izolację wielu dzierżawców i integrację z systemami orkiestracji obliczeniowej.
•
Zarządzanie cyklem życia serwera bare-metal: Twórz automatyzację i narzędzia do pełnego zarządzania cyklem życia serwera bare metal — od wstępnego udostępnienia i konfiguracji, poprzez bieżące operacje, aktualizacje i realokację zasobów.
•
Systemy o krytycznym znaczeniu dla wydajności: Optymalizuj komponenty platformy obliczeniowej pod kątem wysokiej przepustowości i niskich opóźnień, zapewniając, że obciążenia badawcze osiągną wydajność bliską wydajności typu „bare-metal” w środowiskach zwirtualizowanych lub kontenerowych.
•
Interfejsy API i integracja platform: Twórz niezawodne interfejsy API i zestawy SDK, które umożliwiają naukowcom programowe udostępnianie zasobów obliczeniowych i zarządzanie nimi, płynnie integrując się z istniejącymi przepływami pracy i infrastrukturą badawczą.
•
Obserwowalność i monitorowanie: wdrażaj kompleksowe systemy monitorowania i telemetrii zasobów obliczeniowych, zapewniając wgląd w wirtualizację procesora graficznego, wydajność obciążenia i stan infrastruktury.
•
Wielodostępność i izolacja: Twórz izolację obliczeniową klasy korporacyjnej dla wielu dzierżawców, granice bezpieczeństwa i przydziały zasobów, które umożliwiają bezpieczne udostępnianie infrastruktury GPU pomiędzy zespołami i organizacjami.
Wymagania
•
Doświadczenie: ponad 5 lat w inżynierii oprogramowania ze sprawdzonym doświadczeniem w budowaniu platform obliczeniowych, systemów orkiestracji kontenerów lub rozproszonej infrastruktury obliczeniowej dla środowisk produkcyjnych.
•
Inżynieria platformy obliczeniowej: duże doświadczenie w tworzeniu orkiestracji obliczeń, planowania zasobów lub systemów zarządzania obciążeniem na dużą skalę.
•
Kubernetes i orkiestracja kontenerów: Dobra znajomość architektury Kubernetes, koncepcji orkiestracji kontenerów i doświadczenie we wdrażaniu obciążeń w środowiskach Kubernetes. Zrozumienie podów, wdrożeń, usług i podstawowych operacji Kubernetes.
•
Umiejętności programowania: Doświadczenie z Go, C/C++, Pythonem lub Rustem w przypadku komponentów krytycznych dla wydajności jest wysoko cenione.
•
Programowanie w systemie Linux i systemowym: Duże doświadczenie z Linuksem w środowiskach produkcyjnych, w tym z systemami do programowania, optymalizacji wydajności i zarządzania zasobami niskiego poziomu.
•
Wirtualizacja i kontenery: głęboka wiedza na temat technologii wirtualizacji (KVM, Xen), środowisk wykonawczych kontenerów i platform orkiestracji.
•
Podstawy obliczeń na GPU: Zrozumienie architektur GPU, programowanie CUDA (gdzie/kiedy jest potrzebne) i zarządzanie zasobami GPU – lub silna umiejętność szybkiego uczenia się.
•
Infrastruktura bare-metal: doświadczenie w zakresie udostępniania usług bare-metal, systemów zarządzania poza pasmem i warstw abstrakcji sprzętu.
•
Rozwiązywanie problemów i architektura: wykazano umiejętność rozwiązywania złożonych problemów związanych z wydajnością i skalowalnością, przy jednoczesnym równoważeniu pragmatycznej wysyłki z dobrą długoterminową architekturą.
•
Autonomia i komunikacja: Wygodne poruszanie się w niejednoznacznościach, wspólne definiowanie wymagań i komunikowanie dyskusji technicznych za pomocą przejrzystej dokumentacji.
•
Zaangażowanie w rozwój: nastawienie na rozwój z ciągłym naciskiem na naukę i rozwój zawodowy.
Preferowane kwalifikacje
• Udostępnianie w tle lub zarządzanie badawczymi środowiskami obliczeniowymi (klastry Kubernetes, SLURM lub HPC)
• Doświadczenie z technologiami wirtualizacji GPU (SR-IOV, NVIDIA vGPU) i udostępnianiem GPU dla wielu dzierżawców
• Znajomość platform orkiestracji kontenerów z niestandardowym harmonogramem lub zarządzaniem zasobami
• Znajomość wysokowydajnych sieci do komunikacji z GPU (InfiniBand, RDMA, NVLink, NVSwitch)
• Znajomość frameworków szkoleniowych AI/ML (PyTorch, TensorFlow) i ich wymagań infrastrukturalnych
• Zrozumienie rozproszonych wzorców uczenia się i koordynacji wielowęzłowych procesorów graficznych
• Doświadczenie w budowaniu infrastruktury dla instytucji badawczych, laboratoriów lub technicznych środowisk obliczeniowych…
Źródło: Himalaje (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Twoja rola:
Odegrasz kluczową rolę w budowaniu naszej platformy obliczeniowej akcelerowanej przez procesor graficzny, która umożliwia rozproszone szkolenie i wnioskowanie w zakresie sztucznej inteligencji, symulacje na dużą skalę oraz obciążenia badawcze w zakresie obliczeń obliczeniowych. Ściśle współpracując z produktem, członkami zespołu ds. platformy i specjalistami ds. infrastruktury, zaprojektujesz i wdrożysz warstwę orkiestracji obliczeniowej, która zarządza klastrami GPU, udostępnianiem typu bare-metal i planowaniem zasobów, umożliwiając badaczom i inżynierom programowy dostęp do wysokowydajnych zasobów obliczeniowych z prostotą przypominającą chmurę.
Obowiązki zawodowe
•
Systemy orkiestracji obliczeniowej: projektuj i buduj skalowalne platformy orkiestracji obliczeniowej, które zarządzają klastrami GPU, udostępnianiem serwerów typu bare-metal i alokacją zasobów w kolokowanych środowiskach infrastrukturalnych.
•
Zarządzanie zasobami i planowanie: wdrażaj inteligentne algorytmy planowania obciążenia, alokacji zasobów i optymalizacji, które maksymalizują wykorzystanie procesora graficznego, zachowując jednocześnie gwarancje wydajności w przypadku obciążeń badawczych i szkoleniowych.
•
Dostarczanie klastrów badawczych: Projektuj i wdrażaj systemy do udostępniania i zarządzania badawczymi środowiskami obliczeniowymi, w tym klastrami Kubernetes i SLURM, umożliwiające automatyczne wdrażanie, planowanie zasobów i orkiestrację obciążeń na potrzeby rozproszonych szkoleń AI i obciążeń HPC.
•
Inżynieria platformy GPU: Rozwijaj możliwości platformy do zarządzania konfiguracjami procesorów graficznych NVIDIA najnowszej generacji (H100, H200, B200, B300), w tym zarządzanie zasobami GPU, izolację wielu dzierżawców i integrację z systemami orkiestracji obliczeniowej.
•
Zarządzanie cyklem życia serwera bare-metal: Twórz automatyzację i narzędzia do pełnego zarządzania cyklem życia serwera bare metal — od wstępnego udostępnienia i konfiguracji, poprzez bieżące operacje, aktualizacje i realokację zasobów.
•
Systemy o krytycznym znaczeniu dla wydajności: Optymalizuj komponenty platformy obliczeniowej pod kątem wysokiej przepustowości i niskich opóźnień, zapewniając, że obciążenia badawcze osiągną wydajność bliską wydajności typu „bare-metal” w środowiskach zwirtualizowanych lub kontenerowych.
•
Interfejsy API i integracja platform: Twórz niezawodne interfejsy API i zestawy SDK, które umożliwiają naukowcom programowe udostępnianie zasobów obliczeniowych i zarządzanie nimi, płynnie integrując się z istniejącymi przepływami pracy i infrastrukturą badawczą.
•
Obserwowalność i monitorowanie: wdrażaj kompleksowe systemy monitorowania i telemetrii zasobów obliczeniowych, zapewniając wgląd w wirtualizację procesora graficznego, wydajność obciążenia i stan infrastruktury.
•
Wielodostępność i izolacja: Twórz izolację obliczeniową klasy korporacyjnej dla wielu dzierżawców, granice bezpieczeństwa i przydziały zasobów, które umożliwiają bezpieczne udostępnianie infrastruktury GPU pomiędzy zespołami i organizacjami.
Wymagania
•
Doświadczenie: ponad 5 lat w inżynierii oprogramowania ze sprawdzonym doświadczeniem w budowaniu platform obliczeniowych, systemów orkiestracji kontenerów lub rozproszonej infrastruktury obliczeniowej dla środowisk produkcyjnych.
•
Inżynieria platformy obliczeniowej: duże doświadczenie w tworzeniu orkiestracji obliczeń, planowania zasobów lub systemów zarządzania obciążeniem na dużą skalę.
•
Kubernetes i orkiestracja kontenerów: Dobra znajomość architektury Kubernetes, koncepcji orkiestracji kontenerów i doświadczenie we wdrażaniu obciążeń w środowiskach Kubernetes. Zrozumienie podów, wdrożeń, usług i podstawowych operacji Kubernetes.
•
Umiejętności programowania: Doświadczenie z Go, C/C++, Pythonem lub Rustem w przypadku komponentów krytycznych dla wydajności jest wysoko cenione.
•
Programowanie w systemie Linux i systemowym: Duże doświadczenie z Linuksem w środowiskach produkcyjnych, w tym z systemami do programowania, optymalizacji wydajności i zarządzania zasobami niskiego poziomu.
•
Wirtualizacja i kontenery: głęboka wiedza na temat technologii wirtualizacji (KVM, Xen), środowisk wykonawczych kontenerów i platform orkiestracji.
•
Podstawy obliczeń na GPU: Zrozumienie architektur GPU, programowanie CUDA (gdzie/kiedy jest potrzebne) i zarządzanie zasobami GPU – lub silna umiejętność szybkiego uczenia się.
•
Infrastruktura bare-metal: doświadczenie w zakresie udostępniania usług bare-metal, systemów zarządzania poza pasmem i warstw abstrakcji sprzętu.
•
Rozwiązywanie problemów i architektura: wykazano umiejętność rozwiązywania złożonych problemów związanych z wydajnością i skalowalnością, przy jednoczesnym równoważeniu pragmatycznej wysyłki z dobrą długoterminową architekturą.
•
Autonomia i komunikacja: Wygodne poruszanie się w niejednoznacznościach, wspólne definiowanie wymagań i komunikowanie dyskusji technicznych za pomocą przejrzystej dokumentacji.
•
Zaangażowanie w rozwój: nastawienie na rozwój z ciągłym naciskiem na naukę i rozwój zawodowy.
Preferowane kwalifikacje
• Udostępnianie w tle lub zarządzanie badawczymi środowiskami obliczeniowymi (klastry Kubernetes, SLURM lub HPC)
• Doświadczenie z technologiami wirtualizacji GPU (SR-IOV, NVIDIA vGPU) i udostępnianiem GPU dla wielu dzierżawców
• Znajomość platform orkiestracji kontenerów z niestandardowym harmonogramem lub zarządzaniem zasobami
• Znajomość wysokowydajnych sieci do komunikacji z GPU (InfiniBand, RDMA, NVLink, NVSwitch)
• Znajomość frameworków szkoleniowych AI/ML (PyTorch, TensorFlow) i ich wymagań infrastrukturalnych
• Zrozumienie rozproszonych wzorców uczenia się i koordynacji wielowęzłowych procesorów graficznych
• Doświadczenie w budowaniu infrastruktury dla instytucji badawczych, laboratoriów lub technicznych środowisk obliczeniowych…
Źródło: Himalaje (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Moonlite
Ogłoszenie pochodzi od Moonlite.