Praca
Z kanału partnera
Inżynier wsparcia technicznego (L2) - Obliczenia
Cena na życzenie
Szczegóły
- Typ zatrudnienia
- Pełny etat
- Zdalnie
- Nie
- Firma
- Mistral.ai
Opis
Automatyczne tłumaczenie z języka English. Oryginał jest wiążący. Tłumaczenie maszynowe — trwają prace nad dokładniejszą wersją.
O Mistralu
Mistral zapewnia kompleksowe rozwiązania AI: od modeli pionierskich po narzędzia programistyczne, aplikacje i obliczenia. Współpracujemy z przedsiębiorstwami zmagającymi się z najtrudniejszymi problemami w branżach wymagających wysokich stawek, takich jak finanse, produkcja, obrona, opieka zdrowotna i sektor publiczny, współtworząc dostosowane do potrzeb systemy sztucznej inteligencji, które mogą uruchamiać na ich warunkach.
Jesteśmy dynamicznym, współpracującym zespołem pasjonującym się sztuczną inteligencją i jej potencjałem do przekształcania społeczeństwa. Nasza zróżnicowana kadra świetnie radzi sobie w konkurencyjnym środowisku i jest zaangażowana we wprowadzanie innowacji. Nasze zespoły są rozmieszczone w Europie, Ameryce Północnej, Azji i na Bliskim Wschodzie. Jesteśmy kreatywni, mamy niskie ego i jesteśmy duchem zespołowym.
Mistral AI buduje nowy zespół Compute Support, aby zapewnić niezawodność, wydajność i skalowalność naszych klastrów GPU w środowisku Kubernetes. Jako jeden z członków założycieli tego zespołu będziesz odgrywać kluczową rolę w kształtowaniu procesów, standardów i kultury firmy.
Na tym hybrydowym stanowisku wsparcia L1/L2 będziesz pierwszym punktem kontaktowym dla klientów i zespołów wewnętrznych, udzielającym wskazówek technicznych, rozwiązywania problemów i rozwiązywania problemów związanych z zapytaniami związanymi z obliczeniami. Będziesz także pełnić funkcję punktu eskalacji złożonych problemów, wykorzystując swoją głęboką wiedzę o systemach, wiedzę specjalistyczną w zakresie Kubernetes i umiejętności debugowania operacyjnego, aby zapewnić płynne działanie naszych obciążeń AI na dużą skalę.
Jest to rola skupiająca się na wsparciu, która łączy administrację systemem, komunikację z klientem i wiedzę specjalistyczną w zakresie infrastruktury obliczeniowej. Chociaż kodowanie nie jest głównym celem, znajomość Go do debugowania i automatyzacji będzie zaletą.
Kluczowe obowiązki
Pierwszy Punkt Kontaktu Klienta
• Działaj jako pierwszy rozmówca dla klientów i zespołów wewnętrznych, zapewniając terminowe i skuteczne odpowiedzi na zapytania związane z obliczeniami.
• Segreguj i ustalaj priorytety przychodzących żądań, zapewniając dotrzymanie umów SLA w zakresie potwierdzenia, pierwszej odpowiedzi i rozwiązania.
• Zbieraj i analizuj początkowe szczegóły problemu (np. dzienniki, komunikaty o błędach, metryki systemowe), aby skutecznie diagnozować problemy.
• Zapewnij klientom i użytkownikom wewnętrznym jasne, praktyczne wskazówki, w tym tymczasowe rozwiązania, jeśli ma to zastosowanie.
Wsparcie techniczne
• Pełnić funkcję punktu eskalacji poziomu 2 w przypadku problemów z Linuksem, Kubernetesem i infrastrukturą obliczeniową, zapewniając szczegółowe rozwiązywanie problemów technicznych w przypadku:
• Obciążenia GPU/TPU (np. błędy CUDA, wycieki pamięci, awarie zadań).
• Klastry Kubernetes (np. awarie podów, awarie węzłów, błędna konfiguracja sieci).
• Środowiska typu bare metal i chmurowe (np. AWS EC2, maszyny wirtualne GCP, klastry HPC).
• Diagnozuj i rozwiązuj wąskie gardła wydajności, awarie sprzętu i rywalizację o zasoby w systemach rozproszonych.
• Analizuj metryki, dzienniki i ślady systemu (np. dmesg, journalctl, nvidia-smi, Prometheus, Grafana), aby zidentyfikować główne przyczyny problemów.
• Uczestnictwo w dyżurach telefonicznych, aby zapewnić całodobową pomoc techniczną dla krytycznych systemów obliczeniowych
• Miło mieć: Optymalizuj konfiguracje systemu (np. parametry jądra, dostrajanie systemu plików, ustawienia sieci) pod kątem obliczeń o wysokiej wydajności (HPC) i obciążeń AI.
Kubernetes i konteneryzacja
• Debuguj klastry Kubernetes, koncentrując się na:
• Problemy z podami i węzłami (np. CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Sieć i przechowywanie (np. wtyczki CNI, PersistentVolumes, StorageClasses).
• Zarządzanie zasobami (np. żądania/limity, klasy QOS, powinowactwo węzłów).
• Rozwiązywanie problemów związanych z wykonaniem kontenera (Docker, kontenerd), takich jak awarie pobierania obrazów, zgodność z OCI lub błędy czasu wykonywania.
• Współpraca z zespołami SRE w celu zrozumienia i udoskonalenia istniejących narzędzi IaC (Terraform, Ansible) i Go.
Udoskonalanie dokumentacji i procesów
• Twórz i zarządzaj elementami Runbook, PlayBook i wewnętrzną dokumentacją dotyczącą typowych problemów z obliczeniami (np. debugowanie procesora GPU, rozwiązywanie problemów z Kubernetesem).
• Udział w sekcjach zwłok poprzez podjęcie praktycznych działań następczych, aby zapobiec powtarzającym się incydentom.
• Szkolić zespoły wewnętrzne w zakresie najlepszych praktyk w zakresie infrastruktury obliczeniowej i debugowania.
• Pomóż zdefiniować i udoskonalić procesy wsparcia jako członek-założyciel nowego zespołu wsparcia Compute.
Czego szukamy
Wymagane umiejętności i doświadczenie
• Ponad 5 lat doświadczenia w administrowaniu systemami, wsparciu technicznym lub operacjach związanych z infrastrukturą, ze szczególnym naciskiem na środowiska o dużej mocy obliczeniowej (bare metal, chmura, HPC lub wirtualizacja).
• Głęboka wiedza na temat Linuksa/Unixa:
• Debugowanie problemów na poziomie jądra (np. zabójca OOM, wąskie gardła we/wy, dławienie procesora).
• Strojenie wydajności (np. sysctl, ulimit, optymalizacja systemu plików).
• Rozwiązywanie problemów z siecią (np. iptables, tcpdump, DNS, NFS, SSH).
• Zarządzanie pamięcią masową (np. LVM, RAID, NVMe, pamięć lokalna GPU).
• Praktyczne doświadczenie w Kubernetes jest obowiązkowe:
• Debugowanie podów, węzłów i klastrów (np. kubectl opisz, kubectl logs, crictl).
• Sieć i przechowywanie (np. wtyczki CNI, PersistentVolumes).
• Zarządzanie zasobami (np. żądania/limity, klasy QOS).
• Znajomość konteneryzacji (Docker, kontenerd) i podstawowa świadomość IaC. Biegła znajomość narzędzi monitorujących (Prometheus, Grafana, ELK, OpenTelemetry).
• Podstawowe umiejętności pisania skryptów/automatyzacji (najlepiej Go, ale do zadań ad hoc akceptowalny jest Bash lub Python).
• Doświadczenie w pracy ze środowiskami bare metal, wirtualizacyjnymi lub HPC (np. Fluidstack, Coreweave, Vast) będzie mocnym plusem.
• Doskonałe umiejętności rozwiązywania problemów i komunikacji, ze zdolnością do jasnego i cierpliwego wyjaśniania problemów technicznych interesariuszom zarówno technicznym, jak i nietechnicznym.
• Nastawienie skupione na kliencie i pasja skutecznego rozwiązywania problemów i poprawy niezawodności systemu.
• Umiejętność pracy w systemie rotacyjnym i radzenia sobie w sytuacjach pod wysokim napięciem przy ustrukturyzowanym, spokojnym podejściu.
• Zaangażowanie w dotrzymywanie ścisłych umów SLA w zakresie potwierdzania problemów, selekcji i pierwszej reakcji.…
Źródło: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
Mistral zapewnia kompleksowe rozwiązania AI: od modeli pionierskich po narzędzia programistyczne, aplikacje i obliczenia. Współpracujemy z przedsiębiorstwami zmagającymi się z najtrudniejszymi problemami w branżach wymagających wysokich stawek, takich jak finanse, produkcja, obrona, opieka zdrowotna i sektor publiczny, współtworząc dostosowane do potrzeb systemy sztucznej inteligencji, które mogą uruchamiać na ich warunkach.
Jesteśmy dynamicznym, współpracującym zespołem pasjonującym się sztuczną inteligencją i jej potencjałem do przekształcania społeczeństwa. Nasza zróżnicowana kadra świetnie radzi sobie w konkurencyjnym środowisku i jest zaangażowana we wprowadzanie innowacji. Nasze zespoły są rozmieszczone w Europie, Ameryce Północnej, Azji i na Bliskim Wschodzie. Jesteśmy kreatywni, mamy niskie ego i jesteśmy duchem zespołowym.
Mistral AI buduje nowy zespół Compute Support, aby zapewnić niezawodność, wydajność i skalowalność naszych klastrów GPU w środowisku Kubernetes. Jako jeden z członków założycieli tego zespołu będziesz odgrywać kluczową rolę w kształtowaniu procesów, standardów i kultury firmy.
Na tym hybrydowym stanowisku wsparcia L1/L2 będziesz pierwszym punktem kontaktowym dla klientów i zespołów wewnętrznych, udzielającym wskazówek technicznych, rozwiązywania problemów i rozwiązywania problemów związanych z zapytaniami związanymi z obliczeniami. Będziesz także pełnić funkcję punktu eskalacji złożonych problemów, wykorzystując swoją głęboką wiedzę o systemach, wiedzę specjalistyczną w zakresie Kubernetes i umiejętności debugowania operacyjnego, aby zapewnić płynne działanie naszych obciążeń AI na dużą skalę.
Jest to rola skupiająca się na wsparciu, która łączy administrację systemem, komunikację z klientem i wiedzę specjalistyczną w zakresie infrastruktury obliczeniowej. Chociaż kodowanie nie jest głównym celem, znajomość Go do debugowania i automatyzacji będzie zaletą.
Kluczowe obowiązki
Pierwszy Punkt Kontaktu Klienta
• Działaj jako pierwszy rozmówca dla klientów i zespołów wewnętrznych, zapewniając terminowe i skuteczne odpowiedzi na zapytania związane z obliczeniami.
• Segreguj i ustalaj priorytety przychodzących żądań, zapewniając dotrzymanie umów SLA w zakresie potwierdzenia, pierwszej odpowiedzi i rozwiązania.
• Zbieraj i analizuj początkowe szczegóły problemu (np. dzienniki, komunikaty o błędach, metryki systemowe), aby skutecznie diagnozować problemy.
• Zapewnij klientom i użytkownikom wewnętrznym jasne, praktyczne wskazówki, w tym tymczasowe rozwiązania, jeśli ma to zastosowanie.
Wsparcie techniczne
• Pełnić funkcję punktu eskalacji poziomu 2 w przypadku problemów z Linuksem, Kubernetesem i infrastrukturą obliczeniową, zapewniając szczegółowe rozwiązywanie problemów technicznych w przypadku:
• Obciążenia GPU/TPU (np. błędy CUDA, wycieki pamięci, awarie zadań).
• Klastry Kubernetes (np. awarie podów, awarie węzłów, błędna konfiguracja sieci).
• Środowiska typu bare metal i chmurowe (np. AWS EC2, maszyny wirtualne GCP, klastry HPC).
• Diagnozuj i rozwiązuj wąskie gardła wydajności, awarie sprzętu i rywalizację o zasoby w systemach rozproszonych.
• Analizuj metryki, dzienniki i ślady systemu (np. dmesg, journalctl, nvidia-smi, Prometheus, Grafana), aby zidentyfikować główne przyczyny problemów.
• Uczestnictwo w dyżurach telefonicznych, aby zapewnić całodobową pomoc techniczną dla krytycznych systemów obliczeniowych
• Miło mieć: Optymalizuj konfiguracje systemu (np. parametry jądra, dostrajanie systemu plików, ustawienia sieci) pod kątem obliczeń o wysokiej wydajności (HPC) i obciążeń AI.
Kubernetes i konteneryzacja
• Debuguj klastry Kubernetes, koncentrując się na:
• Problemy z podami i węzłami (np. CrashLoopBackOff, OOMKilled, ImagePullBackOff).
• Sieć i przechowywanie (np. wtyczki CNI, PersistentVolumes, StorageClasses).
• Zarządzanie zasobami (np. żądania/limity, klasy QOS, powinowactwo węzłów).
• Rozwiązywanie problemów związanych z wykonaniem kontenera (Docker, kontenerd), takich jak awarie pobierania obrazów, zgodność z OCI lub błędy czasu wykonywania.
• Współpraca z zespołami SRE w celu zrozumienia i udoskonalenia istniejących narzędzi IaC (Terraform, Ansible) i Go.
Udoskonalanie dokumentacji i procesów
• Twórz i zarządzaj elementami Runbook, PlayBook i wewnętrzną dokumentacją dotyczącą typowych problemów z obliczeniami (np. debugowanie procesora GPU, rozwiązywanie problemów z Kubernetesem).
• Udział w sekcjach zwłok poprzez podjęcie praktycznych działań następczych, aby zapobiec powtarzającym się incydentom.
• Szkolić zespoły wewnętrzne w zakresie najlepszych praktyk w zakresie infrastruktury obliczeniowej i debugowania.
• Pomóż zdefiniować i udoskonalić procesy wsparcia jako członek-założyciel nowego zespołu wsparcia Compute.
Czego szukamy
Wymagane umiejętności i doświadczenie
• Ponad 5 lat doświadczenia w administrowaniu systemami, wsparciu technicznym lub operacjach związanych z infrastrukturą, ze szczególnym naciskiem na środowiska o dużej mocy obliczeniowej (bare metal, chmura, HPC lub wirtualizacja).
• Głęboka wiedza na temat Linuksa/Unixa:
• Debugowanie problemów na poziomie jądra (np. zabójca OOM, wąskie gardła we/wy, dławienie procesora).
• Strojenie wydajności (np. sysctl, ulimit, optymalizacja systemu plików).
• Rozwiązywanie problemów z siecią (np. iptables, tcpdump, DNS, NFS, SSH).
• Zarządzanie pamięcią masową (np. LVM, RAID, NVMe, pamięć lokalna GPU).
• Praktyczne doświadczenie w Kubernetes jest obowiązkowe:
• Debugowanie podów, węzłów i klastrów (np. kubectl opisz, kubectl logs, crictl).
• Sieć i przechowywanie (np. wtyczki CNI, PersistentVolumes).
• Zarządzanie zasobami (np. żądania/limity, klasy QOS).
• Znajomość konteneryzacji (Docker, kontenerd) i podstawowa świadomość IaC. Biegła znajomość narzędzi monitorujących (Prometheus, Grafana, ELK, OpenTelemetry).
• Podstawowe umiejętności pisania skryptów/automatyzacji (najlepiej Go, ale do zadań ad hoc akceptowalny jest Bash lub Python).
• Doświadczenie w pracy ze środowiskami bare metal, wirtualizacyjnymi lub HPC (np. Fluidstack, Coreweave, Vast) będzie mocnym plusem.
• Doskonałe umiejętności rozwiązywania problemów i komunikacji, ze zdolnością do jasnego i cierpliwego wyjaśniania problemów technicznych interesariuszom zarówno technicznym, jak i nietechnicznym.
• Nastawienie skupione na kliencie i pasja skutecznego rozwiązywania problemów i poprawy niezawodności systemu.
• Umiejętność pracy w systemie rotacyjnym i radzenia sobie w sytuacjach pod wysokim napięciem przy ustrukturyzowanym, spokojnym podejściu.
• Zaangażowanie w dotrzymywanie ścisłych umów SLA w zakresie potwierdzania problemów, selekcji i pierwszej reakcji.…
Źródło: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/mistralai/technical-support-engineer-l2-compute-paris-18598)
To ogłoszenie pochodzi z feedu partnera. Aplikuj na stronie źródłowej.
Źródło: Mistral.ai
Lokalizacja
Paris, Francja
Ogłoszenie pochodzi od Mistral.ai.