Job
Aus Partner-Feed
Leitender Software-Ingenieur, Compute-Plattform
165.000 $ Gehalt
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Ja
- Gehalt ab
- 165.000
- Gehalt bis
- 225.000
- Unternehmen
- Moonlite
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Moonlite bietet eine leistungsstarke KI-Infrastruktur für Unternehmen, die intensive Computerforschung, groß angelegte Modellschulungen und anspruchsvolle Datenverarbeitungs-Workloads betreiben. Wir stellen Infrastruktur bereit, die in unseren Einrichtungen oder gemeinsam mit Ihren Standorten bereitgestellt wird, und liefern flexible On-Demand- oder reservierte Rechenleistung, die sich wie eine Erweiterung Ihres bestehenden Rechenzentrums anfühlt. Unser Team aus KI-Infrastrukturspezialisten kombiniert Bare-Metal-Leistung mit Cloud-nativer Betriebseinfachheit und ermöglicht es Forschungsteams und Unternehmen, anspruchsvolle KI-Workloads mit Zuverlässigkeit und Compliance auf Unternehmensniveau bereitzustellen.
Ihre Rolle:
Sie werden maßgeblich am Aufbau unserer GPU-beschleunigten Rechenplattform beteiligt sein, die verteiltes KI-Training und -Inferenz, groß angelegte Simulationen und rechnerische Forschungsarbeitslasten ermöglicht. In enger Zusammenarbeit mit dem Produkt, Ihren Plattformteammitgliedern und Infrastrukturspezialisten entwerfen und implementieren Sie die Computing-Orchestrierungsschicht, die GPU-Cluster, Bare-Metal-Bereitstellung und Ressourcenplanung verwaltet und es Forschern und Ingenieuren ermöglicht, programmgesteuert auf leistungsstarke Computing-Ressourcen mit Cloud-ähnlicher Einfachheit zuzugreifen.
Aufgabenbereiche
•
Computing-Orchestrierungssysteme: Entwerfen und bauen Sie skalierbare Computing-Orchestrierungsplattformen, die GPU-Cluster, die Bereitstellung von Bare-Metal-Servern und die Ressourcenzuweisung in gemeinsam gelegenen Infrastrukturumgebungen verwalten.
•
Ressourcenmanagement und -planung: Implementieren Sie intelligente Arbeitslastplanung, Ressourcenzuweisung und Optimierungsalgorithmen, die die GPU-Auslastung maximieren und gleichzeitig Leistungsgarantien für Forschungs- und Schulungsarbeitslasten aufrechterhalten.
•
Bereitstellung von Forschungsclustern: Entwerfen und implementieren Sie Systeme zur Bereitstellung und Verwaltung von Forschungscomputerumgebungen, einschließlich Kubernetes- und SLURM-Clustern, die eine automatisierte Bereitstellung, Ressourcenplanung und Workload-Orchestrierung für verteilte KI-Schulungen und HPC-Workloads ermöglichen.
•
GPU-Plattform-Engineering: Entwickeln Sie Plattformfunktionen für die Verwaltung von NVIDIA-GPU-Konfigurationen der neuesten Generation (H100, H200, B200, B300), einschließlich GPU-Ressourcenmanagement, mandantenfähige Isolation und Integration mit Computing-Orchestrierungssystemen.
•
Bare-Metal-Lebenszyklusmanagement: Erstellen Sie Automatisierung und Tools für das vollständige Lebenszyklusmanagement von Bare-Metal-Servern – von der ersten Bereitstellung und Konfiguration bis hin zu laufenden Vorgängen, Updates und Ressourcenneuzuweisung.
•
Leistungskritische Systeme: Optimieren Sie die Komponenten der Rechenplattform für einen hohen Durchsatz und eine Leistung mit geringer Latenz und stellen Sie sicher, dass Forschungsarbeitslasten in virtualisierten oder Container-Umgebungen nahezu Bare-Metal-Effizienz erreichen.
•
Plattform-APIs und -Integration: Entwickeln Sie robuste APIs und SDKs, die es Forschern ermöglichen, Rechenressourcen programmgesteuert bereitzustellen und zu verwalten und sich nahtlos in bestehende Arbeitsabläufe und Forschungsinfrastrukturen zu integrieren.
•
Beobachtbarkeit und Überwachung: Implementieren Sie umfassende Überwachungs- und Telemetriesysteme für Rechenressourcen und bieten Sie Einblick in die GPU-Virtualisierung, die Workload-Leistung und den Zustand der Infrastruktur.
•
Mandantenfähigkeit und Isolation: Erstellen Sie mandantenfähige Computing-Isolation, Sicherheitsgrenzen und Ressourcenkontingente der Enterprise-Klasse, die eine sichere gemeinsame Nutzung der GPU-Infrastruktur zwischen Teams und Organisationen ermöglichen.
Anforderungen
•
Erfahrung: Mehr als 5 Jahre in der Softwareentwicklung mit nachgewiesener Erfahrung im Aufbau von Rechenplattformen, Container-Orchestrierungssystemen oder verteilter Recheninfrastruktur für Produktionsumgebungen.
•
Compute Platform Engineering: Umfangreiche Erfahrung im Aufbau von Computing-Orchestrierung, Ressourcenplanung oder Workload-Management-Systemen im großen Maßstab.
•
Kubernetes & Container-Orchestrierung: Ausgeprägte Vertrautheit mit der Kubernetes-Architektur, Container-Orchestrierungskonzepten und Erfahrung in der Bereitstellung von Workloads in Kubernetes-Umgebungen. Verständnis von Pods, Bereitstellungen, Diensten und grundlegenden Kubernetes-Vorgängen.
•
Programmierkenntnisse: Erfahrung mit Go, C/C++, Python oder Rust für leistungskritische Komponenten wird sehr geschätzt.
•
Linux- und Systemprogrammierung: Umfangreiche Erfahrung mit Linux in Produktionsumgebungen, einschließlich Systemen zur Programmierung, Leistungsoptimierung und Ressourcenverwaltung auf niedriger Ebene.
•
Virtualisierung und Container: Tiefe Kenntnisse über Virtualisierungstechnologien (KVM, Xen), Container-Laufzeiten und Orchestrierungsplattformen.
•
GPU-Computing-Grundlagen: Verständnis von GPU-Architekturen, CUDA-Programmierung (wo/wann erforderlich) und GPU-Ressourcenmanagement – oder eine ausgeprägte Fähigkeit, schnell zu lernen.
•
Bare-Metal-Infrastruktur: Erfahrung mit Bare-Metal-Bereitstellung, Out-of-Band-Verwaltungssystemen und Hardware-Abstraktionsschichten.
•
Problemlösung und Architektur: Nachgewiesene Fähigkeit, komplexe Leistungs- und Skalierbarkeitsherausforderungen zu lösen und gleichzeitig pragmatischen Versand mit einer guten langfristigen Architektur in Einklang zu bringen.
•
Autonomie und Kommunikation: Bequemes Navigieren in Unklarheiten, gemeinsame Definition von Anforderungen und Kommunikation technischer Diskussionen durch klare Dokumentation.
•
Engagement für Wachstum: Wachstumsmentalität mit kontinuierlichem Fokus auf Lernen und berufliche Weiterentwicklung.
Bevorzugte Qualifikationen
• Hintergrundbereitstellung oder Verwaltung von Forschungscomputerumgebungen (Kubernetes, SLURM oder HPC-Cluster)
• Erfahrung mit GPU-Virtualisierungstechnologien (SR-IOV, NVIDIA vGPU) und mandantenfähiger GPU-Freigabe
• Hintergrundinformationen zu Container-Orchestrierungsplattformen mit benutzerdefinierter Planung oder Ressourcenverwaltung
• Kenntnisse über Hochleistungsnetzwerke für die GPU-Kommunikation (InfiniBand, RDMA, NVLink, NVSwitch)
• Vertrautheit mit KI/ML-Schulungsframeworks (PyTorch, TensorFlow) und deren Infrastrukturanforderungen
• Verständnis verteilter Trainingsmuster und GPU-Koordination mit mehreren Knoten
• Erfahrung im Aufbau von Infrastruktur für Forschungseinrichtungen, Labore oder technische Computerumgebungen …
Quelle: Himalaya (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Ihre Rolle:
Sie werden maßgeblich am Aufbau unserer GPU-beschleunigten Rechenplattform beteiligt sein, die verteiltes KI-Training und -Inferenz, groß angelegte Simulationen und rechnerische Forschungsarbeitslasten ermöglicht. In enger Zusammenarbeit mit dem Produkt, Ihren Plattformteammitgliedern und Infrastrukturspezialisten entwerfen und implementieren Sie die Computing-Orchestrierungsschicht, die GPU-Cluster, Bare-Metal-Bereitstellung und Ressourcenplanung verwaltet und es Forschern und Ingenieuren ermöglicht, programmgesteuert auf leistungsstarke Computing-Ressourcen mit Cloud-ähnlicher Einfachheit zuzugreifen.
Aufgabenbereiche
•
Computing-Orchestrierungssysteme: Entwerfen und bauen Sie skalierbare Computing-Orchestrierungsplattformen, die GPU-Cluster, die Bereitstellung von Bare-Metal-Servern und die Ressourcenzuweisung in gemeinsam gelegenen Infrastrukturumgebungen verwalten.
•
Ressourcenmanagement und -planung: Implementieren Sie intelligente Arbeitslastplanung, Ressourcenzuweisung und Optimierungsalgorithmen, die die GPU-Auslastung maximieren und gleichzeitig Leistungsgarantien für Forschungs- und Schulungsarbeitslasten aufrechterhalten.
•
Bereitstellung von Forschungsclustern: Entwerfen und implementieren Sie Systeme zur Bereitstellung und Verwaltung von Forschungscomputerumgebungen, einschließlich Kubernetes- und SLURM-Clustern, die eine automatisierte Bereitstellung, Ressourcenplanung und Workload-Orchestrierung für verteilte KI-Schulungen und HPC-Workloads ermöglichen.
•
GPU-Plattform-Engineering: Entwickeln Sie Plattformfunktionen für die Verwaltung von NVIDIA-GPU-Konfigurationen der neuesten Generation (H100, H200, B200, B300), einschließlich GPU-Ressourcenmanagement, mandantenfähige Isolation und Integration mit Computing-Orchestrierungssystemen.
•
Bare-Metal-Lebenszyklusmanagement: Erstellen Sie Automatisierung und Tools für das vollständige Lebenszyklusmanagement von Bare-Metal-Servern – von der ersten Bereitstellung und Konfiguration bis hin zu laufenden Vorgängen, Updates und Ressourcenneuzuweisung.
•
Leistungskritische Systeme: Optimieren Sie die Komponenten der Rechenplattform für einen hohen Durchsatz und eine Leistung mit geringer Latenz und stellen Sie sicher, dass Forschungsarbeitslasten in virtualisierten oder Container-Umgebungen nahezu Bare-Metal-Effizienz erreichen.
•
Plattform-APIs und -Integration: Entwickeln Sie robuste APIs und SDKs, die es Forschern ermöglichen, Rechenressourcen programmgesteuert bereitzustellen und zu verwalten und sich nahtlos in bestehende Arbeitsabläufe und Forschungsinfrastrukturen zu integrieren.
•
Beobachtbarkeit und Überwachung: Implementieren Sie umfassende Überwachungs- und Telemetriesysteme für Rechenressourcen und bieten Sie Einblick in die GPU-Virtualisierung, die Workload-Leistung und den Zustand der Infrastruktur.
•
Mandantenfähigkeit und Isolation: Erstellen Sie mandantenfähige Computing-Isolation, Sicherheitsgrenzen und Ressourcenkontingente der Enterprise-Klasse, die eine sichere gemeinsame Nutzung der GPU-Infrastruktur zwischen Teams und Organisationen ermöglichen.
Anforderungen
•
Erfahrung: Mehr als 5 Jahre in der Softwareentwicklung mit nachgewiesener Erfahrung im Aufbau von Rechenplattformen, Container-Orchestrierungssystemen oder verteilter Recheninfrastruktur für Produktionsumgebungen.
•
Compute Platform Engineering: Umfangreiche Erfahrung im Aufbau von Computing-Orchestrierung, Ressourcenplanung oder Workload-Management-Systemen im großen Maßstab.
•
Kubernetes & Container-Orchestrierung: Ausgeprägte Vertrautheit mit der Kubernetes-Architektur, Container-Orchestrierungskonzepten und Erfahrung in der Bereitstellung von Workloads in Kubernetes-Umgebungen. Verständnis von Pods, Bereitstellungen, Diensten und grundlegenden Kubernetes-Vorgängen.
•
Programmierkenntnisse: Erfahrung mit Go, C/C++, Python oder Rust für leistungskritische Komponenten wird sehr geschätzt.
•
Linux- und Systemprogrammierung: Umfangreiche Erfahrung mit Linux in Produktionsumgebungen, einschließlich Systemen zur Programmierung, Leistungsoptimierung und Ressourcenverwaltung auf niedriger Ebene.
•
Virtualisierung und Container: Tiefe Kenntnisse über Virtualisierungstechnologien (KVM, Xen), Container-Laufzeiten und Orchestrierungsplattformen.
•
GPU-Computing-Grundlagen: Verständnis von GPU-Architekturen, CUDA-Programmierung (wo/wann erforderlich) und GPU-Ressourcenmanagement – oder eine ausgeprägte Fähigkeit, schnell zu lernen.
•
Bare-Metal-Infrastruktur: Erfahrung mit Bare-Metal-Bereitstellung, Out-of-Band-Verwaltungssystemen und Hardware-Abstraktionsschichten.
•
Problemlösung und Architektur: Nachgewiesene Fähigkeit, komplexe Leistungs- und Skalierbarkeitsherausforderungen zu lösen und gleichzeitig pragmatischen Versand mit einer guten langfristigen Architektur in Einklang zu bringen.
•
Autonomie und Kommunikation: Bequemes Navigieren in Unklarheiten, gemeinsame Definition von Anforderungen und Kommunikation technischer Diskussionen durch klare Dokumentation.
•
Engagement für Wachstum: Wachstumsmentalität mit kontinuierlichem Fokus auf Lernen und berufliche Weiterentwicklung.
Bevorzugte Qualifikationen
• Hintergrundbereitstellung oder Verwaltung von Forschungscomputerumgebungen (Kubernetes, SLURM oder HPC-Cluster)
• Erfahrung mit GPU-Virtualisierungstechnologien (SR-IOV, NVIDIA vGPU) und mandantenfähiger GPU-Freigabe
• Hintergrundinformationen zu Container-Orchestrierungsplattformen mit benutzerdefinierter Planung oder Ressourcenverwaltung
• Kenntnisse über Hochleistungsnetzwerke für die GPU-Kommunikation (InfiniBand, RDMA, NVLink, NVSwitch)
• Vertrautheit mit KI/ML-Schulungsframeworks (PyTorch, TensorFlow) und deren Infrastrukturanforderungen
• Verständnis verteilter Trainingsmuster und GPU-Koordination mit mehreren Knoten
• Erfahrung im Aufbau von Infrastruktur für Forschungseinrichtungen, Labore oder technische Computerumgebungen …
Quelle: Himalaya (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Moonlite
Inserat bereitgestellt von Moonlite.