Job
Aus Partner-Feed
Mitarbeiter von HPC Systems Software Engineer
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Ja
- Unternehmen
- Senior Manager, Internal Communications - Greenhouse
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Über Nscale
Nscale ist die für KI entwickelte GPU-Cloud. Wir bieten kostengünstige, leistungsstarke Infrastruktur für KI-Start-ups und große Unternehmenskunden. Nscale ermöglicht KI-fokussierten Unternehmen, überlegene Ergebnisse zu erzielen, indem es die Komplexität der KI-Entwicklung reduziert. Unsere GPU-Cloud stärkt die technischen Fähigkeiten und unterstützt direkt strategische Geschäftsergebnisse, einschließlich Kostenmanagement, schnelle Innovation und Umweltverantwortung.
Wir leben von einer Kultur der unermüdlichen Innovation, Eigenverantwortung und Verantwortung, in der jedes Teammitglied stolz auf seine Arbeit ist und diese mit Exzellenz und Dringlichkeit vorantreibt. Als Nscaler bauen Sie Vertrauen durch Offenheit und Transparenz auf, bei der jeder dazu inspiriert wird, sein Bestes zu geben. Wenn Sie unserem Team beitreten, tragen Sie zum Aufbau der Technologie bei, die die Zukunft vorantreibt.
Über die Rolle
Wir stellen einen angestellten HPC-Systemsoftware-Ingenieur ein, um die technische Ausrichtung und Entwicklung einer Kerndomäne der HPC-Plattform bei Nscale zu definieren. In dieser Rolle agieren Sie über ein einzelnes Team hinaus und gestalten mit, wie mehrere Teams Slurm-basierte Funktionen innerhalb der umfassenderen cloudnativen Plattform von Nscale aufbauen, automatisieren und ausführen. Sie arbeiten über technische Grenzen hinweg, um Architektur, Schnittstellen, Lebenszyklusmodelle und Betriebsansätze kohärent zu gestalten, und arbeiten dabei eng mit Teams zusammen, die an Plattform-Tools, Infrastruktur-APIs, Identitätssystemen und an Kubernetes angrenzenden Systemen arbeiten.
Dies ist eine hochwirksame Position auf Mitarbeiterebene für jemanden, der fundierte praktische Softwareentwicklung mit ausgeprägtem Systemurteil verbindet. Ihre Arbeit wird dazu beitragen, sicherzustellen, dass die HPC-Dienste von Nscale robust, unterstützbar und wartbar sind, und gleichzeitig durch gemeinsame Muster, wiederverwendbare Implementierungen und eine klare technische Richtung für mehrdeutige, geschäftskritische Problembereiche eine Hebelwirkung erzielen.
Was Sie tun werden
Domänenarchitektur und technische Leitung
● Besitzen und entwickeln Sie die technische Richtung für eine definierte HPC-Systemdomäne, wie z. B. Slurm-Plattformarchitektur, Scheduler-Integrationen, Cluster-Lebenszyklus, Workload-Umgebungen oder Service-Automatisierung.
● Treffen Sie Architekturentscheidungen, die Softwarequalität, betriebliche Realitäten, Kundenbedürfnisse und langfristige Wartbarkeit in Einklang bringen.
● Definieren Sie, wie bewährte Slurm-Implementierungen gepackt, automatisiert und als Service bereitgestellt werden sollen.
● Beseitigen Sie Unklarheiten in Bezug auf Eigentum, Schnittstellen, Lebenszyklusgrenzen und Betriebsmodelle zwischen den Teams.
● Als technischer Eskalationspunkt für die komplexesten Probleme innerhalb der Domäne fungieren.
Teamübergreifende technische Nutzung
● Etablieren Sie gemeinsame Muster für Automatisierung, Service-Lifecycle-Management, Beobachtbarkeit, Zuverlässigkeit und Unterstützbarkeit auf der gesamten HPC-Plattform.
● Teamübergreifendes Design für Integrationen zwischen Slurm, Kubernetes-angrenzenden Systemen, Infrastruktur-APIs, Identitätssystemen und Plattform-Tools vorantreiben.
● Erstellen Sie wiederverwendbare Module, Automatisierung, Bereitstellungsmuster und Referenzimplementierungen, die den technischen Nutzen erhöhen.
● Identität und Korrektur vermeidbarer technischer Divergenzen, Doppelarbeit und fragiler Betriebsmodelle
● Stellen Sie sicher, dass Domänendesigns die Realitäten von GPU-Planung, HPC-Netzwerken, Leistungsisolation und Produktionsabläufen widerspiegeln.
Lieferung, Zuverlässigkeit und Einfluss
● Leiten Sie technisch wichtige Initiativen, die 2–4 Teams oder einen definierten HPC-Plattformbereich umfassen.
● Entsperrte Bereitstellung durch Klärung der technischen Richtung und Reduzierung von Unklarheiten bei komplexen Systemdesignproblemen.
● Tragen Sie bei Bedarf praxisnah bei, um kritische Arbeiten zu minimieren oder zu beschleunigen.
● Beeinflussen Sie Entwicklungsteams ohne formelle Autorität durch starkes Urteilsvermögen, Designklarheit und praktische Lösungen.
● Arbeiten Sie mit benachbarten Cloud-nativen Softwareentwicklern zusammen, damit HPC-Implementierungen auf gemeinsamen Plattformmustern aufbauen und nicht auf separaten.
KPIs
● Technische Leitung für eine definierte HPC-Domäne
● Bereitstellung kritischer Initiativen in 2–4 Teams
● Reduzierung technischer Divergenz und Doppelaufwand
● Zuverlässigkeit und Unterstützbarkeit von Slurm-basierten HPC-Diensten
Über Dich
● Umfangreiche Erfahrung im Entwerfen und Erstellen von Produktionssoftware und Automatisierung für HPC-Systeme, insbesondere Slurm-basierte Umgebungen.
● Starke Erfolgsbilanz beim Schreiben wartbarer, testbarer und belastbarer Software in Go, Python oder ähnlichen Sprachen.
● Nachgewiesene Fähigkeit, die technische Richtung für eine Domäne zu definieren, die mehrere Teams oder Dienste umfasst.
● Ausgeprägtes Verständnis der Slurm-Interna, des Scheduler-Verhaltens, von Cluster-Lebenszyklusproblemen und betrieblichen Kompromissen.
● Ausgeprägtes praktisches Verständnis von GPU-gestützter Infrastruktur und HPC-Netzwerken, einschließlich InfiniBand, RoCE, RDMA und leistungsempfindlichen Workload-Eigenschaften.
● Erfahrung in der Integration von HPC-Systemen mit Cloud-nativen Plattformen, APIs oder Servicebereitstellungsmodellen.
● Erleben Sie die Schaffung technischer Vorteile durch Standards, wiederverwendbare Muster, gemeinsame Tools und architektonische Klarheit.
● Starkes Urteilsvermögen bei der Balance zwischen kurzfristiger Bereitstellung und langfristiger Plattformgesundheit und -unterstützbarkeit.
● Starke schriftliche und mündliche Kommunikationsfähigkeiten mit der Fähigkeit, mehrere Teams auf eine kohärente technische Ausrichtung auszurichten.
● Erfahrungen mit anderen Schedulern oder Batch-Systemen wie Kueue sind wertvoll.
Was wir Ihnen bieten können
Sie haben die Möglichkeit, die Betriebsstandards hinter einer KI der nächsten Generation mitzugestalten
Cloud-Plattform, die an komplexen Infrastrukturherausforderungen mit echter Eigenverantwortung und Wirkung arbeitet. Dies
ist eine Chance, eine bedeutende Rolle bei der Skalierung eines leistungsstarken, nachhaltigen Rechenzentrums zu spielen
Abläufe in einem schnelllebigen Umfeld
Erklärung zur Chancengleichheit…
Quelle: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/senior-manager-internal-communications-greenhouse/staff-hpc-systems-software-engineer-290428)
Nscale ist die für KI entwickelte GPU-Cloud. Wir bieten kostengünstige, leistungsstarke Infrastruktur für KI-Start-ups und große Unternehmenskunden. Nscale ermöglicht KI-fokussierten Unternehmen, überlegene Ergebnisse zu erzielen, indem es die Komplexität der KI-Entwicklung reduziert. Unsere GPU-Cloud stärkt die technischen Fähigkeiten und unterstützt direkt strategische Geschäftsergebnisse, einschließlich Kostenmanagement, schnelle Innovation und Umweltverantwortung.
Wir leben von einer Kultur der unermüdlichen Innovation, Eigenverantwortung und Verantwortung, in der jedes Teammitglied stolz auf seine Arbeit ist und diese mit Exzellenz und Dringlichkeit vorantreibt. Als Nscaler bauen Sie Vertrauen durch Offenheit und Transparenz auf, bei der jeder dazu inspiriert wird, sein Bestes zu geben. Wenn Sie unserem Team beitreten, tragen Sie zum Aufbau der Technologie bei, die die Zukunft vorantreibt.
Über die Rolle
Wir stellen einen angestellten HPC-Systemsoftware-Ingenieur ein, um die technische Ausrichtung und Entwicklung einer Kerndomäne der HPC-Plattform bei Nscale zu definieren. In dieser Rolle agieren Sie über ein einzelnes Team hinaus und gestalten mit, wie mehrere Teams Slurm-basierte Funktionen innerhalb der umfassenderen cloudnativen Plattform von Nscale aufbauen, automatisieren und ausführen. Sie arbeiten über technische Grenzen hinweg, um Architektur, Schnittstellen, Lebenszyklusmodelle und Betriebsansätze kohärent zu gestalten, und arbeiten dabei eng mit Teams zusammen, die an Plattform-Tools, Infrastruktur-APIs, Identitätssystemen und an Kubernetes angrenzenden Systemen arbeiten.
Dies ist eine hochwirksame Position auf Mitarbeiterebene für jemanden, der fundierte praktische Softwareentwicklung mit ausgeprägtem Systemurteil verbindet. Ihre Arbeit wird dazu beitragen, sicherzustellen, dass die HPC-Dienste von Nscale robust, unterstützbar und wartbar sind, und gleichzeitig durch gemeinsame Muster, wiederverwendbare Implementierungen und eine klare technische Richtung für mehrdeutige, geschäftskritische Problembereiche eine Hebelwirkung erzielen.
Was Sie tun werden
Domänenarchitektur und technische Leitung
● Besitzen und entwickeln Sie die technische Richtung für eine definierte HPC-Systemdomäne, wie z. B. Slurm-Plattformarchitektur, Scheduler-Integrationen, Cluster-Lebenszyklus, Workload-Umgebungen oder Service-Automatisierung.
● Treffen Sie Architekturentscheidungen, die Softwarequalität, betriebliche Realitäten, Kundenbedürfnisse und langfristige Wartbarkeit in Einklang bringen.
● Definieren Sie, wie bewährte Slurm-Implementierungen gepackt, automatisiert und als Service bereitgestellt werden sollen.
● Beseitigen Sie Unklarheiten in Bezug auf Eigentum, Schnittstellen, Lebenszyklusgrenzen und Betriebsmodelle zwischen den Teams.
● Als technischer Eskalationspunkt für die komplexesten Probleme innerhalb der Domäne fungieren.
Teamübergreifende technische Nutzung
● Etablieren Sie gemeinsame Muster für Automatisierung, Service-Lifecycle-Management, Beobachtbarkeit, Zuverlässigkeit und Unterstützbarkeit auf der gesamten HPC-Plattform.
● Teamübergreifendes Design für Integrationen zwischen Slurm, Kubernetes-angrenzenden Systemen, Infrastruktur-APIs, Identitätssystemen und Plattform-Tools vorantreiben.
● Erstellen Sie wiederverwendbare Module, Automatisierung, Bereitstellungsmuster und Referenzimplementierungen, die den technischen Nutzen erhöhen.
● Identität und Korrektur vermeidbarer technischer Divergenzen, Doppelarbeit und fragiler Betriebsmodelle
● Stellen Sie sicher, dass Domänendesigns die Realitäten von GPU-Planung, HPC-Netzwerken, Leistungsisolation und Produktionsabläufen widerspiegeln.
Lieferung, Zuverlässigkeit und Einfluss
● Leiten Sie technisch wichtige Initiativen, die 2–4 Teams oder einen definierten HPC-Plattformbereich umfassen.
● Entsperrte Bereitstellung durch Klärung der technischen Richtung und Reduzierung von Unklarheiten bei komplexen Systemdesignproblemen.
● Tragen Sie bei Bedarf praxisnah bei, um kritische Arbeiten zu minimieren oder zu beschleunigen.
● Beeinflussen Sie Entwicklungsteams ohne formelle Autorität durch starkes Urteilsvermögen, Designklarheit und praktische Lösungen.
● Arbeiten Sie mit benachbarten Cloud-nativen Softwareentwicklern zusammen, damit HPC-Implementierungen auf gemeinsamen Plattformmustern aufbauen und nicht auf separaten.
KPIs
● Technische Leitung für eine definierte HPC-Domäne
● Bereitstellung kritischer Initiativen in 2–4 Teams
● Reduzierung technischer Divergenz und Doppelaufwand
● Zuverlässigkeit und Unterstützbarkeit von Slurm-basierten HPC-Diensten
Über Dich
● Umfangreiche Erfahrung im Entwerfen und Erstellen von Produktionssoftware und Automatisierung für HPC-Systeme, insbesondere Slurm-basierte Umgebungen.
● Starke Erfolgsbilanz beim Schreiben wartbarer, testbarer und belastbarer Software in Go, Python oder ähnlichen Sprachen.
● Nachgewiesene Fähigkeit, die technische Richtung für eine Domäne zu definieren, die mehrere Teams oder Dienste umfasst.
● Ausgeprägtes Verständnis der Slurm-Interna, des Scheduler-Verhaltens, von Cluster-Lebenszyklusproblemen und betrieblichen Kompromissen.
● Ausgeprägtes praktisches Verständnis von GPU-gestützter Infrastruktur und HPC-Netzwerken, einschließlich InfiniBand, RoCE, RDMA und leistungsempfindlichen Workload-Eigenschaften.
● Erfahrung in der Integration von HPC-Systemen mit Cloud-nativen Plattformen, APIs oder Servicebereitstellungsmodellen.
● Erleben Sie die Schaffung technischer Vorteile durch Standards, wiederverwendbare Muster, gemeinsame Tools und architektonische Klarheit.
● Starkes Urteilsvermögen bei der Balance zwischen kurzfristiger Bereitstellung und langfristiger Plattformgesundheit und -unterstützbarkeit.
● Starke schriftliche und mündliche Kommunikationsfähigkeiten mit der Fähigkeit, mehrere Teams auf eine kohärente technische Ausrichtung auszurichten.
● Erfahrungen mit anderen Schedulern oder Batch-Systemen wie Kueue sind wertvoll.
Was wir Ihnen bieten können
Sie haben die Möglichkeit, die Betriebsstandards hinter einer KI der nächsten Generation mitzugestalten
Cloud-Plattform, die an komplexen Infrastrukturherausforderungen mit echter Eigenverantwortung und Wirkung arbeitet. Dies
ist eine Chance, eine bedeutende Rolle bei der Skalierung eines leistungsstarken, nachhaltigen Rechenzentrums zu spielen
Abläufe in einem schnelllebigen Umfeld
Erklärung zur Chancengleichheit…
Quelle: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/senior-manager-internal-communications-greenhouse/staff-hpc-systems-software-engineer-290428)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Senior Manager, Internal Communications - Greenhouse
Inserat bereitgestellt von Senior Manager, Internal Communications - Greenhouse.