Job
Aus Partner-Feed
Vorwärts eingesetzter Inferenzingenieur
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- tensordyne
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Über Tensordyne
Tensordyne baut eine neue Klasse von KI-Inferenzsystemen auf, die für den leistungsstarken und energieeffizienten Einsatz der weltweit anspruchsvollsten generativen KI-Workloads konzipiert sind.
Unsere Plattform kombiniert speziell entwickeltes Silizium, neue KI-Mathematik, optimierte Scale-up-Netzwerke und Speicherarchitektur in einem eng integrierten System, das speziell für groß angelegte KI-Inferenzen entwickelt wurde. Wir arbeiten mit Hyperscalern, Neoclouds, Pioniermodellentwicklern, Unternehmen und Infrastrukturpartnern zusammen, die an der Spitze der KI stehen.
Während Tensordyne von der Systementwicklung zur Siliziumbereitstellung, Kundenvalidierung, Betabereitstellung und Produktionseinführung übergeht, bauen wir die technische Kundenorganisation auf, die direkt zwischen unseren Engineering-Teams und den Unternehmen liegt, die die Plattform bereitstellen.
Rollenzusammenfassung
Wir sind auf der Suche nach einem Forward Deployed Inference Engineer, der fundierte KI-Systemkenntnisse mit ausgeprägtem Kundengespür verbindet. Diese Person ist verantwortlich für den Weg von einer Kundenarbeitslast oder Modellanfrage zu einem technischen Ergebnis und bei Bedarf zu einem optimierten Modell, das erfolgreich auf Tensordyne-Hardware und -Software läuft.
Die Rolle liegt an der Schnittstelle zwischen Modellarchitektur, Inferenzleistung, Systemoptimierung, Entwicklertools und Kundenbereitstellung. Sie arbeiten praktisch mit der Technik zusammen und fungieren gleichzeitig als technische Brücke zu Produkt, BizDev, Vertrieb und Kunden.
Was Sie tun werden
• Verwandeln Sie Kunden-Workloads durch Profiling und Benchmarking in schnelle, glaubwürdige Leistungsantworten. Definieren Sie relevante KPIs, vergleichen Sie sie mit Wettbewerbsbasislinien und halten Sie unsere Bewertungsmethodik anhand externer Benchmarks auf dem neuesten Stand.
• Modellaktivierung und -optimierung: Konvertieren und Hochladen von Kundenmodellen auf dem Tensordyne-Stack, Validieren der numerischen Qualität, Identifizieren von Leistungsengpässen und Arbeiten mit Compiler-, Laufzeit-, Kernel- und Systemteams zur Verbesserung der Ergebnisse.
• Bereitstellung/Forward Engineering: Arbeiten Sie direkt mit Kunden und Partnern an technischen PoCs, Integration, Bereitstellung und Debugging; Übersetzen Sie Anforderungen in messbare Akzeptanzkriterien für Qualität, Latenz, Durchsatz und andere relevante KPIs.
• Verfolgen Sie die Profilierungs-zu-Hardware-Genauigkeit, indem Sie die Profilierungs-/Simulationsergebnisse kontinuierlich mit tatsächlichen Hardware-Bereitstellungen vergleichen, wesentliche Lücken erklären und den Eigentümerteams fehlende Funktionen im Compiler, SDK, Inferenzserver, der KV-Cache-Verwaltung oder angrenzenden Systemen melden.
• Verwandeln Sie wiederholte kundenspezifische Erkenntnisse in wiederverwendbare Tools, Dokumentationen, Benchmarks oder Produktverbesserungen.
Kernqualifikationen
• Umfangreiche praktische Erfahrung mit KI-Modellen und Inferenzsystemen, insbesondere dichten und MoE-LLMs (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM) und VLM, Sprach- und Diffusionsmodellen.
• Starke Python- und PyTorch-Kenntnisse und die Fähigkeit, Modellcode zu verstehen und zu ändern.
• Erleben Sie Profiling, Benchmarking oder die Optimierung von Modellinferenzen und Überlegungen zu Latenz, Durchsatz, Speicher und Auslastung.
• Starke Problemlösungs- und Kommunikationsfähigkeiten mit der Fähigkeit, mehrdeutige technische Probleme über Teamgrenzen hinweg voranzutreiben.
• Kenntnisse im Umgang mit KI-gestützten Entwicklertools (z. B. Claude Code, Cursor).
Starke Pluspunkte
• Erfahrung mit LLM-Bereitstellungs- und Bereitstellungsstacks wie vLLM, SGLang oder ähnlichen Systemen.
• Erfahrung in der direkten Zusammenarbeit mit Kunden oder externen technischen Partnern.
• Erfahrung beim Hochfahren von Modellen auf neuen Beschleunigern oder nicht standardmäßiger Hardware, einschließlich Leistungsdebugging über Framework-/Laufzeit-/Hardware-Grenzen hinweg.
• Praktische Erfahrung mit Produktionsinferenztechniken oder -umgebungen wie Quantisierung, verteilter Inferenz oder Kubernetes.
• Erfahrung im Navigieren und Mitwirken in Rust-Codebasen.
Die Kultur von Tensordyne basierte auf den folgenden Werten
• Stellen Sie die Menschen an die erste Stelle. Wir haben nur Erfolg, wenn unsere Leute erfolgreich sind.
• Immer Ethik und Integrität; Offen, ehrlich und respektvoll gegenüber allen sein.
• Denken Sie groß. Seien Sie ehrgeizig und haben Sie mutige Ziele.
• Streben Sie nach Exzellenz. Qualität und Exzellenz zählen bei allem, was wir tun.
• Besitzen Sie es und erledigen Sie es. Ergebnisse zählen!
• Jede Person gemeinsam besser machen, als sie es als Einzelperson wäre.
• Akzeptieren Sie die Unterschiede des anderen und akzeptieren Sie, dass es Unterschiede geben wird.
Tensordyne ist ein Arbeitgeber, der Chancengleichheit fördert. Wir glauben, dass vielfältige Teams besser in der Lage sind, komplexe Probleme zu lösen und außergewöhnliche Technologien zu entwickeln. Alle qualifizierten Bewerber werden für eine Anstellung berücksichtigt, unabhängig von Alter, Hautfarbe, Geschlechtsidentität oder -ausdruck, Familienstand, nationaler Herkunft, Behinderung, geschütztem Veteranenstatus, Rasse, Religion, Schwangerschaft, sexueller Orientierung oder anderen durch geltende Gesetze, Vorschriften und Verordnungen geschützten Merkmalen.
Hinweis für Personalvermittlungsagenturen: Bitte kontaktieren Sie bezüglich dieser Stelle keine Mitarbeiter oder Führungskräfte von Tensordyne. Wir akzeptieren keine unaufgeforderten Lebensläufe von Agenturen und sind nicht für Gebühren verantwortlich, die mit unaufgeforderten Einreichungen verbunden sind.
Weitere englischsprachige Jobs in Deutschland finden Sie auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-202489)
Tensordyne baut eine neue Klasse von KI-Inferenzsystemen auf, die für den leistungsstarken und energieeffizienten Einsatz der weltweit anspruchsvollsten generativen KI-Workloads konzipiert sind.
Unsere Plattform kombiniert speziell entwickeltes Silizium, neue KI-Mathematik, optimierte Scale-up-Netzwerke und Speicherarchitektur in einem eng integrierten System, das speziell für groß angelegte KI-Inferenzen entwickelt wurde. Wir arbeiten mit Hyperscalern, Neoclouds, Pioniermodellentwicklern, Unternehmen und Infrastrukturpartnern zusammen, die an der Spitze der KI stehen.
Während Tensordyne von der Systementwicklung zur Siliziumbereitstellung, Kundenvalidierung, Betabereitstellung und Produktionseinführung übergeht, bauen wir die technische Kundenorganisation auf, die direkt zwischen unseren Engineering-Teams und den Unternehmen liegt, die die Plattform bereitstellen.
Rollenzusammenfassung
Wir sind auf der Suche nach einem Forward Deployed Inference Engineer, der fundierte KI-Systemkenntnisse mit ausgeprägtem Kundengespür verbindet. Diese Person ist verantwortlich für den Weg von einer Kundenarbeitslast oder Modellanfrage zu einem technischen Ergebnis und bei Bedarf zu einem optimierten Modell, das erfolgreich auf Tensordyne-Hardware und -Software läuft.
Die Rolle liegt an der Schnittstelle zwischen Modellarchitektur, Inferenzleistung, Systemoptimierung, Entwicklertools und Kundenbereitstellung. Sie arbeiten praktisch mit der Technik zusammen und fungieren gleichzeitig als technische Brücke zu Produkt, BizDev, Vertrieb und Kunden.
Was Sie tun werden
• Verwandeln Sie Kunden-Workloads durch Profiling und Benchmarking in schnelle, glaubwürdige Leistungsantworten. Definieren Sie relevante KPIs, vergleichen Sie sie mit Wettbewerbsbasislinien und halten Sie unsere Bewertungsmethodik anhand externer Benchmarks auf dem neuesten Stand.
• Modellaktivierung und -optimierung: Konvertieren und Hochladen von Kundenmodellen auf dem Tensordyne-Stack, Validieren der numerischen Qualität, Identifizieren von Leistungsengpässen und Arbeiten mit Compiler-, Laufzeit-, Kernel- und Systemteams zur Verbesserung der Ergebnisse.
• Bereitstellung/Forward Engineering: Arbeiten Sie direkt mit Kunden und Partnern an technischen PoCs, Integration, Bereitstellung und Debugging; Übersetzen Sie Anforderungen in messbare Akzeptanzkriterien für Qualität, Latenz, Durchsatz und andere relevante KPIs.
• Verfolgen Sie die Profilierungs-zu-Hardware-Genauigkeit, indem Sie die Profilierungs-/Simulationsergebnisse kontinuierlich mit tatsächlichen Hardware-Bereitstellungen vergleichen, wesentliche Lücken erklären und den Eigentümerteams fehlende Funktionen im Compiler, SDK, Inferenzserver, der KV-Cache-Verwaltung oder angrenzenden Systemen melden.
• Verwandeln Sie wiederholte kundenspezifische Erkenntnisse in wiederverwendbare Tools, Dokumentationen, Benchmarks oder Produktverbesserungen.
Kernqualifikationen
• Umfangreiche praktische Erfahrung mit KI-Modellen und Inferenzsystemen, insbesondere dichten und MoE-LLMs (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM) und VLM, Sprach- und Diffusionsmodellen.
• Starke Python- und PyTorch-Kenntnisse und die Fähigkeit, Modellcode zu verstehen und zu ändern.
• Erleben Sie Profiling, Benchmarking oder die Optimierung von Modellinferenzen und Überlegungen zu Latenz, Durchsatz, Speicher und Auslastung.
• Starke Problemlösungs- und Kommunikationsfähigkeiten mit der Fähigkeit, mehrdeutige technische Probleme über Teamgrenzen hinweg voranzutreiben.
• Kenntnisse im Umgang mit KI-gestützten Entwicklertools (z. B. Claude Code, Cursor).
Starke Pluspunkte
• Erfahrung mit LLM-Bereitstellungs- und Bereitstellungsstacks wie vLLM, SGLang oder ähnlichen Systemen.
• Erfahrung in der direkten Zusammenarbeit mit Kunden oder externen technischen Partnern.
• Erfahrung beim Hochfahren von Modellen auf neuen Beschleunigern oder nicht standardmäßiger Hardware, einschließlich Leistungsdebugging über Framework-/Laufzeit-/Hardware-Grenzen hinweg.
• Praktische Erfahrung mit Produktionsinferenztechniken oder -umgebungen wie Quantisierung, verteilter Inferenz oder Kubernetes.
• Erfahrung im Navigieren und Mitwirken in Rust-Codebasen.
Die Kultur von Tensordyne basierte auf den folgenden Werten
• Stellen Sie die Menschen an die erste Stelle. Wir haben nur Erfolg, wenn unsere Leute erfolgreich sind.
• Immer Ethik und Integrität; Offen, ehrlich und respektvoll gegenüber allen sein.
• Denken Sie groß. Seien Sie ehrgeizig und haben Sie mutige Ziele.
• Streben Sie nach Exzellenz. Qualität und Exzellenz zählen bei allem, was wir tun.
• Besitzen Sie es und erledigen Sie es. Ergebnisse zählen!
• Jede Person gemeinsam besser machen, als sie es als Einzelperson wäre.
• Akzeptieren Sie die Unterschiede des anderen und akzeptieren Sie, dass es Unterschiede geben wird.
Tensordyne ist ein Arbeitgeber, der Chancengleichheit fördert. Wir glauben, dass vielfältige Teams besser in der Lage sind, komplexe Probleme zu lösen und außergewöhnliche Technologien zu entwickeln. Alle qualifizierten Bewerber werden für eine Anstellung berücksichtigt, unabhängig von Alter, Hautfarbe, Geschlechtsidentität oder -ausdruck, Familienstand, nationaler Herkunft, Behinderung, geschütztem Veteranenstatus, Rasse, Religion, Schwangerschaft, sexueller Orientierung oder anderen durch geltende Gesetze, Vorschriften und Verordnungen geschützten Merkmalen.
Hinweis für Personalvermittlungsagenturen: Bitte kontaktieren Sie bezüglich dieser Stelle keine Mitarbeiter oder Führungskräfte von Tensordyne. Wir akzeptieren keine unaufgeforderten Lebensläufe von Agenturen und sind nicht für Gebühren verantwortlich, die mit unaufgeforderten Einreichungen verbunden sind.
Weitere englischsprachige Jobs in Deutschland finden Sie auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-202489)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: tensordyne
Standort
München, Deutschland
Inserat bereitgestellt von tensordyne.