Job
Aus Partner-Feed
Vorwärts eingesetzter Inferenzingenieur
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- Tensordyne
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Über Tensordyne
Tensordyne baut eine neue Klasse von KI-Inferenzsystemen auf, die für den leistungsstarken und energieeffizienten Einsatz der weltweit anspruchsvollsten generativen KI-Workloads konzipiert sind.
Unsere Plattform kombiniert speziell entwickeltes Silizium, neue KI-Mathematik, optimierte Scale-up-Netzwerke und Speicherarchitektur in einem eng integrierten System, das speziell für groß angelegte KI-Inferenzen entwickelt wurde. Wir arbeiten mit Hyperscalern, Neoclouds, Pioniermodellentwicklern, Unternehmen und Infrastrukturpartnern zusammen, die an der Spitze der KI stehen.
Während Tensordyne von der Systementwicklung zur Siliziumbereitstellung, Kundenvalidierung, Betabereitstellung und Produktionseinführung übergeht, bauen wir die technische Kundenorganisation auf, die direkt zwischen unseren Engineering-Teams und den Unternehmen liegt, die die Plattform bereitstellen.
Rollenzusammenfassung
Wir sind auf der Suche nach einem Forward Deployed Inference Engineer, der fundierte KI-Systemkenntnisse mit ausgeprägtem Kundengespür verbindet. Diese Person ist verantwortlich für den Weg von einer Kundenarbeitslast oder Modellanfrage zu einem technischen Ergebnis und bei Bedarf zu einem optimierten Modell, das erfolgreich auf Tensordyne-Hardware und -Software läuft.
Die Rolle liegt an der Schnittstelle zwischen Modellarchitektur, Inferenzleistung, Systemoptimierung, Entwicklertools und Kundenbereitstellung. Sie arbeiten praktisch mit der Technik zusammen und fungieren gleichzeitig als technische Brücke zu Produkt, BizDev, Vertrieb und Kunden.
Was Sie tun werden
• Verwandeln Sie Kunden-Workloads durch Profiling und Benchmarking in schnelle, glaubwürdige Leistungsantworten. Definieren Sie relevante KPIs, vergleichen Sie sie mit Wettbewerbsbasislinien und halten Sie unsere Bewertungsmethodik anhand externer Benchmarks auf dem neuesten Stand.
• Modellaktivierung und -optimierung: Konvertieren und Hochladen von Kundenmodellen auf dem Tensordyne-Stack, Validieren der numerischen Qualität, Identifizieren von Leistungsengpässen und Arbeiten mit Compiler-, Laufzeit-, Kernel- und Systemteams zur Verbesserung der Ergebnisse.
• Bereitstellung/Forward Engineering: Arbeiten Sie direkt mit Kunden und Partnern an technischen PoCs, Integration, Bereitstellung und Debugging; Übersetzen Sie Anforderungen in messbare Akzeptanzkriterien für Qualität, Latenz, Durchsatz und andere relevante KPIs.
• Verfolgen Sie die Profilierungs-zu-Hardware-Genauigkeit, indem Sie die Profilierungs-/Simulationsergebnisse kontinuierlich mit tatsächlichen Hardware-Bereitstellungen vergleichen, wesentliche Lücken erklären und den Eigentümerteams fehlende Funktionen im Compiler, SDK, Inferenzserver, der KV-Cache-Verwaltung oder angrenzenden Systemen melden.
• Verwandeln Sie wiederholte kundenspezifische Erkenntnisse in wiederverwendbare Tools, Dokumentationen, Benchmarks oder Produktverbesserungen.
Kernqualifikationen
• Umfangreiche praktische Erfahrung mit KI-Modellen und Inferenzsystemen, insbesondere dichten und MoE-LLMs (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM) und VLM, Sprach- und Diffusionsmodellen.
• Starke Python- und PyTorch-Kenntnisse und die Fähigkeit, Modellcode zu verstehen und zu ändern.
• Erleben Sie Profiling, Benchmarking oder die Optimierung von Modellinferenzen und Überlegungen zu Latenz, Durchsatz, Speicher und Auslastung.
• Starke Problemlösungs- und Kommunikationsfähigkeiten mit der Fähigkeit, mehrdeutige technische Probleme über Teamgrenzen hinweg voranzutreiben.
• Kenntnisse im Umgang mit KI-gestützten Entwicklertools (z. B. Claude Code, Cursor).
Starke Pluspunkte
• Erfahrung mit LLM-Bereitstellungs- und Bereitstellungsstacks wie vLLM, SGLang oder ähnlichen Systemen.
• Erfahrung in der direkten Zusammenarbeit mit Kunden oder externen technischen Partnern.
• Erfahrung beim Hochfahren von Modellen auf neuen Beschleunigern oder nicht standardmäßiger Hardware, einschließlich Leistungsdebugging über Framework-/Laufzeit-/Hardware-Grenzen hinweg.
• Praktische Erfahrung mit Produktionsinferenztechniken oder -umgebungen wie Quantisierung, verteilter Inferenz oder Kubernetes.
• Erfahrung im Navigieren und Mitwirken in Rust-Codebasen.
Tensordyne-Werte
• Denken Sie groß. Verfolgen Sie ehrgeizige technische und geschäftliche Ziele.
• Streben Sie nach Exzellenz. Bei allem, was wir bauen und liefern, kommt es auf Qualität an.
• Besitzen Sie es und erledigen Sie es. Übernehmen Sie Verantwortung und treiben Sie Ergebnisse voran.
• Arbeiten Sie mit Integrität. Seien Sie direkt, transparent und respektvoll.
• Als Team gewinnen. Machen Sie die Menschen um Sie herum effektiver.
• Wertschätzen Sie unterschiedliche Perspektiven. Die stärksten Teams hinterfragen Annahmen und bringen unterschiedliche Erfahrungen in schwierige Probleme ein.
Tensordyne ist ein Arbeitgeber, der Chancengleichheit fördert. Wir glauben, dass vielfältige Teams besser in der Lage sind, komplexe Probleme zu lösen und außergewöhnliche Technologien zu entwickeln. Alle qualifizierten Bewerber werden für eine Anstellung berücksichtigt, unabhängig von Alter, Hautfarbe, Geschlechtsidentität oder -ausdruck, Familienstand, nationaler Herkunft, Behinderung, geschütztem Veteranenstatus, Rasse, Religion, Schwangerschaft, sexueller Orientierung oder anderen durch geltende Gesetze, Vorschriften und Verordnungen geschützten Merkmalen.
Hinweis für Personalvermittlungsagenturen: Bitte kontaktieren Sie bezüglich dieser Stelle keine Mitarbeiter oder Führungskräfte von Tensordyne. Wir akzeptieren keine unaufgeforderten Lebensläufe von Agenturen und sind nicht für Gebühren verantwortlich, die mit unaufgeforderten Einreichungen verbunden sind.
Weitere englischsprachige Jobs in Deutschland finden Sie auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-481912)
Tensordyne baut eine neue Klasse von KI-Inferenzsystemen auf, die für den leistungsstarken und energieeffizienten Einsatz der weltweit anspruchsvollsten generativen KI-Workloads konzipiert sind.
Unsere Plattform kombiniert speziell entwickeltes Silizium, neue KI-Mathematik, optimierte Scale-up-Netzwerke und Speicherarchitektur in einem eng integrierten System, das speziell für groß angelegte KI-Inferenzen entwickelt wurde. Wir arbeiten mit Hyperscalern, Neoclouds, Pioniermodellentwicklern, Unternehmen und Infrastrukturpartnern zusammen, die an der Spitze der KI stehen.
Während Tensordyne von der Systementwicklung zur Siliziumbereitstellung, Kundenvalidierung, Betabereitstellung und Produktionseinführung übergeht, bauen wir die technische Kundenorganisation auf, die direkt zwischen unseren Engineering-Teams und den Unternehmen liegt, die die Plattform bereitstellen.
Rollenzusammenfassung
Wir sind auf der Suche nach einem Forward Deployed Inference Engineer, der fundierte KI-Systemkenntnisse mit ausgeprägtem Kundengespür verbindet. Diese Person ist verantwortlich für den Weg von einer Kundenarbeitslast oder Modellanfrage zu einem technischen Ergebnis und bei Bedarf zu einem optimierten Modell, das erfolgreich auf Tensordyne-Hardware und -Software läuft.
Die Rolle liegt an der Schnittstelle zwischen Modellarchitektur, Inferenzleistung, Systemoptimierung, Entwicklertools und Kundenbereitstellung. Sie arbeiten praktisch mit der Technik zusammen und fungieren gleichzeitig als technische Brücke zu Produkt, BizDev, Vertrieb und Kunden.
Was Sie tun werden
• Verwandeln Sie Kunden-Workloads durch Profiling und Benchmarking in schnelle, glaubwürdige Leistungsantworten. Definieren Sie relevante KPIs, vergleichen Sie sie mit Wettbewerbsbasislinien und halten Sie unsere Bewertungsmethodik anhand externer Benchmarks auf dem neuesten Stand.
• Modellaktivierung und -optimierung: Konvertieren und Hochladen von Kundenmodellen auf dem Tensordyne-Stack, Validieren der numerischen Qualität, Identifizieren von Leistungsengpässen und Arbeiten mit Compiler-, Laufzeit-, Kernel- und Systemteams zur Verbesserung der Ergebnisse.
• Bereitstellung/Forward Engineering: Arbeiten Sie direkt mit Kunden und Partnern an technischen PoCs, Integration, Bereitstellung und Debugging; Übersetzen Sie Anforderungen in messbare Akzeptanzkriterien für Qualität, Latenz, Durchsatz und andere relevante KPIs.
• Verfolgen Sie die Profilierungs-zu-Hardware-Genauigkeit, indem Sie die Profilierungs-/Simulationsergebnisse kontinuierlich mit tatsächlichen Hardware-Bereitstellungen vergleichen, wesentliche Lücken erklären und den Eigentümerteams fehlende Funktionen im Compiler, SDK, Inferenzserver, der KV-Cache-Verwaltung oder angrenzenden Systemen melden.
• Verwandeln Sie wiederholte kundenspezifische Erkenntnisse in wiederverwendbare Tools, Dokumentationen, Benchmarks oder Produktverbesserungen.
Kernqualifikationen
• Umfangreiche praktische Erfahrung mit KI-Modellen und Inferenzsystemen, insbesondere dichten und MoE-LLMs (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM) und VLM, Sprach- und Diffusionsmodellen.
• Starke Python- und PyTorch-Kenntnisse und die Fähigkeit, Modellcode zu verstehen und zu ändern.
• Erleben Sie Profiling, Benchmarking oder die Optimierung von Modellinferenzen und Überlegungen zu Latenz, Durchsatz, Speicher und Auslastung.
• Starke Problemlösungs- und Kommunikationsfähigkeiten mit der Fähigkeit, mehrdeutige technische Probleme über Teamgrenzen hinweg voranzutreiben.
• Kenntnisse im Umgang mit KI-gestützten Entwicklertools (z. B. Claude Code, Cursor).
Starke Pluspunkte
• Erfahrung mit LLM-Bereitstellungs- und Bereitstellungsstacks wie vLLM, SGLang oder ähnlichen Systemen.
• Erfahrung in der direkten Zusammenarbeit mit Kunden oder externen technischen Partnern.
• Erfahrung beim Hochfahren von Modellen auf neuen Beschleunigern oder nicht standardmäßiger Hardware, einschließlich Leistungsdebugging über Framework-/Laufzeit-/Hardware-Grenzen hinweg.
• Praktische Erfahrung mit Produktionsinferenztechniken oder -umgebungen wie Quantisierung, verteilter Inferenz oder Kubernetes.
• Erfahrung im Navigieren und Mitwirken in Rust-Codebasen.
Tensordyne-Werte
• Denken Sie groß. Verfolgen Sie ehrgeizige technische und geschäftliche Ziele.
• Streben Sie nach Exzellenz. Bei allem, was wir bauen und liefern, kommt es auf Qualität an.
• Besitzen Sie es und erledigen Sie es. Übernehmen Sie Verantwortung und treiben Sie Ergebnisse voran.
• Arbeiten Sie mit Integrität. Seien Sie direkt, transparent und respektvoll.
• Als Team gewinnen. Machen Sie die Menschen um Sie herum effektiver.
• Wertschätzen Sie unterschiedliche Perspektiven. Die stärksten Teams hinterfragen Annahmen und bringen unterschiedliche Erfahrungen in schwierige Probleme ein.
Tensordyne ist ein Arbeitgeber, der Chancengleichheit fördert. Wir glauben, dass vielfältige Teams besser in der Lage sind, komplexe Probleme zu lösen und außergewöhnliche Technologien zu entwickeln. Alle qualifizierten Bewerber werden für eine Anstellung berücksichtigt, unabhängig von Alter, Hautfarbe, Geschlechtsidentität oder -ausdruck, Familienstand, nationaler Herkunft, Behinderung, geschütztem Veteranenstatus, Rasse, Religion, Schwangerschaft, sexueller Orientierung oder anderen durch geltende Gesetze, Vorschriften und Verordnungen geschützten Merkmalen.
Hinweis für Personalvermittlungsagenturen: Bitte kontaktieren Sie bezüglich dieser Stelle keine Mitarbeiter oder Führungskräfte von Tensordyne. Wir akzeptieren keine unaufgeforderten Lebensläufe von Agenturen und sind nicht für Gebühren verantwortlich, die mit unaufgeforderten Einreichungen verbunden sind.
Weitere englischsprachige Jobs in Deutschland finden Sie auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.com/jobs/companies/tensordyne/forward-deployed-inference-engineer-munich-481912)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Tensordyne
Standort
München, Deutschland
Inserat bereitgestellt von Tensordyne.