Job
Aus Partner-Feed
KI-Forschungsingenieur (Kernel- und Inferenzoptimierung)
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- Jobgether
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Diese Position wird im Namen eines Partnerunternehmens ausgeschrieben, das alle Bewerbungen und nächsten Schritte verwaltet. Unser Partner sucht einen KI-Forschungsingenieur (Kernel- und Inferenzoptimierung) mit Sitz im Vereinigten Königreich.
Sie arbeiten an der Schnittstelle von KI-Forschung, Systemtechnik und Hochleistungsmodellinferenz.
Ihr Schwerpunkt liegt auf der Entwicklung und Optimierung modellbasierter Architekturen für fortschrittliche KI-Systeme in einer Reihe von Hardwareumgebungen.
Sie werden Herausforderungen in Bezug auf Latenz, Durchsatz, Speichereffizienz und Skalierbarkeit bewältigen, einschließlich der Bereitstellung auf ressourcenbeschränkten Mobil- und Edge-Geräten.
Die Rolle kombiniert praktische Forschung mit Low-Level-Engineering und gibt Ihnen die Möglichkeit, neuartige Inferenzstrategien und GPU-Kernel zu entwickeln.
Sie arbeiten mit komplexen Architekturen, die Text, Bild, Audio, Diffusionsmodelle und Vision-Transformatoren umfassen.
Ihre Arbeit umfasst strenges Benchmarking, Produktionstests und iterative Optimierung, um Forschungsergebnisse in messbare Leistungsverbesserungen umzusetzen.
Sie arbeiten mit funktionsübergreifenden Teams in einer hochtechnischen Remote-Umgebung zusammen und konzentrieren sich darauf, die Grenzen effizienter KI-Systeme zu erweitern.
Verantwortlichkeiten
• Entwerfen und implementieren Sie fortschrittliche Model-Serving-Architekturen, die für hohen Durchsatz, geringe Latenz und effiziente Speichernutzung optimiert sind.
• Entwickeln Sie Inferenzpipelines, die in verschiedenen Umgebungen, einschließlich ressourcenbeschränkten Mobilgeräten und Edge-Plattformen, effektiv funktionieren.
• Legen Sie klare Leistungsziele fest, die Antwortlatenz, Geschwindigkeit der Token-Generierung, Durchsatz, Speicherbedarf und Zuverlässigkeit umfassen.
• Erstellen und führen Sie kontrollierte Inferenz-Benchmarks in simulierten und Produktionsumgebungen aus und verfolgen Sie Latenz, Durchsatz, Speicherverbrauch und Fehlerraten.
• Erstellen und pflegen Sie repräsentative Datensätze und Simulationsszenarien zur Bewertung der Modellleistung unter realen und ressourcenbeschränkten Bedingungen.
• Identifizieren Sie Rechen- und Speicherengpässe in Inferenzpipelines und implementieren Sie Lösungen mit Stapelverarbeitung, Netzwerk, Speicherverwaltung und anderen Optimierungen auf Systemebene.
• Entwickeln Sie benutzerdefinierte GPU-Kernel und Compute-Shader für mobile Hardware, einschließlich Lösungen, die in Metal Shading Language (MSL) geschrieben sind.
• Wenden Sie fortschrittliche Inferenzoptimierungstechniken wie Bereinigung, Quantisierung, Flash Attention, KV-Caching und spekulative Dekodierung an.
• Entwerfen und optimieren Sie verteilte Inferenzsysteme mithilfe von Ansätzen wie Tensor-Parallelität, Pipeline-Parallelität und Experten-Parallelität für große GPU-Workloads.
• Arbeiten Sie mit funktionsübergreifenden Technik- und Forschungsteams zusammen, um optimierte Inferenz-Frameworks in Produktions- und Edge-Device-Anwendungen zu integrieren.
• Definieren Sie Bewertungsmethoden, dokumentieren Sie experimentelle Ergebnisse, vergleichen Sie die Leistung mit etablierten Benchmarks und verfeinern Sie kontinuierlich Optimierungsstrategien.
• Überwachen Sie die Produktionsleistung und nutzen Sie empirische Untersuchungen, um Möglichkeiten für weitere Verbesserungen der Skalierbarkeit, Effizienz und Zuverlässigkeit zu identifizieren.
Anforderungen:
• Abschluss in Informatik oder einem verwandten technischen Bereich; Ein Doktortitel in NLP, maschinellem Lernen oder einer verwandten Disziplin ist von hoher Relevanz, insbesondere mit einer starken Erfolgsbilanz in der KI-Forschung und Veröffentlichungen auf führenden Konferenzen.
• Nachgewiesene Fachkenntnisse in Metal Shading Language (MSL), einschließlich der Fähigkeit, benutzerdefinierte Compute-Shader von Grund auf zu schreiben.
• Nachgewiesene Erfahrung mit Low-Level-Kernel-Optimierung und Inferenzoptimierung auf mobilen oder anderen ressourcenbeschränkten Geräten.
• Erfolgsbilanz bei der Bereitstellung messbarer Verbesserungen der Inferenzlatenz, des Durchsatzes und des Speicherbedarfs für domänenspezifische Anwendungen.
• Tiefes Verständnis moderner modellbasierter Architekturen, Inferenz-Engines und Optimierungstechniken für den Einsatz leistungsstarker KI.
• Umfangreiche Erfahrung im Schreiben von GPU-Kerneln für mobile Geräte wie Smartphones.
• Praktische Erfahrung in der Entwicklung und Bereitstellung von End-to-End-Inferenzpipelines, von der Modelloptimierung bis hin zur Produktionsintegration auf eingeschränkter Hardware.
• Starke Fähigkeit, empirische Forschung und systematische Experimente anzuwenden, um Latenz-, Rechen- und Gedächtnisprobleme zu lösen.
• Erfahrung im Entwerfen robuster Bewertungs- und Benchmarking-Frameworks für Inferenzsysteme.
• Kenntnisse über verteilte Inferenztechniken, einschließlich Tensor-Parallelität, Pipeline-Parallelität und Experten-Parallelität für große GPU-Cluster.
• Tiefes Verständnis der mathematischen Grundlagen und Architektur von Diffusionsmodellen und Vision Transformern.
• Vertrautheit mit modernen Techniken zur Inferenzoptimierung, einschließlich Pruning, Quantisierung, Flash Attention, KV-Cache-Optimierung und spekulativer Dekodierung wie EAGLE.
• Starke Analyse- und Problemlösungsfähigkeiten mit der Fähigkeit, komplexe Systemengpässe zu untersuchen und Forschungsergebnisse in praktische technische Lösungen umzusetzen.
• Hervorragende Kommunikationsfähigkeiten in Englisch und die Fähigkeit, effektiv mit verteilten, funktionsübergreifenden technischen Teams zusammenzuarbeiten.
Vorteile:
• Möglichkeit, an fortschrittlichen KI-Systemen zu arbeiten, die Modellbereitstellung, Inferenzoptimierung, mobiles Computing, Edge-Bereitstellung und groß angelegte verteilte Inferenz umfassen.
• Remote-First-Arbeitsumgebung mit einem internationalen Team.
• Kontakt zu modernster KI-Forschung und praktischen Herausforderungen der Systemtechnik.
• Möglichkeit, zur leistungskritischen Infrastruktur beizutragen, wo Verbesserungen messbare Auswirkungen auf reale KI-Anwendungen haben können.
• Kollaboratives Umfeld, das forschungsorientiertes Experimentieren mit praktischer Technik verbindet.
• Möglichkeit, mit fortschrittlichen Modellarchitekturen zu arbeiten, einschließlich Diffusionsmodellen, Vision Transformers und multimodalen Systemen.…
Quelle: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-uk-187924)
Sie arbeiten an der Schnittstelle von KI-Forschung, Systemtechnik und Hochleistungsmodellinferenz.
Ihr Schwerpunkt liegt auf der Entwicklung und Optimierung modellbasierter Architekturen für fortschrittliche KI-Systeme in einer Reihe von Hardwareumgebungen.
Sie werden Herausforderungen in Bezug auf Latenz, Durchsatz, Speichereffizienz und Skalierbarkeit bewältigen, einschließlich der Bereitstellung auf ressourcenbeschränkten Mobil- und Edge-Geräten.
Die Rolle kombiniert praktische Forschung mit Low-Level-Engineering und gibt Ihnen die Möglichkeit, neuartige Inferenzstrategien und GPU-Kernel zu entwickeln.
Sie arbeiten mit komplexen Architekturen, die Text, Bild, Audio, Diffusionsmodelle und Vision-Transformatoren umfassen.
Ihre Arbeit umfasst strenges Benchmarking, Produktionstests und iterative Optimierung, um Forschungsergebnisse in messbare Leistungsverbesserungen umzusetzen.
Sie arbeiten mit funktionsübergreifenden Teams in einer hochtechnischen Remote-Umgebung zusammen und konzentrieren sich darauf, die Grenzen effizienter KI-Systeme zu erweitern.
Verantwortlichkeiten
• Entwerfen und implementieren Sie fortschrittliche Model-Serving-Architekturen, die für hohen Durchsatz, geringe Latenz und effiziente Speichernutzung optimiert sind.
• Entwickeln Sie Inferenzpipelines, die in verschiedenen Umgebungen, einschließlich ressourcenbeschränkten Mobilgeräten und Edge-Plattformen, effektiv funktionieren.
• Legen Sie klare Leistungsziele fest, die Antwortlatenz, Geschwindigkeit der Token-Generierung, Durchsatz, Speicherbedarf und Zuverlässigkeit umfassen.
• Erstellen und führen Sie kontrollierte Inferenz-Benchmarks in simulierten und Produktionsumgebungen aus und verfolgen Sie Latenz, Durchsatz, Speicherverbrauch und Fehlerraten.
• Erstellen und pflegen Sie repräsentative Datensätze und Simulationsszenarien zur Bewertung der Modellleistung unter realen und ressourcenbeschränkten Bedingungen.
• Identifizieren Sie Rechen- und Speicherengpässe in Inferenzpipelines und implementieren Sie Lösungen mit Stapelverarbeitung, Netzwerk, Speicherverwaltung und anderen Optimierungen auf Systemebene.
• Entwickeln Sie benutzerdefinierte GPU-Kernel und Compute-Shader für mobile Hardware, einschließlich Lösungen, die in Metal Shading Language (MSL) geschrieben sind.
• Wenden Sie fortschrittliche Inferenzoptimierungstechniken wie Bereinigung, Quantisierung, Flash Attention, KV-Caching und spekulative Dekodierung an.
• Entwerfen und optimieren Sie verteilte Inferenzsysteme mithilfe von Ansätzen wie Tensor-Parallelität, Pipeline-Parallelität und Experten-Parallelität für große GPU-Workloads.
• Arbeiten Sie mit funktionsübergreifenden Technik- und Forschungsteams zusammen, um optimierte Inferenz-Frameworks in Produktions- und Edge-Device-Anwendungen zu integrieren.
• Definieren Sie Bewertungsmethoden, dokumentieren Sie experimentelle Ergebnisse, vergleichen Sie die Leistung mit etablierten Benchmarks und verfeinern Sie kontinuierlich Optimierungsstrategien.
• Überwachen Sie die Produktionsleistung und nutzen Sie empirische Untersuchungen, um Möglichkeiten für weitere Verbesserungen der Skalierbarkeit, Effizienz und Zuverlässigkeit zu identifizieren.
Anforderungen:
• Abschluss in Informatik oder einem verwandten technischen Bereich; Ein Doktortitel in NLP, maschinellem Lernen oder einer verwandten Disziplin ist von hoher Relevanz, insbesondere mit einer starken Erfolgsbilanz in der KI-Forschung und Veröffentlichungen auf führenden Konferenzen.
• Nachgewiesene Fachkenntnisse in Metal Shading Language (MSL), einschließlich der Fähigkeit, benutzerdefinierte Compute-Shader von Grund auf zu schreiben.
• Nachgewiesene Erfahrung mit Low-Level-Kernel-Optimierung und Inferenzoptimierung auf mobilen oder anderen ressourcenbeschränkten Geräten.
• Erfolgsbilanz bei der Bereitstellung messbarer Verbesserungen der Inferenzlatenz, des Durchsatzes und des Speicherbedarfs für domänenspezifische Anwendungen.
• Tiefes Verständnis moderner modellbasierter Architekturen, Inferenz-Engines und Optimierungstechniken für den Einsatz leistungsstarker KI.
• Umfangreiche Erfahrung im Schreiben von GPU-Kerneln für mobile Geräte wie Smartphones.
• Praktische Erfahrung in der Entwicklung und Bereitstellung von End-to-End-Inferenzpipelines, von der Modelloptimierung bis hin zur Produktionsintegration auf eingeschränkter Hardware.
• Starke Fähigkeit, empirische Forschung und systematische Experimente anzuwenden, um Latenz-, Rechen- und Gedächtnisprobleme zu lösen.
• Erfahrung im Entwerfen robuster Bewertungs- und Benchmarking-Frameworks für Inferenzsysteme.
• Kenntnisse über verteilte Inferenztechniken, einschließlich Tensor-Parallelität, Pipeline-Parallelität und Experten-Parallelität für große GPU-Cluster.
• Tiefes Verständnis der mathematischen Grundlagen und Architektur von Diffusionsmodellen und Vision Transformern.
• Vertrautheit mit modernen Techniken zur Inferenzoptimierung, einschließlich Pruning, Quantisierung, Flash Attention, KV-Cache-Optimierung und spekulativer Dekodierung wie EAGLE.
• Starke Analyse- und Problemlösungsfähigkeiten mit der Fähigkeit, komplexe Systemengpässe zu untersuchen und Forschungsergebnisse in praktische technische Lösungen umzusetzen.
• Hervorragende Kommunikationsfähigkeiten in Englisch und die Fähigkeit, effektiv mit verteilten, funktionsübergreifenden technischen Teams zusammenzuarbeiten.
Vorteile:
• Möglichkeit, an fortschrittlichen KI-Systemen zu arbeiten, die Modellbereitstellung, Inferenzoptimierung, mobiles Computing, Edge-Bereitstellung und groß angelegte verteilte Inferenz umfassen.
• Remote-First-Arbeitsumgebung mit einem internationalen Team.
• Kontakt zu modernster KI-Forschung und praktischen Herausforderungen der Systemtechnik.
• Möglichkeit, zur leistungskritischen Infrastruktur beizutragen, wo Verbesserungen messbare Auswirkungen auf reale KI-Anwendungen haben können.
• Kollaboratives Umfeld, das forschungsorientiertes Experimentieren mit praktischer Technik verbindet.
• Möglichkeit, mit fortschrittlichen Modellarchitekturen zu arbeiten, einschließlich Diffusionsmodellen, Vision Transformers und multimodalen Systemen.…
Quelle: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/jobgether/ai-research-engineer-kernel-inference-optimization-uk-187924)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Jobgether
Inserat bereitgestellt von Jobgether.