Job
Aus Partner-Feed
KI-Ingenieur – Inferenz
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- Security Engineer, Application - Greenhouse
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Firmus Technologies
Firmus Technologies ist ein weltweit führender Pionier bei der Entwicklung und dem Betrieb einer effizienten KI-Infrastruktur im gesamten asiatisch-pazifischen Raum.
Unser 2019 in Australien gegründetes Ziel ist es, die effizienteste KI-Infrastruktur zu schaffen, indem wir modernste Technologie mit einem unerschütterlichen Engagement für Nachhaltigkeit kombinieren.
Bei Firmus sind wir in unserem Ansatz einzigartig. Wir entwerfen, bauen und betreiben eine neue Klasse digitaler Infrastruktur – die AI Factory. Durch unseren Model-to-Grid-Technologieansatz haben wir die Grenzen von Mehrgenerationen-Flüssigkeitskühlsystemen, Energiemanagement, KI-Software-Orchestrierung und Bauwesen erweitert. Für unsere Kunden ermöglicht uns dieser Ansatz, dass jedes Watt zählt und weltweit kostengünstige KI-Tokens liefert.
Firmus AI Cloud
Unsere groß angelegte GPU-Cloud-Plattform Firmus AI Cloud wurde speziell dafür entwickelt, Kunden energieeffiziente KI-Berechnungen im großen Maßstab bereitzustellen.
Es ermöglicht Entwicklern, Unternehmen, Bildungseinrichtungen und Regierungsanwendern, KI-Modelle mit beispielloser Effizienz und Kosteneinsparungen zu trainieren und bereitzustellen. Mit einem ständig wachsenden Angebot an Diensten und Anwendungen sind wir bestrebt, ein Cloud-Erlebnis zu bieten, das marktführend, proprietär und skalierbar ist.
Warum Firmus?
Als NVIDIA Cloud- und Engineering-Partner im asiatisch-pazifischen Raum erwerben Sie Fähigkeiten, Erfahrungen und Bekanntheit in der gesamten KI-Branche und gestalten mit, wie diese Branche in den kommenden Jahrzehnten aussehen wird.
Wir werden von Gründern geführt und sind kein großes Unternehmen. Entscheidungen fallen schnell, unsere Führungskräfte sind erreichbar und zwischen Ihnen und der Arbeit besteht nur ein Minimum an Bürokratie. Eigentum kommt früh. Was auch immer Ihre Rolle ist, Sie haben einen direkten Draht zu den Ergebnissen und können mitgestalten, wie das Unternehmen wächst, während wir im Rahmen einer langfristigen, groß angelegten Roadmap landesweit skalieren.
Arbeiten Sie mit Gründern und Experten in den Bereichen KI-Infrastruktur, Energiesysteme und Computing der nächsten Generation zusammen.
Was wir hier aufbauen, hat Auswirkungen über das Geschäft hinaus. Unsere KI-Fabriken sind als Vermögenswerte des Energienetzes konzipiert, um die Gemeinden und Regionen, in denen sie tätig sind, aktiv zu stärken, anstatt von ihnen zu profitieren.
Erwägen Sie eine Bewerbung? Sie benötigen keinen perfekten Hintergrund, um unserem Team beizutreten. Wenn Sie ehrgeizig und neugierig sind, gibt es einen Weg für Sie. Wir unterstützen unsere Mitarbeiter dabei, in neue Bereiche hineinzuwachsen und Herausforderungen anzunehmen, die über ihre bisherigen Erfahrungen hinausgehen.
ROLLENZUSAMMENFASSUNG
Der Senior AI Engineer (Inferencing) wird die Inferenzfähigkeiten des AI & Applications-Teams aufbauen und verbessern und Modelle als zuverlässige, sichere, skalierbare und leistungsstarke Endpunkte für interne Produkte, externe Kunden und zukünftige Inference-as-a-Service-Angebote verfügbar machen.
Die Rolle wird die technische Grundlage für die Bereitstellung selbstgehosteter Modelle in der KI-Fabrikumgebung der Organisation schaffen. Dazu gehören Modell-Onboarding, Bereitstellung, Endpunktbereitstellung, Laufzeitauswahl, Leistungsbenchmarking und -optimierung, Beobachtbarkeit, Kapazitätsmanagement, Sicherheit und Betriebslebenszyklusmanagement. Ziel ist es, Benutzern einen vorhersehbaren und effizienten Zugriff auf Modelle zu ermöglichen und gleichzeitig die Kontrolle über Leistung, Kosten, Datenverarbeitung, Bereitstellungskonfiguration und Infrastrukturnutzung zu behalten.
Die Rolle leistet einen wichtigen Beitrag zur Roadmap für Model-to-Grid-Produkte und Agentenanwendungen. Es wandelt Modell- und Laufzeitmerkmale in Benchmarking-, wiederholbare Inferenzrezepte und Endpunktprofile um, die als Grundlage für die Arbeitslastplanung, topologiebewusste Platzierung, Kapazitätsplanung, Leistungsempfehlungen und betriebliche Entscheidungsfindung dienen können. Es stellt außerdem die kontrollierten und zweckdienlichen Modellendpunkte bereit, die von Agentensystemen für Argumentation, Abruf, Werkzeugnutzung, Diagnose, Empfehlung und kontrollierte Automatisierung benötigt werden.
SCHLÜSSELVERANTWORTLICHKEITEN
• Erstellen, betreiben und kontinuierlich verbessern Sie selbst gehostete KI-Inferenzdienste für interne Anwendungen, kundenorientierte Produkte und zukünftige Inferenz-as-a-Service-Angebote.
• Definieren und implementieren Sie Standard-Modell-Onboarding-Workflows, die Modellaufnahme, Kompatibilitätsvalidierung, Paketierung, Laufzeitauswahl, Optimierung, Bereitstellung, Endpunktregistrierung, Tests, Release und Lebenszyklusmanagement umfassen.
• Bereitstellung und Verwaltung sicherer, skalierbarer Inferenzendpunkte für gängige KI-Anwendungsmuster, einschließlich interaktiver Generierung, RAG, Einbettungen, Reranking, Stapelverarbeitung, multimodaler Anwendungsfälle, Toolaufrufe und Agenten-Workflows.
• Entwickeln Sie wiederverwendbare Bereitstellungsvorlagen, APIs, SDKs, Konfigurationsstandards und Self-Service-Workflows, damit Benutzer Modellendpunkte anfordern, konfigurieren, darauf zugreifen, überwachen, aktualisieren und außer Betrieb nehmen können.
• Arbeiten Sie mit führenden Inferenz-Frameworks und Toolkits wie TensorRT-LLM, TensorRT, SGLang, vLLM, Triton Inference Server, NVIDIA Dynamo, NVIDIA NIM, CUDA, cuDNN, NCCL und zugehörigen Bereitstellungs-, Profilierungs- und Observability-Tools.
• Optimieren Sie die Modellbereitstellungsleistung mithilfe geeigneter Techniken, einschließlich Quantisierung, Kompilierung, Stapelverarbeitung, kontinuierlicher Stapelverarbeitung, Anforderungsrouting, KV-Cache-Verwaltung, Präfix-Caching, spekulative Dekodierung, Lastausgleich, Modellrouting, Speicheroptimierung und verteilte Parallelität.
• Erstellen und validieren Sie wiederverwendbare Inferenzrezepte, die kompatible Modellversionen, Framework- und Laufzeitversionen, Präzisionsformate, GPU-Konfigurationen, Topologieanforderungen, Skalierungsansätze, Scheduler-Profile, Benchmark-Ergebnisse und erwartete Leistungsumschläge angeben.
• Verwenden Sie Quantisierungs- und Optimierungsansätze wie NVFP4, FP8, INT8, TensorRT-Kompilierung, Kerneloptimierung, effiziente Aufmerksamkeitsmechanismen und Speicherverwaltungstechniken und behalten Sie dabei vereinbarte Modellqualitätsziele bei.
• Entwerfen Sie verteilte Inferenzkonfigurationen für große Modelle, einschließlich Tensor-, Pipeline-, Experten-, Kontext- und Datenparallelität, sofern angemessen.…
Quelle: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/security-engineer-application-greenhouse/ai-engineer-inference-sydney-australia-94778)
Firmus Technologies ist ein weltweit führender Pionier bei der Entwicklung und dem Betrieb einer effizienten KI-Infrastruktur im gesamten asiatisch-pazifischen Raum.
Unser 2019 in Australien gegründetes Ziel ist es, die effizienteste KI-Infrastruktur zu schaffen, indem wir modernste Technologie mit einem unerschütterlichen Engagement für Nachhaltigkeit kombinieren.
Bei Firmus sind wir in unserem Ansatz einzigartig. Wir entwerfen, bauen und betreiben eine neue Klasse digitaler Infrastruktur – die AI Factory. Durch unseren Model-to-Grid-Technologieansatz haben wir die Grenzen von Mehrgenerationen-Flüssigkeitskühlsystemen, Energiemanagement, KI-Software-Orchestrierung und Bauwesen erweitert. Für unsere Kunden ermöglicht uns dieser Ansatz, dass jedes Watt zählt und weltweit kostengünstige KI-Tokens liefert.
Firmus AI Cloud
Unsere groß angelegte GPU-Cloud-Plattform Firmus AI Cloud wurde speziell dafür entwickelt, Kunden energieeffiziente KI-Berechnungen im großen Maßstab bereitzustellen.
Es ermöglicht Entwicklern, Unternehmen, Bildungseinrichtungen und Regierungsanwendern, KI-Modelle mit beispielloser Effizienz und Kosteneinsparungen zu trainieren und bereitzustellen. Mit einem ständig wachsenden Angebot an Diensten und Anwendungen sind wir bestrebt, ein Cloud-Erlebnis zu bieten, das marktführend, proprietär und skalierbar ist.
Warum Firmus?
Als NVIDIA Cloud- und Engineering-Partner im asiatisch-pazifischen Raum erwerben Sie Fähigkeiten, Erfahrungen und Bekanntheit in der gesamten KI-Branche und gestalten mit, wie diese Branche in den kommenden Jahrzehnten aussehen wird.
Wir werden von Gründern geführt und sind kein großes Unternehmen. Entscheidungen fallen schnell, unsere Führungskräfte sind erreichbar und zwischen Ihnen und der Arbeit besteht nur ein Minimum an Bürokratie. Eigentum kommt früh. Was auch immer Ihre Rolle ist, Sie haben einen direkten Draht zu den Ergebnissen und können mitgestalten, wie das Unternehmen wächst, während wir im Rahmen einer langfristigen, groß angelegten Roadmap landesweit skalieren.
Arbeiten Sie mit Gründern und Experten in den Bereichen KI-Infrastruktur, Energiesysteme und Computing der nächsten Generation zusammen.
Was wir hier aufbauen, hat Auswirkungen über das Geschäft hinaus. Unsere KI-Fabriken sind als Vermögenswerte des Energienetzes konzipiert, um die Gemeinden und Regionen, in denen sie tätig sind, aktiv zu stärken, anstatt von ihnen zu profitieren.
Erwägen Sie eine Bewerbung? Sie benötigen keinen perfekten Hintergrund, um unserem Team beizutreten. Wenn Sie ehrgeizig und neugierig sind, gibt es einen Weg für Sie. Wir unterstützen unsere Mitarbeiter dabei, in neue Bereiche hineinzuwachsen und Herausforderungen anzunehmen, die über ihre bisherigen Erfahrungen hinausgehen.
ROLLENZUSAMMENFASSUNG
Der Senior AI Engineer (Inferencing) wird die Inferenzfähigkeiten des AI & Applications-Teams aufbauen und verbessern und Modelle als zuverlässige, sichere, skalierbare und leistungsstarke Endpunkte für interne Produkte, externe Kunden und zukünftige Inference-as-a-Service-Angebote verfügbar machen.
Die Rolle wird die technische Grundlage für die Bereitstellung selbstgehosteter Modelle in der KI-Fabrikumgebung der Organisation schaffen. Dazu gehören Modell-Onboarding, Bereitstellung, Endpunktbereitstellung, Laufzeitauswahl, Leistungsbenchmarking und -optimierung, Beobachtbarkeit, Kapazitätsmanagement, Sicherheit und Betriebslebenszyklusmanagement. Ziel ist es, Benutzern einen vorhersehbaren und effizienten Zugriff auf Modelle zu ermöglichen und gleichzeitig die Kontrolle über Leistung, Kosten, Datenverarbeitung, Bereitstellungskonfiguration und Infrastrukturnutzung zu behalten.
Die Rolle leistet einen wichtigen Beitrag zur Roadmap für Model-to-Grid-Produkte und Agentenanwendungen. Es wandelt Modell- und Laufzeitmerkmale in Benchmarking-, wiederholbare Inferenzrezepte und Endpunktprofile um, die als Grundlage für die Arbeitslastplanung, topologiebewusste Platzierung, Kapazitätsplanung, Leistungsempfehlungen und betriebliche Entscheidungsfindung dienen können. Es stellt außerdem die kontrollierten und zweckdienlichen Modellendpunkte bereit, die von Agentensystemen für Argumentation, Abruf, Werkzeugnutzung, Diagnose, Empfehlung und kontrollierte Automatisierung benötigt werden.
SCHLÜSSELVERANTWORTLICHKEITEN
• Erstellen, betreiben und kontinuierlich verbessern Sie selbst gehostete KI-Inferenzdienste für interne Anwendungen, kundenorientierte Produkte und zukünftige Inferenz-as-a-Service-Angebote.
• Definieren und implementieren Sie Standard-Modell-Onboarding-Workflows, die Modellaufnahme, Kompatibilitätsvalidierung, Paketierung, Laufzeitauswahl, Optimierung, Bereitstellung, Endpunktregistrierung, Tests, Release und Lebenszyklusmanagement umfassen.
• Bereitstellung und Verwaltung sicherer, skalierbarer Inferenzendpunkte für gängige KI-Anwendungsmuster, einschließlich interaktiver Generierung, RAG, Einbettungen, Reranking, Stapelverarbeitung, multimodaler Anwendungsfälle, Toolaufrufe und Agenten-Workflows.
• Entwickeln Sie wiederverwendbare Bereitstellungsvorlagen, APIs, SDKs, Konfigurationsstandards und Self-Service-Workflows, damit Benutzer Modellendpunkte anfordern, konfigurieren, darauf zugreifen, überwachen, aktualisieren und außer Betrieb nehmen können.
• Arbeiten Sie mit führenden Inferenz-Frameworks und Toolkits wie TensorRT-LLM, TensorRT, SGLang, vLLM, Triton Inference Server, NVIDIA Dynamo, NVIDIA NIM, CUDA, cuDNN, NCCL und zugehörigen Bereitstellungs-, Profilierungs- und Observability-Tools.
• Optimieren Sie die Modellbereitstellungsleistung mithilfe geeigneter Techniken, einschließlich Quantisierung, Kompilierung, Stapelverarbeitung, kontinuierlicher Stapelverarbeitung, Anforderungsrouting, KV-Cache-Verwaltung, Präfix-Caching, spekulative Dekodierung, Lastausgleich, Modellrouting, Speicheroptimierung und verteilte Parallelität.
• Erstellen und validieren Sie wiederverwendbare Inferenzrezepte, die kompatible Modellversionen, Framework- und Laufzeitversionen, Präzisionsformate, GPU-Konfigurationen, Topologieanforderungen, Skalierungsansätze, Scheduler-Profile, Benchmark-Ergebnisse und erwartete Leistungsumschläge angeben.
• Verwenden Sie Quantisierungs- und Optimierungsansätze wie NVFP4, FP8, INT8, TensorRT-Kompilierung, Kerneloptimierung, effiziente Aufmerksamkeitsmechanismen und Speicherverwaltungstechniken und behalten Sie dabei vereinbarte Modellqualitätsziele bei.
• Entwerfen Sie verteilte Inferenzkonfigurationen für große Modelle, einschließlich Tensor-, Pipeline-, Experten-, Kontext- und Datenparallelität, sofern angemessen.…
Quelle: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/security-engineer-application-greenhouse/ai-engineer-inference-sydney-australia-94778)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Standort
Sydney, Australien
Inserat bereitgestellt von Security Engineer, Application - Greenhouse.