Job
Aus Partner-Feed
Agentischer Compiler-Ingenieur
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Nein
- Unternehmen
- Kog
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
ÜBER KOG
Kog erstellt einen gemeinsam entwickelten Inferenzstapel für Echtzeit-KI-Agenten auf Standard-GPUs von Rechenzentren, der Modellarchitektur, Inferenz-Engine, Compiler und Low-Level-GPU-Kernel umfasst.
Auf der Modellseite haben wir Laneformer 2B und Delayed Tensor Parallelism (DTP) entwickelt, eine Transformer-Architektur, die Kommunikation mit nützlichen Berechnungen und Gewichtsstreaming überlappt.
Auf der Systemseite führt die Kog Inference Engine diesen Stack auf standardmäßigen AMD- und NVIDIA-Rechenzentrums-GPUs aus.
Kog generiert 3.500 Token/s pro Anfrage auf 8 AMD MI300X-GPUs und 2.100 Token/s pro Anfrage auf 8 NVIDIA H200-GPUs, im FP16 bei Batchgröße 1, mit deaktivierter Quantisierung und spekulativer Dekodierung.
Unser nächstes großes Projekt ist AGCO, unser Agent-Compiler. AGCO ist darauf ausgelegt, LLMs über verschiedene GPUs und Optimierungsziele hinweg zu optimieren, einschließlich sehr schneller Inferenz.
Das Team besteht aus 10 Personen, darunter 9 Ingenieure und Forscher sowie 4 Doktoranden.
Testen Sie es auf Playground.kog.ai. Lesen Sie die technischen Details im Kog Labs-Blog.
Woran Sie arbeiten werden
Sie arbeiten direkt bei AGCO.
Ziel ist es, ein System aufzubauen, das Möglichkeiten zur Optimierung der LLM-Ausführung erkunden, Änderungen generieren, kompilieren, auf Richtigkeit prüfen, auf realer Hardware ausführen, die Ergebnisse messen und dieses Feedback als Leitfaden für die nächste Optimierung nutzen kann.
Sie werden in folgenden Bereichen mitwirken:
• Compiler- und IR-Design zur Darstellung und Transformation von LLM-Berechnungen.
• Optimierungsdurchgänge, Senkung und Codegenerierung.
• Suchmethoden zum Erkunden verschiedener Implementierungen und Ausführungsstrategien.
• Verifizierung und Korrektheitsprüfungen für generierte Änderungen.
• GPU-Ausführung, Profilerstellung und Leistungsoptimierung.
• LLM-Inferenz über Operatoren, Speicher, Parallelität und Kommunikation.
• Optimierungsschleifen, die generierte Änderungen mit Messungen auf echten GPUs verbinden.
Eine Richtung, die wir erkunden, kombiniert eine IR, einen Verifizierer, einen Compiler und einen Suchoptimierer. Wir planen, mit fokussierten Problemen zu beginnen, funktionierende Prototypen zu erstellen und das System anhand des Gelernten zu erweitern.
Ihr Hauptgebiet hängt von Ihren Erfahrungen, Fähigkeiten und Interessen ab. Möglicherweise konzentrieren Sie sich mehr auf Compiler, GPU-Systeme oder LLM-Inferenz, während Sie eng mit Personen im gesamten Stack zusammenarbeiten.
WAS WIR SUCHEN
Wir suchen Ingenieure mit fundiertem technischem Fachwissen und origineller Arbeit in mindestens einem für AGCO relevanten Bereich.
Zu den relevanten Erfahrungen zählen:
• Compiler-Engineering, einschließlich Optimierungsdurchläufen, IRs, Senkung, Codegenerierung, LLVM oder MLIR.
• GPU-Programmierung mit CUDA, HIP, Metal, Vulkan oder ähnlichen Technologien.
• GPU-Leistung, die Kernel, Speicher, Synchronisierung, Profilerstellung oder Hardwareverhalten betrifft.
• LLM-Inferenz-Engines und Leistungsoptimierung.
• Aufmerksamkeit, MoE, Parallelität, Kommunikation oder andere Teile der LLM-Ausführung auf Systemebene.
• Formale Verifizierung, Äquivalenzprüfung, SAT/SMT oder verwandte Methoden.
• Systeme, die Code automatisch generieren, suchen, testen, vergleichen oder optimieren.
Uns ist wichtig, was Sie persönlich gebaut haben und welche technischen Entscheidungen dahinter stehen. Starke Kandidaten können das Problem, ihren Ansatz, die von ihnen untersuchten Alternativen und die Art und Weise erläutern, wie sie das Ergebnis gemessen haben.
Wir überprüfen die technische Arbeit während des Prozesses. Dabei kann es sich um öffentlichen Code, einen Upstream-Beitrag, eine Arbeit, eine Abschlussarbeit, ein technisches Projekt oder einen detaillierten Aufsatz basierend auf der Arbeit handeln, den Sie teilen können.
WAS WIR BIETEN
Sie werden einem kleinen Team beitreten, das AGCO als Kernbestandteil der Kog-Technologie aufbaut.
• Arbeiten Sie an der Schnittstelle von Compilern, GPU-Systemen und LLM-Inferenz.
• Direkter Zugriff auf Ingenieure, die am gesamten Inferenzstapel arbeiten.
• Eine schnelle Schleife von einer Optimierungsidee zur Kompilierung, Ausführung, Verifizierung und Messung auf echten GPUs.
• Die Möglichkeit, tief in Ihr stärkstes technisches Gebiet vorzudringen und gleichzeitig in die anderen Teile des Stacks zu expandieren.
• Hohe Eigenverantwortung für technische Entscheidungen und Systeme, die beeinflussen, wie Kog die LLM-Inferenz optimiert.
Diese Position ist in Paris angesiedelt und wir suchen Kandidaten, die nach Paris ziehen und eng mit dem Team zusammenarbeiten können.
Finden Sie Jobs in Frankreich auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Kog erstellt einen gemeinsam entwickelten Inferenzstapel für Echtzeit-KI-Agenten auf Standard-GPUs von Rechenzentren, der Modellarchitektur, Inferenz-Engine, Compiler und Low-Level-GPU-Kernel umfasst.
Auf der Modellseite haben wir Laneformer 2B und Delayed Tensor Parallelism (DTP) entwickelt, eine Transformer-Architektur, die Kommunikation mit nützlichen Berechnungen und Gewichtsstreaming überlappt.
Auf der Systemseite führt die Kog Inference Engine diesen Stack auf standardmäßigen AMD- und NVIDIA-Rechenzentrums-GPUs aus.
Kog generiert 3.500 Token/s pro Anfrage auf 8 AMD MI300X-GPUs und 2.100 Token/s pro Anfrage auf 8 NVIDIA H200-GPUs, im FP16 bei Batchgröße 1, mit deaktivierter Quantisierung und spekulativer Dekodierung.
Unser nächstes großes Projekt ist AGCO, unser Agent-Compiler. AGCO ist darauf ausgelegt, LLMs über verschiedene GPUs und Optimierungsziele hinweg zu optimieren, einschließlich sehr schneller Inferenz.
Das Team besteht aus 10 Personen, darunter 9 Ingenieure und Forscher sowie 4 Doktoranden.
Testen Sie es auf Playground.kog.ai. Lesen Sie die technischen Details im Kog Labs-Blog.
Woran Sie arbeiten werden
Sie arbeiten direkt bei AGCO.
Ziel ist es, ein System aufzubauen, das Möglichkeiten zur Optimierung der LLM-Ausführung erkunden, Änderungen generieren, kompilieren, auf Richtigkeit prüfen, auf realer Hardware ausführen, die Ergebnisse messen und dieses Feedback als Leitfaden für die nächste Optimierung nutzen kann.
Sie werden in folgenden Bereichen mitwirken:
• Compiler- und IR-Design zur Darstellung und Transformation von LLM-Berechnungen.
• Optimierungsdurchgänge, Senkung und Codegenerierung.
• Suchmethoden zum Erkunden verschiedener Implementierungen und Ausführungsstrategien.
• Verifizierung und Korrektheitsprüfungen für generierte Änderungen.
• GPU-Ausführung, Profilerstellung und Leistungsoptimierung.
• LLM-Inferenz über Operatoren, Speicher, Parallelität und Kommunikation.
• Optimierungsschleifen, die generierte Änderungen mit Messungen auf echten GPUs verbinden.
Eine Richtung, die wir erkunden, kombiniert eine IR, einen Verifizierer, einen Compiler und einen Suchoptimierer. Wir planen, mit fokussierten Problemen zu beginnen, funktionierende Prototypen zu erstellen und das System anhand des Gelernten zu erweitern.
Ihr Hauptgebiet hängt von Ihren Erfahrungen, Fähigkeiten und Interessen ab. Möglicherweise konzentrieren Sie sich mehr auf Compiler, GPU-Systeme oder LLM-Inferenz, während Sie eng mit Personen im gesamten Stack zusammenarbeiten.
WAS WIR SUCHEN
Wir suchen Ingenieure mit fundiertem technischem Fachwissen und origineller Arbeit in mindestens einem für AGCO relevanten Bereich.
Zu den relevanten Erfahrungen zählen:
• Compiler-Engineering, einschließlich Optimierungsdurchläufen, IRs, Senkung, Codegenerierung, LLVM oder MLIR.
• GPU-Programmierung mit CUDA, HIP, Metal, Vulkan oder ähnlichen Technologien.
• GPU-Leistung, die Kernel, Speicher, Synchronisierung, Profilerstellung oder Hardwareverhalten betrifft.
• LLM-Inferenz-Engines und Leistungsoptimierung.
• Aufmerksamkeit, MoE, Parallelität, Kommunikation oder andere Teile der LLM-Ausführung auf Systemebene.
• Formale Verifizierung, Äquivalenzprüfung, SAT/SMT oder verwandte Methoden.
• Systeme, die Code automatisch generieren, suchen, testen, vergleichen oder optimieren.
Uns ist wichtig, was Sie persönlich gebaut haben und welche technischen Entscheidungen dahinter stehen. Starke Kandidaten können das Problem, ihren Ansatz, die von ihnen untersuchten Alternativen und die Art und Weise erläutern, wie sie das Ergebnis gemessen haben.
Wir überprüfen die technische Arbeit während des Prozesses. Dabei kann es sich um öffentlichen Code, einen Upstream-Beitrag, eine Arbeit, eine Abschlussarbeit, ein technisches Projekt oder einen detaillierten Aufsatz basierend auf der Arbeit handeln, den Sie teilen können.
WAS WIR BIETEN
Sie werden einem kleinen Team beitreten, das AGCO als Kernbestandteil der Kog-Technologie aufbaut.
• Arbeiten Sie an der Schnittstelle von Compilern, GPU-Systemen und LLM-Inferenz.
• Direkter Zugriff auf Ingenieure, die am gesamten Inferenzstapel arbeiten.
• Eine schnelle Schleife von einer Optimierungsidee zur Kompilierung, Ausführung, Verifizierung und Messung auf echten GPUs.
• Die Möglichkeit, tief in Ihr stärkstes technisches Gebiet vorzudringen und gleichzeitig in die anderen Teile des Stacks zu expandieren.
• Hohe Eigenverantwortung für technische Entscheidungen und Systeme, die beeinflussen, wie Kog die LLM-Inferenz optimiert.
Diese Position ist in Paris angesiedelt und wir suchen Kandidaten, die nach Paris ziehen und eng mit dem Team zusammenarbeiten können.
Finden Sie Jobs in Frankreich auf Arbeitnow
Quelle: Arbeitnow (https://www.arbeitnow.fr/jobs/companies/kog/agentic-compiler-engineer-paris-247204)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Kog
Standort
Paris, Frankreich
Inserat bereitgestellt von Kog.