Job
Aus Partner-Feed
KI-Lösungsarchitekt
Preis auf Anfrage
Details
- Beschäftigungsart
- Vollzeit
- Remote
- Ja
- Unternehmen
- Uvation
Beschreibung
Automatisch aus dem English übersetzt. Der Originaltext ist maßgeblich. Maschinenübersetzung – eine genauere Version wird vorbereitet.
Jobübersicht
Wir suchen einen erfahrenen KI-Lösungsarchitekten
um End-to-End-KI-Fabrik- und GPU-Infrastrukturlösungen für Unternehmen zu entwerfen und zu leiten, die Rechen-, Hochleistungsnetzwerk-, Speicher-, Kubernetes-, Cloud- und KI/ML-Plattformen umfassen. Die Rolle erfordert umfassende Fachkenntnisse in den Bereichen NVIDIA-GPU-Technologien, KI-Workloads, skalierbare Infrastrukturarchitektur, Sicherheit, Observability, Performance Engineering und Kapazitätsplanung.
Hauptaufgaben
• Eigene End-to-End-Architektur für AI Factory und Unternehmens-KI-Lösungen von den Anforderungen bis zur Produktionsreife.
• Bewerten Sie die Anforderungen an die KI/ML-Arbeitslast für Training, Feinabstimmung, Inferenz, Stapelverarbeitung und Hochleistungsrechnen.
• Entwerfen Sie GPU-Rechenarchitekturen, einschließlich NVIDIA HGX/DGX/OEM-Plattformen, Multi-GPU-Systeme, NVLink/NVSwitch und GPU-Ressourcenzuweisung.
• Entwerfen Sie leistungsstarke KI-Netzwerke mit 100/200/400/800G-Ethernet, EVPN/VXLAN und Leaf-Spine-Architekturen.
• Entwerfen Sie KI-Speicher- und Datenarchitekturen mithilfe von Objektspeicher, parallelen Dateisystemen wie Ceph, WEKA oder gleichwertigen Plattformen.
• Definieren Sie die KI-Plattformarchitektur für Kubernetes, HPC, Container-Laufzeiten, Modellplattformen und KI-Frameworks für Unternehmen.
• Legen Sie Architekturstandards für Sicherheit, Identität, Mandantenisolierung, Datenschutz, Beobachtbarkeit, Notfallwiederherstellung und betriebliche Ausfallsicherheit fest.
• Entwickeln Sie Referenzarchitekturen, High-Level-/Low-Level-Designs, Kapazitätsmodelle, Stücklisten, Technologiebewertungen und Implementierungs-Roadmaps.
• Leitung technischer Bewertungen, Proof-of-Concepts, Anbieterbewertungen und Architekturprüfungsgremien.
• Arbeiten Sie mit Infrastruktur-, Netzwerk-, Sicherheits-, Speicher-, Cloud-, Daten-, Anwendungs- und Betriebsteams zusammen.
• Definieren Sie Leistungs-, Verfügbarkeits-, Skalierbarkeits-, Sicherheits- und Kostenziele und validieren Sie die Architektur anhand messbarer Akzeptanzkriterien.
• Übernehmen Sie technische Führung bei Bereitstellung, Migration, Integration, Fehlerbehebung und Produktionsübergang.
• Erforderliche technische Fähigkeiten
KI/ML-Architektur
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, GPU Operator und KI-Plattform-Ökosystem.
• PyTorch, TensorFlow, JAX und operatives Verständnis von Trainings- und Inferenz-Workloads.
• GPU-Planung, Mandantenfähigkeit, MIG/vGPU, GPU-Nutzung und Workload-Platzierung.
• LLM, generative KI, RAG, Feinabstimmung, Modellbereitstellung und Inferenzarchitektur.
GPU- und KI-Fabrikinfrastruktur
• NVIDIA A100/H100/H200/B200 oder gleichwertige GPU-Plattformen; Vertrautheit mit Systemen der nächsten Generation.
• NVLink, NVSwitch, PCIe-Topologie und Multi-GPU-Leistungsarchitektur.
• DGX/HGX/OEM GPU-Serverarchitektur und Lebenszyklusverwaltung.
• KI-Fabrikkapazitätsplanung, Rackdichte, Stromversorgung, Kühlung, Inbetriebnahme und Lebenszyklusstrategie.
Hochleistungsnetzwerke
• 100/200/400/800G Ethernet, InfiniBand, RoCEv2 und RDMA, Netris
• NVIDIA ConnectX/SuperNIC-, Spectrum/Spectrum-X-, Quantum- und BlueField-DPU-Technologien.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS und Überlastungsmanagement.
• GPU-Ost-West-Verkehr, GPUDirect RDMA und Fehlerbehebung bei der Netzwerkleistung.
KI-Speicher- und Datenarchitektur
• Parallele Dateisysteme, Objektspeicher, NFS, NVMe/NVMe-oF und Datenpipelines mit hohem Durchsatz.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp oder gleichwertige Technologien.
• Data Lake/Lakehouse-Konzepte, Metadaten, Herkunft, Datenbewegung und Datenlebenszyklus.
• GPUDirect Storage und Optimierung der Speicher-/Netzwerkleistung.
KI-Plattform und Orchestrierung
• Kubernetes, GPU-Operator, Containerlaufzeiten und Kubernetes-GPU-Planung.
• HPC oder andere gleichwertige Workload-Planer.
• Modellbereitstellungs-/Inferenzplattformen und MLOps-Plattformarchitektur.
• API-Gateways, Service Discovery, Secrets Management und Plattformintegration.
Cloud- und Hybridarchitektur
• AWS- und/oder Azure-KI-Infrastruktur- und Sicherheitsdienste.
• Hybrid-Cloud-Konnektivität, IAM, private Netzwerke, Cloud-Speicher und Workload-Platzierung.
• Cloud-Kostenoptimierung, Kapazitätsplanung und FinOps-Überlegungen für GPU-Workloads.
Sicherheit und Governance
• Zero Trust, Netzwerksegmentierung, IAM/RBAC, PAM und Workload-Identität.
• GPU-, DPU-, Container-, Kubernetes-, Firmware- und Lieferkettensicherheit.
• Verschlüsselung im Ruhezustand/während der Übertragung, Geheimnisverwaltung, Audit-Protokollierung und Compliance-Kontrollen.
• KI-spezifische Risiken, einschließlich Daten-/Modellschutz, Mandantenisolierung und sicherer Modellzugriff.
Beobachtbarkeit und Zuverlässigkeit
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM und Infrastrukturtelemetrie.
• Überwachung über GPU-, CPU-, Speicher-, Netzwerk-, Speicher-, Energie- und Wärmedomänen hinweg.
• Hochverfügbarkeit, Sicherung/Wiederherstellung, Notfallwiederherstellung, Geschäftskontinuität und Fehlerdomänendesign.
• Performance-Engineering, Engpassanalyse, SLO/SLA-Design und Kapazitätsprognose.
Architekturleistungen
• AI Factory-Referenzarchitektur und Lösungsentwürfe
• High-Level-Design (HLD) und Low-Level-Design (LLD)
• Netzwerk-, Rechen-, GPU- und Speicherarchitekturdiagramme
• Kapazitäts-, Leistungs- und Skalierbarkeitsmodelle
• Technologiebewertungs- und Anbietervergleichsdokumente
• Eingaben zur Sicherheitsarchitektur und zum Bedrohungsmodell
• Stücklisten (BOM) und Infrastrukturdimensionierung
• Migrations-/Bereitstellungsstrategie und Implementierungs-Roadmap
• Checkliste für die Betriebsbereitschaft, Runbooks und Akzeptanzkriterien
Erfahrung und Qualifikationen
• Mehr als 10 Jahre Erfahrung in den Bereichen Infrastruktur, Cloud, Unternehmensarchitektur oder Lösungsarchitektur mit erheblicher Erfahrung in der KI/GPU-Infrastruktur.
• Nachgewiesene Erfahrung in der Gestaltung großer Unternehmensplattformen und der Umsetzung von Geschäftsanforderungen in technische Architekturen.
• Praktisches Verständnis der physischen Infrastruktur, GPU-Systeme, Netzwerke, Speicher und Linux-Plattformen.
• Bachelor-Abschluss in Informatik, Ingenieurwesen, Informationstechnologie oder einem verwandten Bereich bevorzugt.…
Quelle: EU Remote Jobs (https://euremotejobs.com/job/ai-solution-architect-2/)
Wir suchen einen erfahrenen KI-Lösungsarchitekten
um End-to-End-KI-Fabrik- und GPU-Infrastrukturlösungen für Unternehmen zu entwerfen und zu leiten, die Rechen-, Hochleistungsnetzwerk-, Speicher-, Kubernetes-, Cloud- und KI/ML-Plattformen umfassen. Die Rolle erfordert umfassende Fachkenntnisse in den Bereichen NVIDIA-GPU-Technologien, KI-Workloads, skalierbare Infrastrukturarchitektur, Sicherheit, Observability, Performance Engineering und Kapazitätsplanung.
Hauptaufgaben
• Eigene End-to-End-Architektur für AI Factory und Unternehmens-KI-Lösungen von den Anforderungen bis zur Produktionsreife.
• Bewerten Sie die Anforderungen an die KI/ML-Arbeitslast für Training, Feinabstimmung, Inferenz, Stapelverarbeitung und Hochleistungsrechnen.
• Entwerfen Sie GPU-Rechenarchitekturen, einschließlich NVIDIA HGX/DGX/OEM-Plattformen, Multi-GPU-Systeme, NVLink/NVSwitch und GPU-Ressourcenzuweisung.
• Entwerfen Sie leistungsstarke KI-Netzwerke mit 100/200/400/800G-Ethernet, EVPN/VXLAN und Leaf-Spine-Architekturen.
• Entwerfen Sie KI-Speicher- und Datenarchitekturen mithilfe von Objektspeicher, parallelen Dateisystemen wie Ceph, WEKA oder gleichwertigen Plattformen.
• Definieren Sie die KI-Plattformarchitektur für Kubernetes, HPC, Container-Laufzeiten, Modellplattformen und KI-Frameworks für Unternehmen.
• Legen Sie Architekturstandards für Sicherheit, Identität, Mandantenisolierung, Datenschutz, Beobachtbarkeit, Notfallwiederherstellung und betriebliche Ausfallsicherheit fest.
• Entwickeln Sie Referenzarchitekturen, High-Level-/Low-Level-Designs, Kapazitätsmodelle, Stücklisten, Technologiebewertungen und Implementierungs-Roadmaps.
• Leitung technischer Bewertungen, Proof-of-Concepts, Anbieterbewertungen und Architekturprüfungsgremien.
• Arbeiten Sie mit Infrastruktur-, Netzwerk-, Sicherheits-, Speicher-, Cloud-, Daten-, Anwendungs- und Betriebsteams zusammen.
• Definieren Sie Leistungs-, Verfügbarkeits-, Skalierbarkeits-, Sicherheits- und Kostenziele und validieren Sie die Architektur anhand messbarer Akzeptanzkriterien.
• Übernehmen Sie technische Führung bei Bereitstellung, Migration, Integration, Fehlerbehebung und Produktionsübergang.
• Erforderliche technische Fähigkeiten
KI/ML-Architektur
• NVIDIA AI Enterprise, NGC, CUDA, NCCL, DCGM, GPU Operator und KI-Plattform-Ökosystem.
• PyTorch, TensorFlow, JAX und operatives Verständnis von Trainings- und Inferenz-Workloads.
• GPU-Planung, Mandantenfähigkeit, MIG/vGPU, GPU-Nutzung und Workload-Platzierung.
• LLM, generative KI, RAG, Feinabstimmung, Modellbereitstellung und Inferenzarchitektur.
GPU- und KI-Fabrikinfrastruktur
• NVIDIA A100/H100/H200/B200 oder gleichwertige GPU-Plattformen; Vertrautheit mit Systemen der nächsten Generation.
• NVLink, NVSwitch, PCIe-Topologie und Multi-GPU-Leistungsarchitektur.
• DGX/HGX/OEM GPU-Serverarchitektur und Lebenszyklusverwaltung.
• KI-Fabrikkapazitätsplanung, Rackdichte, Stromversorgung, Kühlung, Inbetriebnahme und Lebenszyklusstrategie.
Hochleistungsnetzwerke
• 100/200/400/800G Ethernet, InfiniBand, RoCEv2 und RDMA, Netris
• NVIDIA ConnectX/SuperNIC-, Spectrum/Spectrum-X-, Quantum- und BlueField-DPU-Technologien.
• BGP, EVPN/VXLAN, VRF, ECMP, VLAN, MTU, PFC, ECN, QoS und Überlastungsmanagement.
• GPU-Ost-West-Verkehr, GPUDirect RDMA und Fehlerbehebung bei der Netzwerkleistung.
KI-Speicher- und Datenarchitektur
• Parallele Dateisysteme, Objektspeicher, NFS, NVMe/NVMe-oF und Datenpipelines mit hohem Durchsatz.
• Ceph, WEKA, VAST, Dell PowerScale, Pure FlashBlade, NetApp oder gleichwertige Technologien.
• Data Lake/Lakehouse-Konzepte, Metadaten, Herkunft, Datenbewegung und Datenlebenszyklus.
• GPUDirect Storage und Optimierung der Speicher-/Netzwerkleistung.
KI-Plattform und Orchestrierung
• Kubernetes, GPU-Operator, Containerlaufzeiten und Kubernetes-GPU-Planung.
• HPC oder andere gleichwertige Workload-Planer.
• Modellbereitstellungs-/Inferenzplattformen und MLOps-Plattformarchitektur.
• API-Gateways, Service Discovery, Secrets Management und Plattformintegration.
Cloud- und Hybridarchitektur
• AWS- und/oder Azure-KI-Infrastruktur- und Sicherheitsdienste.
• Hybrid-Cloud-Konnektivität, IAM, private Netzwerke, Cloud-Speicher und Workload-Platzierung.
• Cloud-Kostenoptimierung, Kapazitätsplanung und FinOps-Überlegungen für GPU-Workloads.
Sicherheit und Governance
• Zero Trust, Netzwerksegmentierung, IAM/RBAC, PAM und Workload-Identität.
• GPU-, DPU-, Container-, Kubernetes-, Firmware- und Lieferkettensicherheit.
• Verschlüsselung im Ruhezustand/während der Übertragung, Geheimnisverwaltung, Audit-Protokollierung und Compliance-Kontrollen.
• KI-spezifische Risiken, einschließlich Daten-/Modellschutz, Mandantenisolierung und sicherer Modellzugriff.
Beobachtbarkeit und Zuverlässigkeit
• Prometheus, Grafana, OpenTelemetry, NVIDIA DCGM und Infrastrukturtelemetrie.
• Überwachung über GPU-, CPU-, Speicher-, Netzwerk-, Speicher-, Energie- und Wärmedomänen hinweg.
• Hochverfügbarkeit, Sicherung/Wiederherstellung, Notfallwiederherstellung, Geschäftskontinuität und Fehlerdomänendesign.
• Performance-Engineering, Engpassanalyse, SLO/SLA-Design und Kapazitätsprognose.
Architekturleistungen
• AI Factory-Referenzarchitektur und Lösungsentwürfe
• High-Level-Design (HLD) und Low-Level-Design (LLD)
• Netzwerk-, Rechen-, GPU- und Speicherarchitekturdiagramme
• Kapazitäts-, Leistungs- und Skalierbarkeitsmodelle
• Technologiebewertungs- und Anbietervergleichsdokumente
• Eingaben zur Sicherheitsarchitektur und zum Bedrohungsmodell
• Stücklisten (BOM) und Infrastrukturdimensionierung
• Migrations-/Bereitstellungsstrategie und Implementierungs-Roadmap
• Checkliste für die Betriebsbereitschaft, Runbooks und Akzeptanzkriterien
Erfahrung und Qualifikationen
• Mehr als 10 Jahre Erfahrung in den Bereichen Infrastruktur, Cloud, Unternehmensarchitektur oder Lösungsarchitektur mit erheblicher Erfahrung in der KI/GPU-Infrastruktur.
• Nachgewiesene Erfahrung in der Gestaltung großer Unternehmensplattformen und der Umsetzung von Geschäftsanforderungen in technische Architekturen.
• Praktisches Verständnis der physischen Infrastruktur, GPU-Systeme, Netzwerke, Speicher und Linux-Plattformen.
• Bachelor-Abschluss in Informatik, Ingenieurwesen, Informationstechnologie oder einem verwandten Bereich bevorzugt.…
Quelle: EU Remote Jobs (https://euremotejobs.com/job/ai-solution-architect-2/)
Dieses Angebot stammt aus einem Partner-Feed. Bewerben Sie sich auf der Quell-Website.
Quelle: Uvation
Inserat bereitgestellt von Uvation.