İş
Ortak beslemesinden
Kıdemli Yazılım Mühendisi, Bilgi İşlem Platformu
$165.000 Maaş
Detaylar
- Çalışma türü
- Tam zamanlı
- Uzaktan
- Evet
- Maaş alt limiti
- 165.000
- Maaş üst limiti
- 225.000
- Şirket
- Moonlite
Açıklama
English dilinden otomatik çevrildi. Orijinal metin esas alınmalıdır. Makine çevirisi — daha doğru bir çeviri hazırlanıyor.
Moonlite, yoğun hesaplamalı araştırma, büyük ölçekli model eğitimi ve zorlu veri işleme iş yükleri yürüten kuruluşlar için yüksek performanslı yapay zeka altyapısı sağlar. Tesislerimizde dağıtılan veya tesislerinizde ortak konumlu altyapı sağlayarak, mevcut veri merkezinizin bir uzantısı gibi hissettiren esnek isteğe bağlı veya ayrılmış bilgi işlem sağlıyoruz. Yapay zeka altyapısı uzmanlarından oluşan ekibimiz, çıplak donanım performansını bulutta yerel operasyonel basitlikle birleştirerek araştırma ekiplerinin ve kuruluşların zorlu yapay zeka iş yüklerini kurumsal düzeyde güvenilirlik ve uyumlulukla dağıtmasına olanak tanır.
Rolünüz:
Dağıtılmış yapay zeka eğitimi ve çıkarımına, büyük ölçekli simülasyonlara ve hesaplamalı araştırma iş yüklerine güç veren GPU ile hızlandırılmış bilgi işlem platformumuzu oluşturmada etkili olacaksınız. Ürünle, platform ekibi üyelerinizle ve altyapı uzmanlarıyla yakın işbirliği içinde çalışarak GPU kümelerini, çıplak donanım sağlamayı ve kaynak planlamayı yöneten, araştırmacıların ve mühendislerin yüksek performanslı bilgi işlem kaynaklarına bulut benzeri basitlikle programlı bir şekilde erişmesine olanak tanıyan bilgi işlem düzenleme katmanını tasarlayacak ve uygulayacaksınız.
İş Sorumlulukları
•
Bilgi İşlem Düzenleme Sistemleri: GPU kümelerini, yalın sunucu sağlamayı ve ortak konumdaki altyapı ortamlarında kaynak tahsisini yöneten ölçeklenebilir bilgi işlem düzenleme platformları tasarlayın ve oluşturun.
•
Kaynak Yönetimi ve Planlama: Araştırma ve eğitim iş yükleri için performans garantilerini korurken GPU kullanımını en üst düzeye çıkaran akıllı iş yükü planlama, kaynak tahsisi ve optimizasyon algoritmaları uygulayın.
•
Araştırma Kümesi Sağlama: Kubernetes ve SLURM kümeleri de dahil olmak üzere araştırma bilgi işlem ortamlarının sağlanması ve yönetilmesi için sistemler tasarlayın ve uygulayın; dağıtılmış yapay zeka eğitimi ve HPC iş yükleri için otomatik dağıtım, kaynak planlama ve iş yükü orkestrasyonunu etkinleştirin.
•
GPU Platform Mühendisliği: GPU kaynak yönetimi, çok kiracılı izolasyon ve bilgi işlem düzenleme sistemleriyle entegrasyon dahil olmak üzere en yeni nesil NVIDIA GPU yapılandırmalarını (H100, H200, B200, B300) yönetmek için platform yetenekleri geliştirin.
•
Bare-Metal Yaşam Döngüsü Yönetimi: İlk provizyon ve konfigürasyondan devam eden operasyonlara, güncellemelere ve kaynak yeniden tahsisine kadar eksiksiz bir bare-metal sunucu yaşam döngüsü yönetimi için otomasyon ve araçlar oluşturun.
•
Performans Açısından Kritik Sistemler: Bilgi işlem platformu bileşenlerini yüksek işlem hacmi ve düşük gecikme süreli performans için optimize ederek araştırma iş yüklerinin sanallaştırılmış veya konteynerleştirilmiş ortamlarda neredeyse tamamen verimliliğe ulaşmasını sağlayın.
•
Platform API'leri ve Entegrasyonu: Araştırmacıların bilgi işlem kaynaklarını programlı bir şekilde tedarik etmesine ve yönetmesine, mevcut iş akışları ve araştırma altyapısıyla sorunsuz bir şekilde entegre olmasına olanak tanıyan güçlü API'ler ve SDK'lar geliştirin.
•
Gözlemlenebilirlik ve İzleme: Bilgi işlem kaynakları için kapsamlı izleme ve telemetri sistemleri uygulayarak GPU sanallaştırmasına, iş yükü performansına ve altyapı sağlığına ilişkin görünürlük sağlar.
•
Çoklu Kiralama ve Yalıtım: GPU altyapısının ekipler ve kuruluşlar arasında güvenli bir şekilde paylaşılmasını sağlayan kurumsal düzeyde çok kiracılı bilgi işlem izolasyonu, güvenlik sınırları ve kaynak kotaları oluşturun.
Gereksinimler
•
Deneyim: Üretim ortamları için bilgi işlem platformları, konteyner düzenleme sistemleri veya dağıtılmış bilgi işlem altyapısı oluşturma konusunda kanıtlanmış deneyime sahip yazılım mühendisliğinde 5 yıldan fazla.
•
Bilgi İşlem Platformu Mühendisliği: Geniş ölçekte bilgi işlem orkestrasyonu, kaynak planlaması veya iş yükü yönetimi sistemleri oluşturma konusunda güçlü bir deneyim.
•
Kubernetes ve Container Orchestration: Kubernetes mimarisine, konteyner orkestrasyonu kavramlarına güçlü aşinalık ve Kubernetes ortamlarında iş yüklerini dağıtma deneyimi. Pod'ları, dağıtımları, hizmetleri ve temel Kubernetes işlemlerini anlama.
•
Programlama Becerileri: Performans açısından kritik bileşenler için Go, C/C++, Python veya Rust deneyimi son derece değerlidir.
•
Linux ve Sistem Programlama: Programlama sistemleri, performans optimizasyonu ve alt düzey kaynak yönetimi de dahil olmak üzere, üretim ortamlarında Linux ile ilgili güçlü deneyim.
•
Sanallaştırma ve Konteynerler: Sanallaştırma teknolojileri (KVM, Xen), konteyner çalışma zamanları ve orkestrasyon platformları hakkında derin bilgi.
•
GPU Bilgi İşlemin Temelleri: GPU mimarilerini, CUDA programlamayı (gerektiğinde/nerede) ve GPU kaynak yönetimini anlamak veya hızlı öğrenme konusunda güçlü bir beceri.
•
Çıplak Metal Altyapı: Çıplak donanım sağlama, bant dışı yönetim sistemleri ve donanım soyutlama katmanları deneyimi.
•
Problem Çözme ve Mimari: Pragmatik sevkıyatı iyi uzun vadeli mimariyle dengelerken karmaşık performans ve ölçeklenebilirlik zorluklarını çözme becerisi gösterildi.
•
Özerklik ve İletişim: Belirsizliklerde rahatça gezinme, gereksinimleri işbirliği içinde tanımlama ve teknik tartışmaları anlaşılır belgeler aracılığıyla iletme.
•
Büyümeye Bağlılık: Öğrenmeye ve mesleki gelişime sürekli odaklanan büyüme zihniyeti.
Tercih Edilen Nitelikler
• Araştırma bilgi işlem ortamlarının arka planda sağlanması veya yönetilmesi (Kubernetes, SLURM veya HPC kümeleri)
• GPU sanallaştırma teknolojileri (SR-IOV, NVIDIA vGPU) ve çok kiracılı GPU paylaşımı deneyimi
• Özel planlama veya kaynak yönetimine sahip konteyner düzenleme platformlarının arka planı
• GPU iletişimi için yüksek performanslı ağ iletişimi bilgisi (InfiniBand, RDMA, NVLink, NVSwitch)
• AI/ML eğitim çerçeveleri (PyTorch, TensorFlow) ve bunların altyapı gereksinimlerine aşinalık
• Dağıtılmış eğitim modellerinin ve çok düğümlü GPU koordinasyonunun anlaşılması
• Araştırma kurumları, laboratuvarlar veya teknik bilgi işlem ortamları için altyapı oluşturma deneyimi…
Kaynak: Himalayalar (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Rolünüz:
Dağıtılmış yapay zeka eğitimi ve çıkarımına, büyük ölçekli simülasyonlara ve hesaplamalı araştırma iş yüklerine güç veren GPU ile hızlandırılmış bilgi işlem platformumuzu oluşturmada etkili olacaksınız. Ürünle, platform ekibi üyelerinizle ve altyapı uzmanlarıyla yakın işbirliği içinde çalışarak GPU kümelerini, çıplak donanım sağlamayı ve kaynak planlamayı yöneten, araştırmacıların ve mühendislerin yüksek performanslı bilgi işlem kaynaklarına bulut benzeri basitlikle programlı bir şekilde erişmesine olanak tanıyan bilgi işlem düzenleme katmanını tasarlayacak ve uygulayacaksınız.
İş Sorumlulukları
•
Bilgi İşlem Düzenleme Sistemleri: GPU kümelerini, yalın sunucu sağlamayı ve ortak konumdaki altyapı ortamlarında kaynak tahsisini yöneten ölçeklenebilir bilgi işlem düzenleme platformları tasarlayın ve oluşturun.
•
Kaynak Yönetimi ve Planlama: Araştırma ve eğitim iş yükleri için performans garantilerini korurken GPU kullanımını en üst düzeye çıkaran akıllı iş yükü planlama, kaynak tahsisi ve optimizasyon algoritmaları uygulayın.
•
Araştırma Kümesi Sağlama: Kubernetes ve SLURM kümeleri de dahil olmak üzere araştırma bilgi işlem ortamlarının sağlanması ve yönetilmesi için sistemler tasarlayın ve uygulayın; dağıtılmış yapay zeka eğitimi ve HPC iş yükleri için otomatik dağıtım, kaynak planlama ve iş yükü orkestrasyonunu etkinleştirin.
•
GPU Platform Mühendisliği: GPU kaynak yönetimi, çok kiracılı izolasyon ve bilgi işlem düzenleme sistemleriyle entegrasyon dahil olmak üzere en yeni nesil NVIDIA GPU yapılandırmalarını (H100, H200, B200, B300) yönetmek için platform yetenekleri geliştirin.
•
Bare-Metal Yaşam Döngüsü Yönetimi: İlk provizyon ve konfigürasyondan devam eden operasyonlara, güncellemelere ve kaynak yeniden tahsisine kadar eksiksiz bir bare-metal sunucu yaşam döngüsü yönetimi için otomasyon ve araçlar oluşturun.
•
Performans Açısından Kritik Sistemler: Bilgi işlem platformu bileşenlerini yüksek işlem hacmi ve düşük gecikme süreli performans için optimize ederek araştırma iş yüklerinin sanallaştırılmış veya konteynerleştirilmiş ortamlarda neredeyse tamamen verimliliğe ulaşmasını sağlayın.
•
Platform API'leri ve Entegrasyonu: Araştırmacıların bilgi işlem kaynaklarını programlı bir şekilde tedarik etmesine ve yönetmesine, mevcut iş akışları ve araştırma altyapısıyla sorunsuz bir şekilde entegre olmasına olanak tanıyan güçlü API'ler ve SDK'lar geliştirin.
•
Gözlemlenebilirlik ve İzleme: Bilgi işlem kaynakları için kapsamlı izleme ve telemetri sistemleri uygulayarak GPU sanallaştırmasına, iş yükü performansına ve altyapı sağlığına ilişkin görünürlük sağlar.
•
Çoklu Kiralama ve Yalıtım: GPU altyapısının ekipler ve kuruluşlar arasında güvenli bir şekilde paylaşılmasını sağlayan kurumsal düzeyde çok kiracılı bilgi işlem izolasyonu, güvenlik sınırları ve kaynak kotaları oluşturun.
Gereksinimler
•
Deneyim: Üretim ortamları için bilgi işlem platformları, konteyner düzenleme sistemleri veya dağıtılmış bilgi işlem altyapısı oluşturma konusunda kanıtlanmış deneyime sahip yazılım mühendisliğinde 5 yıldan fazla.
•
Bilgi İşlem Platformu Mühendisliği: Geniş ölçekte bilgi işlem orkestrasyonu, kaynak planlaması veya iş yükü yönetimi sistemleri oluşturma konusunda güçlü bir deneyim.
•
Kubernetes ve Container Orchestration: Kubernetes mimarisine, konteyner orkestrasyonu kavramlarına güçlü aşinalık ve Kubernetes ortamlarında iş yüklerini dağıtma deneyimi. Pod'ları, dağıtımları, hizmetleri ve temel Kubernetes işlemlerini anlama.
•
Programlama Becerileri: Performans açısından kritik bileşenler için Go, C/C++, Python veya Rust deneyimi son derece değerlidir.
•
Linux ve Sistem Programlama: Programlama sistemleri, performans optimizasyonu ve alt düzey kaynak yönetimi de dahil olmak üzere, üretim ortamlarında Linux ile ilgili güçlü deneyim.
•
Sanallaştırma ve Konteynerler: Sanallaştırma teknolojileri (KVM, Xen), konteyner çalışma zamanları ve orkestrasyon platformları hakkında derin bilgi.
•
GPU Bilgi İşlemin Temelleri: GPU mimarilerini, CUDA programlamayı (gerektiğinde/nerede) ve GPU kaynak yönetimini anlamak veya hızlı öğrenme konusunda güçlü bir beceri.
•
Çıplak Metal Altyapı: Çıplak donanım sağlama, bant dışı yönetim sistemleri ve donanım soyutlama katmanları deneyimi.
•
Problem Çözme ve Mimari: Pragmatik sevkıyatı iyi uzun vadeli mimariyle dengelerken karmaşık performans ve ölçeklenebilirlik zorluklarını çözme becerisi gösterildi.
•
Özerklik ve İletişim: Belirsizliklerde rahatça gezinme, gereksinimleri işbirliği içinde tanımlama ve teknik tartışmaları anlaşılır belgeler aracılığıyla iletme.
•
Büyümeye Bağlılık: Öğrenmeye ve mesleki gelişime sürekli odaklanan büyüme zihniyeti.
Tercih Edilen Nitelikler
• Araştırma bilgi işlem ortamlarının arka planda sağlanması veya yönetilmesi (Kubernetes, SLURM veya HPC kümeleri)
• GPU sanallaştırma teknolojileri (SR-IOV, NVIDIA vGPU) ve çok kiracılı GPU paylaşımı deneyimi
• Özel planlama veya kaynak yönetimine sahip konteyner düzenleme platformlarının arka planı
• GPU iletişimi için yüksek performanslı ağ iletişimi bilgisi (InfiniBand, RDMA, NVLink, NVSwitch)
• AI/ML eğitim çerçeveleri (PyTorch, TensorFlow) ve bunların altyapı gereksinimlerine aşinalık
• Dağıtılmış eğitim modellerinin ve çok düğümlü GPU koordinasyonunun anlaşılması
• Araştırma kurumları, laboratuvarlar veya teknik bilgi işlem ortamları için altyapı oluşturma deneyimi…
Kaynak: Himalayalar (https://himalayas.app/companies/moonlite/jobs/senior-software-engineer-compute-platform-9024339573)
Bu ilan bir ortak kaynağından gelmektedir. Başvuruyu kaynak web sitesinde yapın.
Kaynak: Moonlite
İlan Moonlite tarafından sağlanmıştır.