Empleo
Del feed del socio
Ingeniero de IA - Inferencia
Precio a consultar
Detalles
- Tipo de empleo
- Jornada completa
- Remoto
- No
- Empresa
- Security Engineer, Application - Greenhouse
- Location raw
- Sydney, australia
Descripción
Traducido automáticamente de English. El texto original es el oficial. Traducción automática — se está preparando una más precisa.
Tecnologías Firmus
Firmus Technologies es un líder global pionero en el desarrollo y operación de infraestructura de IA eficiente en toda Asia Pacífico.
Fundada en Australia en 2019, nuestra misión es crear la infraestructura de IA más eficiente combinando tecnología de vanguardia con un firme compromiso con la sostenibilidad.
En Firmus, somos únicos en nuestro enfoque. Diseñamos, construimos y operamos una nueva clase de infraestructura digital: la AI Factory. A través de nuestro enfoque tecnológico de modelo a red, hemos superado los límites de los sistemas de refrigeración líquida multigeneracionales, la gestión de energía, la orquestación de software de IA y la construcción. Para nuestros clientes, este enfoque nos permite hacer que cada vatio cuente y ofrecer tokens de IA de bajo costo a nivel mundial.
Nube de IA Firmus
Nuestra plataforma en la nube de GPU a gran escala, Firmus AI Cloud, está diseñada específicamente para ofrecer computación de IA con eficiencia energética a escala a los clientes.
Permite a los desarrolladores, empresas, instituciones educativas y usuarios gubernamentales entrenar e implementar modelos de IA con una eficiencia y ahorro de costos inigualables. Con un conjunto de servicios y aplicaciones en constante crecimiento, estamos comprometidos a brindar una experiencia en la nube líder en el mercado, patentada y diseñada a escala.
¿Por qué Firmus?
Como socio de ingeniería y nube de NVIDIA en Asia Pacífico, obtendrá habilidades, experiencia y exposición en toda la industria de la IA y será parte de la configuración de cómo será esta industria en las próximas décadas.
Estamos dirigidos por fundadores, no una gran empresa. Las decisiones se toman rápidamente, nuestros líderes son accesibles y existe una burocracia mínima entre usted y el trabajo. La propiedad llega temprano. Cualquiera que sea su función, tendrá una línea directa con los resultados, lo que ayudará a dar forma a cómo crece el negocio a medida que escalamos a nivel nacional a través de una hoja de ruta a gran escala y a largo plazo.
Trabaje junto a fundadores y expertos en infraestructura de inteligencia artificial, sistemas energéticos y computación de próxima generación.
Lo que construimos aquí tiene un impacto más allá del negocio. Nuestras fábricas de IA están diseñadas para operar como activos de la red energética para fortalecer activamente las comunidades y regiones en las que operan en lugar de aprovecharlas.
¿Está considerando postularse? No necesitas una experiencia perfecta para unirte a nuestro equipo. Si eres motivado y curioso, hay un camino para ti. Respaldamos a nuestra gente para que crezca en nuevos dominios y asuma desafíos más allá de su experiencia previa.
RESUMEN DE FUNCIONES
El ingeniero senior de IA (Inferencia) desarrollará y mejorará la capacidad de inferencia del equipo de IA y Aplicaciones, haciendo que los modelos estén disponibles como puntos finales confiables, seguros, escalables y de alto rendimiento para productos internos, clientes externos y futuras ofertas de Inferencia como servicio.
El puesto establecerá la base de ingeniería para el modelo autohospedado que sirve en el entorno de fábrica de IA de la organización. Esto incluye la incorporación de modelos, la implementación, el aprovisionamiento de terminales, la selección del tiempo de ejecución, la evaluación comparativa y la optimización del rendimiento, la observabilidad, la gestión de la capacidad, la seguridad y la gestión del ciclo de vida operativo. El objetivo es proporcionar a los usuarios un acceso predecible y eficiente a los modelos manteniendo al mismo tiempo el control sobre el rendimiento, el costo, el manejo de datos, la configuración de implementación y la utilización de la infraestructura.
El puesto es un colaborador clave en la hoja de ruta de aplicaciones agentes y productos Model-to-Grid. Convertirá las características del modelo y del tiempo de ejecución en recetas de inferencia repetibles y comparadas y perfiles de terminales que pueden informar la programación de cargas de trabajo, la ubicación teniendo en cuenta la topología, la planificación de capacidad, las recomendaciones de rendimiento y la toma de decisiones operativas. También proporcionará los puntos finales de modelo gobernados y adecuados que necesitan los sistemas agentes para el razonamiento, la recuperación, el uso de herramientas, el diagnóstico, la recomendación y la automatización controlada.
RESPONSABILIDADES CLAVE
• Construir, operar y mejorar continuamente servicios de inferencia de IA autohospedados para aplicaciones internas, productos orientados al cliente y futuras ofertas de inferencia como servicio.
• Definir e implementar flujos de trabajo de incorporación de modelos estándar que abarquen la admisión de modelos, la validación de compatibilidad, el empaquetado, la selección del tiempo de ejecución, la optimización, la implementación, el registro de terminales, las pruebas, el lanzamiento y la gestión del ciclo de vida.
• Suministre y administre puntos finales de inferencia seguros y escalables para patrones comunes de aplicaciones de IA, incluida la generación interactiva, RAG, incorporaciones, reclasificación, procesamiento por lotes, casos de uso multimodal, llamadas de herramientas y flujos de trabajo agentes.
• Desarrollar plantillas de implementación reutilizables, API, SDK, estándares de configuración y flujos de trabajo de autoservicio para que los usuarios soliciten, configuren, accedan, supervisen, actualicen y retiren puntos finales modelo.
• Trabajar con marcos de trabajo y kits de herramientas de inferencia líderes, como TensorRT-LLM, TensorRT, SGLang, vLLM, Triton Inference Server, NVIDIA Dynamo, NVIDIA NIM, CUDA, cuDNN, NCCL y herramientas relacionadas de servicio, creación de perfiles y observabilidad.
• Optimice el rendimiento del servicio de modelos utilizando técnicas apropiadas, incluyendo cuantificación, compilación, procesamiento por lotes, procesamiento por lotes continuo, enrutamiento de solicitudes, administración de caché KV, almacenamiento en caché de prefijos, decodificación especulativa, equilibrio de carga, enrutamiento de modelos, optimización de memoria y paralelismo distribuido.
• Cree y valide recetas de inferencia reutilizables que especifiquen versiones de modelos compatibles, versiones de marco y tiempo de ejecución, formatos de precisión, configuraciones de GPU, requisitos de topología, enfoques de escalado, perfiles de programador, resultados de pruebas comparativas y límites de rendimiento esperados.
• Utilice enfoques de cuantificación y optimización como NVFP4, FP8, INT8, compilación TensorRT, optimización del kernel, mecanismos de atención eficientes y técnicas de administración de memoria mientras mantiene los objetivos acordados de calidad del modelo.
• Diseñar configuraciones de inferencia distribuida para modelos grandes, incluidos tensor, canalización, experto, contexto y paralelismo de datos cuando corresponda.…
Fuente: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/security-engineer-application-greenhouse/ai-engineer-inference-sydney-australia-94778)
Firmus Technologies es un líder global pionero en el desarrollo y operación de infraestructura de IA eficiente en toda Asia Pacífico.
Fundada en Australia en 2019, nuestra misión es crear la infraestructura de IA más eficiente combinando tecnología de vanguardia con un firme compromiso con la sostenibilidad.
En Firmus, somos únicos en nuestro enfoque. Diseñamos, construimos y operamos una nueva clase de infraestructura digital: la AI Factory. A través de nuestro enfoque tecnológico de modelo a red, hemos superado los límites de los sistemas de refrigeración líquida multigeneracionales, la gestión de energía, la orquestación de software de IA y la construcción. Para nuestros clientes, este enfoque nos permite hacer que cada vatio cuente y ofrecer tokens de IA de bajo costo a nivel mundial.
Nube de IA Firmus
Nuestra plataforma en la nube de GPU a gran escala, Firmus AI Cloud, está diseñada específicamente para ofrecer computación de IA con eficiencia energética a escala a los clientes.
Permite a los desarrolladores, empresas, instituciones educativas y usuarios gubernamentales entrenar e implementar modelos de IA con una eficiencia y ahorro de costos inigualables. Con un conjunto de servicios y aplicaciones en constante crecimiento, estamos comprometidos a brindar una experiencia en la nube líder en el mercado, patentada y diseñada a escala.
¿Por qué Firmus?
Como socio de ingeniería y nube de NVIDIA en Asia Pacífico, obtendrá habilidades, experiencia y exposición en toda la industria de la IA y será parte de la configuración de cómo será esta industria en las próximas décadas.
Estamos dirigidos por fundadores, no una gran empresa. Las decisiones se toman rápidamente, nuestros líderes son accesibles y existe una burocracia mínima entre usted y el trabajo. La propiedad llega temprano. Cualquiera que sea su función, tendrá una línea directa con los resultados, lo que ayudará a dar forma a cómo crece el negocio a medida que escalamos a nivel nacional a través de una hoja de ruta a gran escala y a largo plazo.
Trabaje junto a fundadores y expertos en infraestructura de inteligencia artificial, sistemas energéticos y computación de próxima generación.
Lo que construimos aquí tiene un impacto más allá del negocio. Nuestras fábricas de IA están diseñadas para operar como activos de la red energética para fortalecer activamente las comunidades y regiones en las que operan en lugar de aprovecharlas.
¿Está considerando postularse? No necesitas una experiencia perfecta para unirte a nuestro equipo. Si eres motivado y curioso, hay un camino para ti. Respaldamos a nuestra gente para que crezca en nuevos dominios y asuma desafíos más allá de su experiencia previa.
RESUMEN DE FUNCIONES
El ingeniero senior de IA (Inferencia) desarrollará y mejorará la capacidad de inferencia del equipo de IA y Aplicaciones, haciendo que los modelos estén disponibles como puntos finales confiables, seguros, escalables y de alto rendimiento para productos internos, clientes externos y futuras ofertas de Inferencia como servicio.
El puesto establecerá la base de ingeniería para el modelo autohospedado que sirve en el entorno de fábrica de IA de la organización. Esto incluye la incorporación de modelos, la implementación, el aprovisionamiento de terminales, la selección del tiempo de ejecución, la evaluación comparativa y la optimización del rendimiento, la observabilidad, la gestión de la capacidad, la seguridad y la gestión del ciclo de vida operativo. El objetivo es proporcionar a los usuarios un acceso predecible y eficiente a los modelos manteniendo al mismo tiempo el control sobre el rendimiento, el costo, el manejo de datos, la configuración de implementación y la utilización de la infraestructura.
El puesto es un colaborador clave en la hoja de ruta de aplicaciones agentes y productos Model-to-Grid. Convertirá las características del modelo y del tiempo de ejecución en recetas de inferencia repetibles y comparadas y perfiles de terminales que pueden informar la programación de cargas de trabajo, la ubicación teniendo en cuenta la topología, la planificación de capacidad, las recomendaciones de rendimiento y la toma de decisiones operativas. También proporcionará los puntos finales de modelo gobernados y adecuados que necesitan los sistemas agentes para el razonamiento, la recuperación, el uso de herramientas, el diagnóstico, la recomendación y la automatización controlada.
RESPONSABILIDADES CLAVE
• Construir, operar y mejorar continuamente servicios de inferencia de IA autohospedados para aplicaciones internas, productos orientados al cliente y futuras ofertas de inferencia como servicio.
• Definir e implementar flujos de trabajo de incorporación de modelos estándar que abarquen la admisión de modelos, la validación de compatibilidad, el empaquetado, la selección del tiempo de ejecución, la optimización, la implementación, el registro de terminales, las pruebas, el lanzamiento y la gestión del ciclo de vida.
• Suministre y administre puntos finales de inferencia seguros y escalables para patrones comunes de aplicaciones de IA, incluida la generación interactiva, RAG, incorporaciones, reclasificación, procesamiento por lotes, casos de uso multimodal, llamadas de herramientas y flujos de trabajo agentes.
• Desarrollar plantillas de implementación reutilizables, API, SDK, estándares de configuración y flujos de trabajo de autoservicio para que los usuarios soliciten, configuren, accedan, supervisen, actualicen y retiren puntos finales modelo.
• Trabajar con marcos de trabajo y kits de herramientas de inferencia líderes, como TensorRT-LLM, TensorRT, SGLang, vLLM, Triton Inference Server, NVIDIA Dynamo, NVIDIA NIM, CUDA, cuDNN, NCCL y herramientas relacionadas de servicio, creación de perfiles y observabilidad.
• Optimice el rendimiento del servicio de modelos utilizando técnicas apropiadas, incluyendo cuantificación, compilación, procesamiento por lotes, procesamiento por lotes continuo, enrutamiento de solicitudes, administración de caché KV, almacenamiento en caché de prefijos, decodificación especulativa, equilibrio de carga, enrutamiento de modelos, optimización de memoria y paralelismo distribuido.
• Cree y valide recetas de inferencia reutilizables que especifiquen versiones de modelos compatibles, versiones de marco y tiempo de ejecución, formatos de precisión, configuraciones de GPU, requisitos de topología, enfoques de escalado, perfiles de programador, resultados de pruebas comparativas y límites de rendimiento esperados.
• Utilice enfoques de cuantificación y optimización como NVFP4, FP8, INT8, compilación TensorRT, optimización del kernel, mecanismos de atención eficientes y técnicas de administración de memoria mientras mantiene los objetivos acordados de calidad del modelo.
• Diseñar configuraciones de inferencia distribuida para modelos grandes, incluidos tensor, canalización, experto, contexto y paralelismo de datos cuando corresponda.…
Fuente: Arbeitnow (https://www.arbeitnow.co.uk/jobs/companies/security-engineer-application-greenhouse/ai-engineer-inference-sydney-australia-94778)
Este anuncio proviene de un feed de socios. Solicítalo en el sitio web de origen.
Ubicación
Sydney, Australia
Publicación proporcionada por Security Engineer, Application - Greenhouse.