AI / LLM Inference Engineer
Ключевые ИТ Решения · Москва ·
- Work mode
- Remote
- Category
- AI engineering
Ключевые ИТ Решения · Москва ·
БиАйЭй-Технолоджиз · Москва
СОГАЗ: г. Москва · Москва
SpbDev · Москва
Градиент · Москва
Engineer AI/LLM inference on GPU clusters: benchmark, tune, and optimize model serving with vLLM, Triton, or TensorRT-LLM to hit latency, throughput, and memory targets.
ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры.
Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков.
Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов.
Что предстоит делать:
Что для нас важно:
Будет плюсом:
Технологический контур:
OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible.
Условия:
— график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар)
— бессрочный трудовой договор.
— бонусная система, включая проектные премии.
— ДМС, программы психологической поддержки.
— компания оплачивает обучение и сертификацию.
— преимущества работы в IT-компании.