SRE в команду АИ-платформы
HR Prime · Россия ·
- Seniority
- Middle
- Category
- SRE
Ищем SRE в команду AI-платформы.
Проект — высоконагруженный сервис, который позволяет компаниям загружать внутренние документы и использовать их как базу знаний для ИИ. Сервис сам индексирует документы, выполняет поиск нужной информации и передает найденные данные LLM для формирования ответов на вопросы пользователей.
Что делать
- Отвечать за стабильность и надежность production-среды.
- Настраивать и развивать SLI/SLO, метрики, алерты, дашборды и ранбуки.
- Повышать наблюдаемость и отказоустойчивость сервисов.
- Участвовать в расследовании и устранении инцидентов.
- Проводить постмортемы и разрабатывать меры для предотвращения повторных аварий.
- Разрабатывать и поддерживать планы аварийного восстановления (DRP).
- Участвовать в развитии процессов и практик SRE.
Что важно
- Уверенно работать с Linux и иметь опыт промышленной эксплуатации систем.
- Понимать принципы load balancing, circuit breaker, disaster recovery и других механизмов отказоустойчивости.
- Хорошо понимать SLI/SLO и уметь применять их на практике.
- Опыт работы с Kubernetes, Grafana и Prometheus.
- Понимать принципы IaC.
- Разбираться в сетях и уметь находить и устранять проблемы сетевого взаимодействия.
Будет плюсом:
- Go, Python, Bash.
- Опыт проектирования отказоустойчивых и масштабируемых сервисов.
- Опыт работы с системами управления конфигурациями.
Условия
- Оформление по ТК РФ.
- Конкурентная зарплата + годовой бонус.
- ДМС со стоматологией с возможностью подключить родственников.
- Гибридный или удалённый формат работы на территории РФ.