SRE инженер (Москва)
200 000 — 442 200 руб
Условия
- Требуемый опыт работы: От 3 до 6 лет
Условия
- Требуемый опыт: От 3 до 6 лет
ТехВилл – IT-компания и партнёр ВкусВилл по развитию цифровых решений.
Мы отвечаем за разработку мобильных и web- приложений, автоматизацию бизнес-процессов, искусственный интеллект, devops, инфобез ВкусВилла.
Нашими решениями пользуется свыше 1 000 000 клиентов и сотрудников ВкусВилла.
Мы строим кластер, где GPU - основной ресурс, и SRE должен уметь его эксплуатировать так же хорошо, как и агентскую часть.
Обязанности:
- Поддержка сервисов и команд разработки со стороны инфраструктуры;
- Обеспечение надежности и масштабируемости систем;
- Выявление и устранение узких мест в производительности;
- Настройка систем мониторинга, логирования и трейсинга;
- Предотвращение потенциальных сбоев;
- Оптимизация CI/CD пайплайнов, внедрение инфраструктуры как код (IaC) и автоматизация рутинных задач;
- Продвижение практик DevOps в сторону разработки: внедрение best practices DevOps, таких как мониторинг SLA, SLO, SLI, анализ инцидентов (postmortem) и управление изменениями;
- Участие в создании и развитии инфраструктурных платформ;
- Обеспечение безопасности, надежности, отказоустойчивости и быстрого восстановления после сбоев платформы.
Требования:
- Практический опыт в администрировании и поддержки информационных систем семейства Linux (Debian, Ubuntu, Rocky);
- Владение bash или python как инструментарием для автоматизации рутинной деятельности;
- Практический опыт применения систем оркестрации контейнеров (Kubernetes, Docker compose);
- Практический опыт работы с контейнерами (Docker), знание основ построения Dockerfile и лучших практик в этой области;
- Владение системами управления конфигурациями (Ansible, Terraform, Pulumi) и практический опыт применения таких систем в процессах построения IaC (Infrastructure as Code;
- Применение инструментов GitLab CI и Jenkins в построении процессов сборки и доставки;
- Практический опыт применения и администрирования систем мониторинга на базе Prometheus, Zabbix, Grafana Stack, Alertmanager, VictoriaMetrics;
- Практический опыт взаимодействия с системами потоковой передачи событий (Kafka, RabbitMQ);
- Знание методологий Agile, опыт работы в тикетных системах (Yandex Tracker и др.) и системах хранения документации (Evawiki и другие Wiki);
- Практический опыт эксплуатации веб-серверов и балансировщиков нагрузки (Nginx, HAProxy, Traefik, APISIX);
- Практический опыт администрирования систем управления реляционными базами данных (PostgreSQL, Greenplum, MySQL), кластеризации на базе Patroni, а также колоночной СУБД ClickHouse;
- Практический опыт применения NoSQL и Key-Value систем (Elasticsearch, OpenSearch, etcd, Redis, Memcached);
- Практический опыт применения систем централизованного сбора и хранения логов на базе стеков: Logstash, Vector, Graylog, Loki;
- Практический опыт применения систем объектного хранения на базе S3 (MinIO), а также инструментов доступа к ним;
- Навыки работы с облачными системами (Yandex Cloud, Cloud.ru) и системами управления ими;
- Практический опыт оркестрации пайплайнов обработки данных на базе Apache Airflow;
- Опыт развертывания и сопровождения JupyterHub
- Владение инструментарием распределённой обработки данных (Apache Spark, Spark Streaming);
- Опыт работы с Iceberg REST Catalog как каталогом табличных данных;
- Практический опыт применения MLflow для отслеживания экспериментов, регистрации моделей и управления их жизненным циклом;
- Знакомство с векторными базами данных (Qdrant) в составе ML-платформы;
- Знакомство с платформой автоматизации процессов на базе n8n;
- Понимание/опыт развёртывания и эксплуатации LLM‑моделей на GPU (Triton Inference Server, vLLM, TensorRT‑LLM или аналоги);
- Знание GPU‑мониторинга: DCGM, Prometheus, метрики по использованию памяти, ядер, температуры, NVLink;
- Опыт профилирования инференса: оптимизация latency (TTFT, TPS), throughput, работа с KV‑cache;
- Управление ресурсами GPU в K8s: HAMi, MIG, time‑slicing, квотирование;
- Понимание работы с NVDEC/NVENC;
- Практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning → tool calling → validation;
- Опыт с Model Context Protocol: MCP-серверы и шлюзы, регистрация/проксирование инструментов, маршрутизация tool-calling между сервисами.
Условия:
- Работу в аккредитованной IT-компании.
- Удалённая работа: для нас важны результаты работы без привязки к месту;
- Официальное оформление с первого дня работы и поддержка куратора во время адаптации.
- Прозрачная система развития: понятные грейды, внутреннее и внешнее обучение, индивидуальные планы развития и матрицы компетенций.
- Экологичная культура и адекватные руководители.
- Компенсация затрат на медицинские услуги, ментальное благополучие, спорт, тимбилдинги и использование AI-помощников.
- Бонус 15% с покупок во ВкусВилл.
- Социальная ответственность: поощряем донорство, оказываем материальную помощь при рождении ребёнка.
- Партнерская программа «Зелёный свет»: за рекомендации знакомых специалистов можно получить до 50 000 руб.
Ключевые навыки
- SRE
- Kubernetes
- Docker
- Bash
Адрес
Москва