С картой выгоднее
Авторизуйтесь по номеру телефона, и мы найдём вашу карту лояльности или создадим новую. С картой вы сможете:
  • назначать скидку 20% на любимый продукт
  • получать 6 персональных скидок каждый день
  • пользоваться скидками программы лояльности
  • оформлять возврат онлайн
А ещё у нас есть приложение

SRE инженер (Москва)

200 000 — 442 200 руб
Условия
  • Требуемый опыт работы: От 3 до 6 лет
Условия
  • Требуемый опыт: От 3 до 6 лет

ТехВилл – IT-компания и партнёр ВкусВилл по развитию цифровых решений.

Мы отвечаем за разработку мобильных и web- приложений, автоматизацию бизнес-процессов, искусственный интеллект, devops, инфобез ВкусВилла.

Нашими решениями пользуется свыше 1 000 000 клиентов и сотрудников ВкусВилла.

Мы строим кластер, где GPU - основной ресурс, и SRE должен уметь его эксплуатировать так же хорошо, как и агентскую часть.

Обязанности:

  • Поддержка сервисов и команд разработки со стороны инфраструктуры;
  • Обеспечение надежности и масштабируемости систем;
  • Выявление и устранение узких мест в производительности;
  • Настройка систем мониторинга, логирования и трейсинга;
  • Предотвращение потенциальных сбоев;
  • Оптимизация CI/CD пайплайнов, внедрение инфраструктуры как код (IaC) и автоматизация рутинных задач;
  • Продвижение практик DevOps в сторону разработки: внедрение best practices DevOps, таких как мониторинг SLA, SLO, SLI, анализ инцидентов (postmortem) и управление изменениями;
  • Участие в создании и развитии инфраструктурных платформ;
  • Обеспечение безопасности, надежности, отказоустойчивости и быстрого восстановления после сбоев платформы.

Требования:

  • Практический опыт в администрировании и поддержки информационных систем семейства Linux (Debian, Ubuntu, Rocky);
  • Владение bash или python как инструментарием для автоматизации рутинной деятельности;
  • Практический опыт применения систем оркестрации контейнеров (Kubernetes, Docker compose);
  • Практический опыт работы с контейнерами (Docker), знание основ построения Dockerfile и лучших практик в этой области;
  • Владение системами управления конфигурациями (Ansible, Terraform, Pulumi) и практический опыт применения таких систем в процессах построения IaC (Infrastructure as Code;
  • Применение инструментов GitLab CI и Jenkins в построении процессов сборки и доставки;
  • Практический опыт применения и администрирования систем мониторинга на базе Prometheus, Zabbix, Grafana Stack, Alertmanager, VictoriaMetrics;
  • Практический опыт взаимодействия с системами потоковой передачи событий (Kafka, RabbitMQ);
  • Знание методологий Agile, опыт работы в тикетных системах (Yandex Tracker и др.) и системах хранения документации (Evawiki и другие Wiki);
  • Практический опыт эксплуатации веб-серверов и балансировщиков нагрузки (Nginx, HAProxy, Traefik, APISIX);
  • Практический опыт администрирования систем управления реляционными базами данных (PostgreSQL, Greenplum, MySQL), кластеризации на базе Patroni, а также колоночной СУБД ClickHouse;
  • Практический опыт применения NoSQL и Key-Value систем (Elasticsearch, OpenSearch, etcd, Redis, Memcached);
  • Практический опыт применения систем централизованного сбора и хранения логов на базе стеков: Logstash, Vector, Graylog, Loki;
  • Практический опыт применения систем объектного хранения на базе S3 (MinIO), а также инструментов доступа к ним;
  • Навыки работы с облачными системами (Yandex Cloud, Cloud.ru) и системами управления ими;
  • Практический опыт оркестрации пайплайнов обработки данных на базе Apache Airflow;
  • Опыт развертывания и сопровождения JupyterHub
  • Владение инструментарием распределённой обработки данных (Apache Spark, Spark Streaming);
  • Опыт работы с Iceberg REST Catalog как каталогом табличных данных;
  • Практический опыт применения MLflow для отслеживания экспериментов, регистрации моделей и управления их жизненным циклом;
  • Знакомство с векторными базами данных (Qdrant) в составе ML-платформы;
  • Знакомство с платформой автоматизации процессов на базе n8n;
  • Понимание/опыт развёртывания и эксплуатации LLM‑моделей на GPU (Triton Inference Server, vLLM, TensorRT‑LLM или аналоги);
  • Знание GPU‑мониторинга: DCGM, Prometheus, метрики по использованию памяти, ядер, температуры, NVLink;
  • Опыт профилирования инференса: оптимизация latency (TTFT, TPS), throughput, работа с KV‑cache;
  • Управление ресурсами GPU в K8s: HAMi, MIG, time‑slicing, квотирование;
  • Понимание работы с NVDEC/NVENC;
  • Практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning → tool calling → validation;
  • Опыт с Model Context Protocol: MCP-серверы и шлюзы, регистрация/проксирование инструментов, маршрутизация tool-calling между сервисами.

Условия:

  • Работу в аккредитованной IT-компании.
  • Удалённая работа: для нас важны результаты работы без привязки к месту;
  • Официальное оформление с первого дня работы и поддержка куратора во время адаптации.
  • Прозрачная система развития: понятные грейды, внутреннее и внешнее обучение, индивидуальные планы развития и матрицы компетенций.
  • Экологичная культура и адекватные руководители.
  • Компенсация затрат на медицинские услуги, ментальное благополучие, спорт, тимбилдинги и использование AI-помощников.
  • Бонус 15% с покупок во ВкусВилл.
  • Социальная ответственность: поощряем донорство, оказываем материальную помощь при рождении ребёнка.
  • Партнерская программа «Зелёный свет»: за рекомендации знакомых специалистов можно получить до 50 000 руб.
Ключевые навыки
  • SRE
  • Kubernetes
  • Docker
  • Bash
Адрес
Москва