2GIS Careers · собрана 2 дня назад

Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)

2GIS

ГибридРоссия

Описание вакансии

2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей.Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.Чем предстоит заниматьсяРазвивать Incident & Problem Managementвнедрять и развивать единый процесс управления инцидентами;формировать культуру postmortem-разборов без поиска виноватых;контролировать выполнение action items, направленных на предотвращение повторных сбоев;улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования.Развивать observabilityстандартизировать внедрение OpenTelemetry: трассировок, метрик и логов;участвовать в создании единой платформы мониторинга и визуализации;разрабатывать стандарты логирования;контролировать объём и качество данных, поступающих в системы телеметрии.Трансформировать подход к алертингупроводить аудит существующих алертов и снижать число ложных срабатываний;формировать единые принципы приоритизации алертов с учётом критичности сервисов;помогать командам настраивать полезные, своевременные и понятные уведомления.Внедрять SRE-практики и повышать зрелость командучаствовать в классификации сервисов по уровням критичности: MC, BC, BO, OP;помогать командам определять и внедрять SLO/SLA;создавать дашборды для контроля Error Budget;разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов;консультировать продуктовые команды по вопросам стабильности и надёжности.Автоматизировать процессыформировать требования к развитию платформы дежурств и интеллектуальной эскалации;внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков.Мы ожидаем, что тыРаботаешь в SRE или DevOps от 3 лет.Хорошо понимаешь принципы SRE: SLO, SLA, Error Budget, Incident Management и Observability.Имеешь практический опыт работы с системами мониторинга и алертинга — например, Prometheus и Grafana.Работал с OpenTelemetry или аналогичными инструментами.Автоматизируешь процессы на Python, Go, Bash или другом языке.Понимаешь принципы работы on-call-ротаций и систем управления инцидентами.Умеешь анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения.Знаком с CI/CD, Kubernetes и контейнеризацией.Будет плюсом, если тыВнедрял SRE-практики с нуля или участвовал в их масштабировании в растущей компании.Проводил воркшопы, обучал или менторил продуктовые команды по вопросам надёжности.Что предлагаемВозможность стать одним из первых участников нового стратегического направления и напрямую влиять на его развитие.Масштабные технические задачи: ты будешь работать над стабильностью сервисов, которыми пользуются миллионы людей.Реальное влияние на процессы: поможешь снизить уровень хаоса, сделать реагирование на инциденты и релизы более предсказуемыми.Пространство для инженерных решений: команда формируется сейчас, поэтому можно участвовать в выборе подходов, стандартов и инструментов.ИТ-акредитациюУдаленную работу по РФ или гибрид в городах, где есть офис (Новосибирск, Москва, Санкт-Петербург).