Getmatch · собрана 16 часов назад

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Сбер

500 000–1 000 000 ₽
ГибридОфисРоссияLead
Python

Описание вакансии

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat Grade: Lead Salary: 500000-1000000 RUB Skills: Python, PyTorch, Machine Learning, LLM, ML, VLLM, Python / Data Scientist & Machine Learning Company URL: Description: Мы развиваем GigaChat и ищем сильного ML-инженера в команду online-RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели. Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат. Обязанности Разрабатывать и улучшать методы online-RL. Реализовывать и дорабатывать подходы post-training и online-RL. Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин. Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач. Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру. Строить и развивать инфраструктуру обучения. Разрабатывать и поддерживать пайплайны online-RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели. Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций. Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест. Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять. Работать с данными и системой оценки качества. Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки. Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек. Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения. Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры. Брать на себя ответственность за целые куски системы: от идеи до результата в проде. Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества. Требования Отличное владение Python и PyTorch. Практический опыт в LLM post-training: RLHF, online-RL, DPO или смежных направлениях. Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы. Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги. Умение писать чистый, надёжный, production-ready код. Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места. Будет плюсом: Опыт работы с reward-моделями, process-reward-моделями, LLM-as-a-judge. Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач. Опыт работы с large-scale inference и оптимизацией генерации (vLLM, SGLang и т. д.). Понимание современных open-source стеков для обучения LLM (verl, Megatron, TRL и др.). Публикации, open-source-вклад или сильный прикладной track record. Условия Возможность выбрать удобный формат работы: гибрид или офис. Ежегодный пересмотр зарплаты, годовая премия. Корпоративный спортзал и зоны отдыха. Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития. Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа. Ипотека выгоднее до 7% для каждого сотрудника. Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнёров. Вознаграждение за рекомендацию друзей в команду Сбера. 5:["$","$L18",null,{"initialState":{"status":"anonymous"},"children":[["$","$L19",null,{}],["$","main",null,{"children":["$","$L1a",null,{"vacancySlug":"36051-rukovoditel-napravleniia-online-rl-stem","initialVacancy":{"published_at":"2026-10-03T09:00:51.368734","is_active":true,"position":"Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat","language":"ru","type":"only_web","id":36051,"offer_type":"vacancy","cover_letter_required":false,"cover_letter_placeholder":null,"source":"hh_import","incognito_publication":false,"salary_description":"500 000 —‍ 1 000 000 ₽/‍мес на руки","salary_hidden":false,"salary_display_from":500000,"salary_display_to":1000000,"salary_currency":"RUB","salary_taxes":"net","salary_is_total":false,"salary_by_our_version":false,"salary_hidden_variant":null,"offer_description":"Что делать: Разрабатывать и улучшать методы online RL, реализовывать и дорабатывать подходы post-training и online RL, проектировать и проводить эксперименты, анализируя результаты и причины изменений.\n\nО компании: Сбербанк — крупнейший банк в России, Центральной и Восточной Европе, один из ведущих международных финансовых институтов.","skills_objects":[{"name":"Python","slug":"python","is_custom":false},{"name":"PyTorch","slug":"pytorch","is_custom":false},{"name":"Machine Learning","slug":"machine learning","is_custom":false},{"name":"LLM","slug":"llm","is_custom":false},{"name":"ML","slug":"ml","is_custom":false},{"name":"VLLM","slug":"vllm","is_custom":false}],"url":"/vacancies/36051-rukovoditel-napravleniia-online-rl-stem","description_html":null,"english_level":null,"location_requirements":[{"location_id":"moscow__mo__russia","format":"office","exclude":false,"ancestors":["moscow","mo__russia","russia","_cu-europe","_cu-emea","_cu-world"],"metros":[],"city":"Москва","country":"Россия"}],"location_items":[{"label":"Москва","format":"office","exclude":false}],"application":null,"viewed":false,"company":{"id":null,"name":"Сбер","logotype":"8f5d6d49-bb76-4250-9aa9-267e36fc5273.png","url":"/companies/GNRXrNQz-sber","industry":"Банки / Финтех","post_to_job_aggregators":true,"investments":"","size":"1001+","short_description":"Сбербанк — крупнейший банк в России, Центральной и Восточной Европе, один из ведущих международных финансовых институтов. Самый дорогой российский бренд и самый сильный банковский бренд в мире по версии Brand Finance. "},"one_day_offer_content":null,"one_day_offer_content_v3":null,"specialization":"Python / Data Scientist & Machine Learning","seniorities":["lead"],"team_size":null,"stack_description":"","short_description":"","description":"$1b","branding_blocks":[],"branding_css