ML-инженер (Online RL) / Post-Training LLM
Grade: Senior
Salary: 350000-550000 RUB
Skills: Python, PyTorch, Data Scientist & Machine Learning
Company URL:
Description:
Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.
Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.
Чем предстоит заниматься
Разрабатывать и улучшать методы online RL
Реализовывать и дорабатывать подходы post-training и online RL.
Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.
Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.
Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.
Строить и развивать инфраструктуру обучения
Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.
Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.
Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.
Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.
Работать с данными и системой оценки качества
Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.
Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.
Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения.
Работать в сильной команде
Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры.
Брать на себя ответственность за целые куски системы: от идеи до результата в проде.
Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.
Для нас важно
Отличное владение Python и PyTorch.
Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.
Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.
Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
Умение писать чистый, надёжный, production-ready код.
Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.
Будет плюсом
Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.
Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).
Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).
Публикации, open-source вклад или сильный прикладной track record.
Что предлагаем
Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте.
Команду сильных инженеров и исследователей, у которых есть чему поучиться.
Возможность совмещать инженерную и исследовательскую работу.
Конкурентную компенсацию, премии и расширенный соцпакет.
17:["$","$L18",null,{"initialState":{"status":"anonymous"},"children":[["$","$L19",null,{}],["$","main",null,{"children":["$","$L1a",null,{"vacancySlug":"33803-ml-inzhener-online-rl-post-training-llm","initialVacancy":{"published_at":"2026-07-11T09:00:50.663410","is_active":true,"position":"ML-инженер (Online RL) / Post-Training LLM","language":"ru","type":"web_and_tg","id":33803,"offer_type":"vacancy","cover_letter_required":false,"cover_letter_placeholder":"","source":"backoffice","incognito_publication":false,"analytics_id":"Ll0jWKvE","salary_description":"350 000 — 550 000 ₽/мес на руки","salary_hidden":false,"salary_display_from":350000,"salary_display_to":550000,"salary_currency":"RUB","salary_taxes":"net","salary_is_total":false,"salary_by_our_version":false,"salary_hidden_variant":null,"offer_description":"Что делать: Разрабатывать и улучшать методы online RL, строить и развивать инфраструктуру обучения, работать с данными и системой оценки качества.\n\nО компании: Сбербанк — крупнейший банк в России, Центральной и Восточной Европе, один из ведущих международных финансовых институтов.","skills_objects":[{"name":"Python","slug":"python","is_custom":false},{"name":"PyTorch","slug":"pytorch","is_custom":false}],"url":"/vacancies/33803-ml-inzhener-online-rl-post-training-llm","description_html":null,"english_level":null,"location_requirements":[{"location_id":"russia","format":"remote","exclude":false,"ancestors":["russia","_cu-europe","_cu-emea","_cu-world"],"metros":[],"city":"","country":"Россия"}],"location_items":[{"label":"Россия","format":"remote","exclude":false}],"application":null,"viewed":false,"company":{"id":null,"name":"Сбер","logotype":"8f5d6d49-bb76-4250-9aa9-267e36fc5273.png","salary_hidden_variant":null,"url":"/companies/GNRXrNQz-sber","industry":"Банки / Финтех","post_to_job_aggregators":true,"investments":"","size":"1001+","short_description":"Сбербанк — крупнейший банк в России, Центральной и Восточной Европе, один из ведущих международных финансовых институтов. Самый дорогой российский бренд и самый сильный банковский бренд в мире по версии Brand Finance.
"},"one_day_offer_content":null,"one_day_offer_content_v3":null,"specialization":"Data Scientist & Machine Learning","seniorities":["senior"],"team_size":"","stack_description":"","short_description":"","description":"$1b","is_form_my_company":null,"is_my":null,"required_years_of_experience":null,"og":{"title":"Вакансия ML-инженер (Online RL) / Post-Training LLM, работа в Сбер, удалённо — getmatch","description":"Вакансия ML-инженер (Online RL) / Post-Training