Online RL (General) / Post-Training LLM в команду GigaChat
Сбер
650 000–850 000 ₽
УдалёнкаРоссияLead
PythonQAProject Manager
Формат
Удалёнка
Регион
Россия
Уровень
Lead
собрана 13 дней назад
Источник: Getmatch
Описание вакансии
Online RL (General) / Post-Training LLM в команду GigaChat
Grade: Lead
Salary: 650000-850000 RUB
Skills: Python, PyTorch, Data Scientist & Machine Learning
Company URL:
Description:
Зарплата: 650 000–850 000 ₽ + годовой бонус.
Мы развиваем GigaChat и ищем сильного руководителя направления online RL в general-домене. Это роль для человека, который умеет одновременно развивать методы обучения моделей, писать важный код своими руками и выстраивать процессы сбора и подготовки данных.
Основная цель направления — делать модель более полезной, понятной и приятной для пользователей: чтобы она лучше следовала инструкциям, давала более уместные и качественные ответы, лучше удерживала формат и стиль, реже ошибалась в типовых пользовательских сценариях и в целом больше нравилась людям.
Нам нужен не просто менеджер, а сильный технический руководитель, который способен глубоко погружаться в детали, самостоятельно собирать ключевые части решения и доводить идеи до реального роста качества модели.
Чем предстоит заниматься
Развивать направление online RL для general-сценариев
Определять, как должно развиваться направление online RL в general-домене: какие пользовательские сценарии для нас наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели.
Вести направление целиком: от постановки гипотез и плана работ до внедрения результатов в регулярный цикл обучения модели.
Принимать решения о приоритетах между развитием методов, сбором данных, инфраструктурой и системой оценки качества.
Разрабатывать и улучшать методы обучения
Развивать подходы post-training и online RL для general-задач.
Обучать и улучшать reward-модели, которые помогают приближать поведение модели к пользовательским ожиданиям.
Продумывать и внедрять способы оценки качества, которые позволяют лучше измерять, насколько модель следует инструкциям, удерживает формат ответа, соблюдает ограничения, ведёт себя последовательно и даёт ответы, которые действительно нравятся пользователям.
Определять, в каких случаях online RL действительно даёт прирост качества по сравнению с supervised fine-tuning и другими подходами, а в каких — нет.
Проводить эксперименты и разбирать результаты не только на уровне метрик, но и на уровне причин: почему модель стала лучше или хуже, насколько устойчив результат и можно ли его перенести на другие типы задач и сценариев.
Писать ключевой код и развивать инфраструктуру
Самостоятельно писать и дорабатывать пайплайн online RL.
Реализовывать и улучшать пайплайны обучения reward-моделей, preference-моделей и связанных компонентов post-training контура.
Делать надёжные и воспроизводимые эксперименты: с понятными версиями данных, конфигами, сравнением запусков и контролем деградаций.
Выстраивать связку между моделью, системой оценки, reward-моделями и обучающими пайплайнами так, чтобы новые идеи можно было быстро проверять и быстро доводить до практического результата.
Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и качестве данных.
Строить контур данных для обучения
Организовывать сбор и подготовку данных для online RL в general-домене: instruction-following сценарии, разметку предпочтений, пользовательские сигналы, синтетические и реальные сценарии.
Формировать качественные обучающие выборки с хорошим покрытием по типам пользовательских задач, стилям запросов, уровням сложности, форматным ограничениям и типовым ошибкам модели.
Продумывать, какие данные действительно помогают делать модель более полезной и приятной для пользователя, а какие создают лишь локальный рост на метриках.
Встраивать в пайплайны проверки качества: контроль утечек, удаление дублей, балансировку по сложности, фильтрацию шумной разметки и контроль качества reward-данных.
Делать так, чтобы каждый цикл обучения улучшал не только модель, но и сам процесс: появлялись новые данные, уточнялись критерии качества, лучше выделялись слабые сценарии и типовые причины недовольства пользователей.
Улучшать пользовательское качество модели
Разбирать, какие именно свойства делают модель лучше для человека: полезность, следование инструкциям, понятность, уместность, качество аргументации, соблюдение формата, стабильность поведения.
Помогать команде переводить абстрактные требования вроде “модель должна нравиться пользователю” в понятные критерии, данные, эксперименты и измеримые результаты.
Находить компромиссы между разными требованиями к модели: полезностью, строгостью следования инструкции, краткостью, безопасностью, естественностью и устойчивостью поведения.
Руководить сильной технической командой
Руководить командой исследователей и инженеров, задавать высокую планку по качеству решений, скорости работы и глубине проработки.
Помогать команде превращать исследовательские идеи в работающие решения, которые можно встроить в основной цикл обучения.
Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.
Для нас важно
Отличное владение Python и PyTorch.
Практический опыт в LLM post-training: RLHF, online RL или смежных направлениях.
Понимание того, как обучать модели под пользовательские ожидания.
Опыт построения пайплайнов данных, а не только работы с уже готовыми датасетами.
Умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов.
Опыт руководства сильной технической командой.
Готовность лично писать важные части системы руками.
Будет плюсом
Опыт обучения reward-моделей, judge-моделей или preference-моделей для LLM.
Опыт работы с human feedback, synthetic preference data и quality annotation pipelines.
Опыт построения систем оценки качества для general assistant-сценариев.
Опыт работы с distributed training или large-scale inference.
Понимание современных open-source стеков для обучения и инференса больших языковых моделей.
Публикации, open-source вклад или сильный прикладной research track record.
Что предлагаем
Оклад + годовой бонус.
Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.
Команду сильных инженеров и исследователей.
Возможность совмещать управление направлением с глубокой технической работой.
Конкурентную компенсацию, премии и расширенный соцпакет.
17:["$","$L18",null,{"initialState":{"status":"anonymous"},"children":[["$","$L19",null,{}],["$","main",null,{"children":["$","$L1a",null,{"vacancySlug":"33800-online-rl-general-post-training-llm","initialVacancy":{"published_at":"2026-07-11T09:00:50.587514","is_active":true,"position":"Online RL (General) / Post-Training LLM в команду GigaChat","language":"ru","type":"web_and_tg","id":33800,"offer_type":"vacancy","cover_letter_required":false,"cover_letter_placeholder":"","source":"backoffice","incognito_publication":false,"analytics_id":"oQjDrnR7","salary_description":"650 000 — 850 000 ₽/мес на руки","salary_hidden":false,"salary_display_from":650000,"salary_display_to":850000,"salary_currency":"RUB","salary_taxes":"net","salary_is_total":false,"salary_by_our_version":false,"salary_hidden_variant":null,"offer_description":"Зарплата: 650 000–850 000 ₽ + годовой бонус.\n\nЧто делать: Развивать направление online RL для general-сценариев, разрабатывать и улучшать методы обучения, писать ключевой код и развивать инфраструктуру. \n\nО компании: Сбербанк — крупнейший банк в России, Центральной и Восточной Европе, один из ведущих международных финансовых институтов.","skills_objects":[{"name":"Python","slug":"python","is_custom":false},{"name":"PyTorch","slug":"pytorch","is_custom":false}],"url":"/vacancies/33800-online-rl-general-post-training-llm","description_html":null,"english_level":null,"location_requirements":[{"location_id":"russia","format":"remote","exclude":false,"ancestors":["russia","_cu-europe","_cu-emea","_cu-world"],"metros":[],"city":"","country":"Россия"}],"location_items":[{"label":"Россия","format":"remote","exclude":false}],"application":null,"viewed":false,"company":{"id":null,"name":"Сбер","logotype":"8f5d6d49-bb76-4250-9aa9-267e36fc5273.png","salary_hidden_variant":null,"url":"/companies/GNRXrNQz-sber","industry":"Банки / Финтех","post_to_job_aggregators":true,"investments":"","size":"1001+","short_description":"Сбербанк — крупнейший банк в России, Центральной и Восточной Европе, один из ведущих международных финансовых институтов. Самый дорогой российский бренд и самый сильный банковский бренд в мире по версии Brand Finance.
"},"one_day_offer_content":null,"one_day_offer_content_v3":null,"specialization":"Data Scientist & Machine Learning","seniorities":["lead"],"team_size":"","stack_description":"","short_description":"","description":"$1b","is_form_my_company":null,"is_my":null,"required_years_of_experience":null,"og":{"title":"Вакансия Online RL (General) / Post-Training LLM в команду GigaChat, работа в Сбер, удалённо — getmatch","description":"Вакансия Online RL (General) / Post-Training LLM в команду GigaChat, работа в компании Сбер, полная удалёнка. Зарплата: 650 000 — 850 000 ₽/мес на руки. Дата публикации: 11.07.2026.","image_url":" Auto","slug":"qa_auto","morphs":{"form_first":"automation QA-инженера","form_second":"automation QA-инженерам","plural":"automation QA-инженеры","form_first_plural":"automation QA тестировщиков","form5":"Automation QA-тестировщиков"},"seo_morphs":{"form1":"QA / Auto","form2":"Automation QA-инженером","form3":"Automation QA-тестировщиком","form4":"QA / Auto","form5":"QA Auto"},"category":{"id":1,"slug":"qa","name":"QA","sort_order":40},"sort_order":1100},{"id":23,"name":"Project Manager","slug":"project_management","morphs":{"form_first":"проджект менеджера","form_second":"проджект менеджерам","plural":"проджект менеджеры","form_first_plural":"менеджеров проектов","form5":"Project Manager`ов"},"seo_morphs":{"form1":"Project Manager","form2":"Проджект менеджером","form3":"Менеджером проектов","form4":"Project Manager'а","form5":"Project Management"},"category":{"id":7,"slug":"management_product","name":"Product, Project, Architecture","sort_order":50},"sort_order":1400},{"id":26,"name":"CTO / CIO","slug":"engineering_management","morphs":{"form_first":"Tech Team Lead","form_second":"CTO / Engineering-менеджерам","plural":"CTO / Engineering-менеджеры","form_first_plural":"Тимлидов","form5":"Engineering manager`ов"},"seo_morphs":{"form1":"Engineering manager","form2":"Тимлидом разработки","form3":"Техническим лидом","form4":"Engineering manager","form5":"Tech Lead"},"category":{"id":11,"slug":"top_management","name":"Top Management","sort_order":120