Telegram · собрана 17 часов назад

Middle / Senior Data Scientist (команда LLM Core)

Avito

УдалёнкаГибридОфисРоссияMiddle
Python

Описание вакансии

Middle / Senior Data Scientist (команда LLM Core) 🏢 Компания: Авито 🌍 Формат: Удалённая работа или офис/гибрид (Москва) О компании: Авито — крупная российская платформа объявлений: более 230 млн активных объявлений и месячная аудитория свыше 72 млн пользователей. Платформа охватывает товары, авто, недвижимость и услуги; в компании работает более 10 000 сотрудников. Задачи: • Формулировать и проверять гипотезы по pre-training, continual pre-training, post-training, RL и синтетическим данным. • Вести сложные исследовательские и инженерные задачи — от метрик и дизайна экспериментов до реализации и внедрения. • Масштабировать обучение и инференс: профилировать узкие места, оптимизировать квантованием и speculative decoding. • Строить надёжные процедуры оценки качества, анализ ошибок, проектировать датасеты и метрики. • Писать production-код на Python и PyTorch, проводить code review и улучшать воспроизводимость экспериментов. • Менторить коллег и участвовать в архитектурных обсуждениях и внутренних LLM-семинарах. Требования: • Не менее 3 лет опыта реализации и эксплуатации ML-решений. • Глубокое понимание современных ML-алгоритмов, Transformer и принципов обучения LLM. • Практический опыт обучения, адаптации или внедрения NLP‑моделей и умение превращать идеи в проверяемые эксперименты. • Уверенное владение Python и PyTorch, хорошее знание инженерных практик разработки. • Умение работать с неопределённостью: декомпозировать проблему, выбирать метрики и анализировать результаты. • Понимание компромиссов между качеством, latency, throughput и стоимостью. Будет плюсом: • Опыт с continual pre-training, заменой или расширением токенизатора, SFT, LoRA или RL-подходами. • Опыт распределённого обучения или оптимизации инференса (DeepSpeed, vLLM, SGLang, TensorRT-LLM). • Построение пайплайнов оценки качества, синтетических датасетов и систем автоматического анализа ошибок. • Работа с MLOps-инструментами: Weights & Biases, MLflow, DVC. • Публикации, участие в open source или достижения в соревнованиях по ML. Стек: Python, PyTorch, LLM, Transformer, RL, LoRA, SFT, tokenizers, DeepSpeed, vLLM, SGLang, TensorRT-LLM, speculative decoding, Weights & Biases, MLflow, DVC Условия: • Влияние на продукт и решения, которые увидят миллионы пользователей. • Сложные технологические задачи на большом масштабе и доступ к производительным GPU-кластерам. • Сильное профессиональное комьюнити и регулярные LLM‑семинары. • Бюджет на обучение, курсы, конференции и профессиональную литературу. • ДМС со стоматологией с первого дня; в офисе принимают терапевт и массажист. • Гибкость: удалённо или из офисов в нескольких городах России. 📩 Откликнуться