ML-разработчик в команду гуманоидных роботов
Яндекс — технологическая компания, создающая интеллектуальные продукты и сервисы на основе машинного обучения: поиск, беспилотники, облако, образование и десятки других направлений.
Offline и online reinforcement learning. Вы будете исследовать и внедрять RL-подходы для улучшения VLA-политик после предобучения и supervised fine-tuning. В зоне ответственности — offline RL на логах взаимодействий и демонстрациях, offline-to-online RL, RL fine-tuning и residual RL. Будет уделяться внимание тому, как безопасно использовать данные реальных rollout’ов, строить reward’ы и success-сигналы, улучшать политики без потери исходных навыков и находить баланс между качеством, устойчивостью и sample efficiency. Обучение на corrective data и recovery trajectories
- развивать ML-часть обучения роботов на их собственных ошибках. Робот может попасть в OOD-состояние, начать неуспешно выполнять навык или потерять уверенность
- в таких случаях оператор или другой механизм восстановления формирует корректирующую траекторию. Эти эпизоды становятся данными для следующей итерации обучения. Вы будете работать с подходами уровня DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и dataset aggregation
- — превращать всё это в улучшение VLA-policy. Сбор данных, teleoperation и операционные процессы находятся на стороне других команд
- с вашей стороны —
к данным, методы обучения, оценка качества и интеграция результатов в training pipeline. OOD robustness и final-mile quality. Вы будете улучшать качество моделей в сложных, редких и нештатных сценариях: при распределительном сдвиге, изменении условий сцены, ошибках восприятия, накоплении ошибок управления и неполных или шумных наблюдениях. В фокусе — анализ failure modes, OOD robustness, uncertainty-aware и recovery-oriented learning, работа с hard examples и long-tail-данными. Важно строить понятные метрики качества: success rate, recovery rate, intervention rate, устойчивость к возмущениям и безопасность выполнения задач. Больше об ML в Яндексе — в канале Yandex for ML
- Уверенно программируете на Python и работали с PyTorch
- Имеете сильную базу в deep learning и reinforcement learning
- Понимаете основные подходы в RL: policy optimization, actor-critic, value learning, off-policy learning и offline RL
- Понимаете, что такое behavior cloning, covariate shift и dataset aggregation
- Умеете ставить эксперименты, проводить абляции, работать с метриками и анализировать причины деградации моделей
- Умеете читать исследовательские статьи и превращать исследовательские идеи в устойчивые ML-пайплайны
- Работали с гуманоидными роботами или другими физическими робототехническими платформами
- Знакомы с DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и recovery learning
- Работали с online RL, offline-to-online RL, safe RL, constrained RL или residual RL
- Знакомы с Isaac Lab, Isaac Sim, MuJoCo, ManiSkill или другими симуляторами
Нажмите «Откликнуться», заполните короткую форму и прикрепите резюме. Команда обычно отвечает в течение 3 рабочих дней.