CCareerLab
Главная/Вакансии/IT/ML-разработчик в команду гуманоидных роботовЯндекс
Яндекс
IT · Офис · Москва

ML-разработчик в команду гуманоидных роботов

До 1 годаfulltimeОфис
Не указана
зарплата не указана в источнике
ОткликнутьсяОбновлено август 2026 г.
ФорматОфис
Тип занятостиfulltime
ОпытДо 1 года
О компании

Яндекс — технологическая компания, создающая интеллектуальные продукты и сервисы на основе машинного обучения: поиск, беспилотники, облако, образование и десятки других направлений.

О компании

Offline и online reinforcement learning. Вы будете исследовать и внедрять RL-подходы для улучшения VLA-политик после предобучения и supervised fine-tuning. В зоне ответственности — offline RL на логах взаимодействий и демонстрациях, offline-to-online RL, RL fine-tuning и residual RL. Будет уделяться внимание тому, как безопасно использовать данные реальных rollout’ов, строить reward’ы и success-сигналы, улучшать политики без потери исходных навыков и находить баланс между качеством, устойчивостью и sample efficiency. Обучение на corrective data и recovery trajectories

Чем предстоит заниматься
  • развивать ML-часть обучения роботов на их собственных ошибках. Робот может попасть в OOD-состояние, начать неуспешно выполнять навык или потерять уверенность
  • в таких случаях оператор или другой механизм восстановления формирует корректирующую траекторию. Эти эпизоды становятся данными для следующей итерации обучения. Вы будете работать с подходами уровня DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и dataset aggregation
Чем предстоит заниматься
  • — превращать всё это в улучшение VLA-policy. Сбор данных, teleoperation и операционные процессы находятся на стороне других команд
  • с вашей стороны —
Что мы ждем от тебя

к данным, методы обучения, оценка качества и интеграция результатов в training pipeline. OOD robustness и final-mile quality. Вы будете улучшать качество моделей в сложных, редких и нештатных сценариях: при распределительном сдвиге, изменении условий сцены, ошибках восприятия, накоплении ошибок управления и неполных или шумных наблюдениях. В фокусе — анализ failure modes, OOD robustness, uncertainty-aware и recovery-oriented learning, работа с hard examples и long-tail-данными. Важно строить понятные метрики качества: success rate, recovery rate, intervention rate, устойчивость к возмущениям и безопасность выполнения задач. Больше об ML в Яндексе — в канале Yandex for ML

Что мы ждем от тебя
  • Уверенно программируете на Python и работали с PyTorch
  • Имеете сильную базу в deep learning и reinforcement learning
  • Понимаете основные подходы в RL: policy optimization, actor-critic, value learning, off-policy learning и offline RL
  • Понимаете, что такое behavior cloning, covariate shift и dataset aggregation
  • Умеете ставить эксперименты, проводить абляции, работать с метриками и анализировать причины деградации моделей
  • Умеете читать исследовательские статьи и превращать исследовательские идеи в устойчивые ML-пайплайны
  • Работали с гуманоидными роботами или другими физическими робототехническими платформами
  • Знакомы с DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и recovery learning
  • Работали с online RL, offline-to-online RL, safe RL, constrained RL или residual RL
  • Знакомы с Isaac Lab, Isaac Sim, MuJoCo, ManiSkill или другими симуляторами
Как откликнуться

Нажмите «Откликнуться», заполните короткую форму и прикрепите резюме. Команда обычно отвечает в течение 3 рабочих дней.