CCareerLab
Главная/Вакансии/IT/Reinforcement Learning EngineerСбер
Сбер
IT · Офис · Москва

Reinforcement Learning Engineer

До 1 годаПроектная работаОфис
Не указана
зарплата не указана в источнике
ОткликнутьсяОбновлено август 2026 г.
ФорматОфис
Тип занятостиПроектная работа
ОпытДо 1 года
О компании

Сбер — крупнейший банк России и технологическая компания, развивающая финтех, ИИ и цифровые сервисы.

О компании

В Центре Робототехники Сбера мы строим антропоморфного робота общего назначения. Наш робот вышел из стадии первых демонстраций — и мы переходим к надёжной автономной работе в реальных задачах. Локомоция и управление всем телом (Whole Body Control) — основа этой работы: именно от них зависит, насколько устойчиво и предсказуемо робот движется в реальном мире. Мы ищем инженера, который разрабатывает, обучает и доводит до робота RL-политики управления всем телом — от постановки задачи в симуляторе до стабильной работы контроллера на железе. Это роль для того, кто хочет видеть результат своих алгоритмов не в метриках на графике, а в том, как робот уверенно идёт, поворачивает и держит равновесие. Наша команда действительно работает над уникальным проектом в России, а у Вас будет прямой доступ к железу, Вы будете видеть результат своей работы в физическом мире. Ключевые технологии: Python, PyTorch, RL (PPO/SAC), MuJoCo/Isaac Sim, ONNX, C++, ROS2.

Чем предстоит заниматься
  • разрабатывать, обучать и деплоить RL-политики локомоции и whole body control
  • подбирать observations, actions и типы моделей, которые дают максимальную производительность
  • находить и закрывать ключевые факторы в sim-to-real gap — добиваться, чтобы политика, обученная в симуляторе, работала на реальном роботе
  • определять, измерять и интерпретировать метрики качества обученных политик
  • доводить control stack до стабильной и предсказуемой работы в реальных условиях
  • настраивать reward-функции, domain randomization и curriculum под конкретные двигательные задачи
  • работать в связке с командами интеграции и middleware — доводить политику до надежного исполнения на железе.
Что мы ждем от тебя
  • уверенное владение Python; знание C++ как плюс для интеграции на робота
  • опыт применения RL-алгоритмов для робототехники или управления (PPO, SAC и подобные)
  • понимание динамики и управления, в идеале — шагающих роботов
  • опыт подбора гиперпараметров и cost/reward-функций для RL
  • знакомство с типовыми техниками RL: domain randomization, curriculum learning, reward shaping
  • опыт работы с симуляторами (MuJoCo, Isaac Sim или аналоги)
  • способность самостоятельно разбираться в незнакомых системах и находить корневые причины проблем
  • желание брать ответственность за то, что политика работает на роботе, а не только в симуляторе.
  • опыт деплоя обученных политик на реальное железо
  • опыт с behavior cloning и дистилляцией политик
  • понимание основ теории управления, кинематики и динамики шагающих роботов
  • опыт работы с middleware робота (ROS2, DDS)
  • опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов.
Условия
  • комфортный современный офис г. Москва, МЦК ЗИЛ
  • формат работы - лаборатория робототехники
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • программа адаптации и помощь руководителя на старте (для вакансий уровня Junior)
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбера.
Как откликнуться

Нажмите «Откликнуться», заполните короткую форму и прикрепите резюме. Команда обычно отвечает в течение 3 рабочих дней.