Краткое содержание
Команда исследователей Минго Чжао из Университета Цинхуа разработала унифицированный контроллер на основе визуального управления с применением методов обучения с подкреплением, который позволяет гуманоидным роботам бесшовно искать, преследовать и бить по мячу в нескольких направлениях, используя исключительно бортовые камеры.
Группа под руководством Минго Чжао из Департамента автоматизации Университета Цинхуа опубликовала статью «Learning vision-driven reactive soccer skills for humanoid robots» в ведущем робототехническом журнале Science Robotics.
В статье представлен унифицированный контроллер на основе обучения с подкреплением, напрямую связывающий зрительное восприятие с управлением локомоцией. Обученный исключительно в симуляции и развернутый без дополнительной донастройки на физическом гуманоидном роботе, контроллер использует только данные встроенных камер для непрерывного выполнения поиска мяча, его преследования и ударов в различных направлениях.
Система захвата движений NOKOV предоставила данные о движениях человека при ударах и точные координаты робота и мяча, что соответственно поддержало формирование эталонного набора движений и моделирование системы виртуального восприятия.
Ссылка на источник
Yushi Wang et al., Learning vision-driven reactive soccer skills for humanoid robots. Sci. Robot. 11, eaed1152 (2026). DOI: 10.1126/scirobotics.aed1152
Прочитать статью здесь: Web of Science
Ключевая информация о проекте
Параметр | Описание |
Научная организация | Университет Цинхуа, Департамент автоматизации |
Публикация | Science Robotics |
Робот | Гуманоидный робот Booster T1 |
Задача | Реактивный футбол с визуальным управлением |
Методы обучения | Обучение с подкреплением, AMP, архитектура энкодер-декодер |
Зрительный ввод | Бортовая камера |
Применение системы захвата движений NOKOV | Захват движений человеческого удара Отслеживание истинных координат робота и мяча |
Реальные результаты | Успешность ударов составляет 80–90% на позициях в передней зоне поля |
Испытанные среды | Реальные условия: трава, плитняк, почва, асфальт, резина |
Научный контекст: Зачем гуманоидным роботам требуется реактивное управление футболом на основе зрения?
Футбол среди гуманоидов требует тесной интеграции маневренной локомоции с нестабильным зрительным восприятием, получаемым с бортовых датчиков. Традиционные модульные конвейеры, разделяющие восприятие, планирование и управление, плохо справляются с обеспечением быстрых реакций в динамичных условиях. Существующие подходы к обучению с подкреплением по схеме конец-в-конце либо полагаются на привилегированную информацию о состоянии, предоставляемую системами захвата движений, что ограничивает их применение пределами лабораторий, либо опираются на ресурсоемкое моделирование сцены и страдают от деградации производительности при переносе из симуляции в реальный мир. В результате разработка реактивного контроллера футбольного гуманоида, работающего надежно в реальных условиях, остается открытой задачей.
Как гуманоидные роботы учатся играть в футбол с помощью обучения с подкреплением?
В работе футбольный гуманоид рассматривается как задача управления с ограничениями по восприятию: вместо того чтобы рассматривать восприятие как предобрабатывающий модуль, подающий входные данные в контроллер, реалистичная неопределенность восприятия моделируется как неотъемлемая часть процесса обучения. Одна политика обучения с подкреплением тренируется в симуляции для приема визуальных детекций и проприоцепции робота, выдавая целевые углы сочленений, что позволяет непрерывно выполнять поиск мяча, сближение, корректировку шага и удар в рамках единого контрольного контура. После обучения политика развертывается без дополнительной адаптации на гуманоидном роботе Booster T1 (высотой около одного метра двадцати сантиметров и весом тридцать килограммов), функционируя исключительно за счет бортовых камер и вычислительных ресурсов.

Общий вид системы. Робот в реальных условиях оснащен встроенной камерой для зрительного восприятия. Детекции изображений проецируются в пространство вида сверху. Детекции мяча передаются напрямую в политику, а ориентиры поля обрабатываются модулем одометрии для определения целевой локации на основе долгосрочных данных. Конвейер восприятия спроектирован для эффективного извлечения и представления визуальных признаков для политики обучения с подкреплением.
Инновация первая: Как работает сквозное сопряжение восприятия и действия?
В отличие от традиционных модульных конвейеров, разделяющих восприятие, планирование и управление, предлагаемая политика напрямую связывает зрительное восприятие с контролем локомоции. Восприятие больше не рассматривается как предобрабатывающий модуль, просто подающий сигналы контроллеру, а неопределенность восприятия становится неотъемлемой частью процесса обучения, позволяя политике непрерывно адаптировать движение в замкнутом контуре.
Инновация вторая: Как человеческие движения при ударе используются для тренировки робота?
Для освоения похожих на человеческие паттернов удара в исследовании был создан эталонный набор движений на основе человеческих ударов с опорой на свод стопы и открытых данных ходьбы. Система захвата движений NOKOV зафиксировала тридцать секунд человеческих ударов, тогда как семьдесят шесть точек двадцати восьми секунд всенаправленных данных ходьбы были выбраны из открытого набора ACCAD. Набор данных применялся для тренировки дискриминатора AMP, направляя политику к естественным двигательным паттернам при одновременной оптимизации показателей задачи. Путем интеграции AMP с конвейером восприятия исследование расширяет применение AMP на контроль в реальном мире при динамичных визуальных сценариях.
Инновация третья: Как система преодолевает разрыв между симуляцией и реальным миром?
Бортовое зрение в реальных условиях шумит, имеет задержки и подвержено сбоям детекции. Поэтому исследователи явным образом смоделировали эти несовершенства восприятия в симуляции на основе параметров, полученных из реальных данных: робот управлялся программой на основе правил, пока оператор вручную двигал мячом по полю, собирая около часа наблюдательных данных. Система захвата движений NOKOV фиксировала истинные позиции робота и мяча, которые сравнивались с визуальными детекциями для количественного моделирования. На этой базе сеть политик использует архитектуру энкодер-декодер: энкодер сжимает пятьдесят предыдущих кадров наблюдений (примерно одну секунду истории) в шестидесятичетырехмерное латентное представление, а декодер восстанавливает привилегированную информацию, недоступную при развертывании, например истинную позицию мяча. Это заставляет политику восстанавливать надежную информацию о состоянии из зашумленных и неполных наблюдений.

Предложенная схема обучения. Актор принимает частичные наблюдения и восстанавливает полное состояние из исторических данных с помощью архитектуры энкодер-декодер. Политика тренируется с использованием PPO, получая награды как от среды, так и от дискриминатора, кодирующего априорные сведения о движениях, при этом несколько критиков обеспечивают оценку значений. Политика тренируется в симуляции, где лишь модули, выделенные синим цветом, развертываются на аппаратуре.
Экспериментальная проверка: Насколько хорошо работает контроллер футбольного гуманоида с визуальным управлением в реальных испытаниях?
Работа в разнообразных сценариях и реальных соревнованиях
Контроллер был развернут без дообучения на траве, плитняке, почве, асфальте, резине и при разных визуальных условиях, сохраняя надежное отслеживание мяча и локомоцию во всех сценариях. Контроллер также внедрен в качестве модуля командой Tsinghua Hephaestus на чемпионате Adult-Size Humanoid League соревнований RoboCup в два тысячи двадцать пятом году и на Всемирных Играх Человеческих Роботов в два тысячи двадцать пятом году, где команда завоевала титулы чемпионов.
Процент успешности ударов
Соответственно спецификациям взрослого размера лиги RoboCup Humanoid, в исследовании оценивалась процентная успешность ударов с нескольких заранее заданных позиций на поле. Аппаратные эксперименты показали примерно восемьдесят-девяносто процентов успешности на позициях в передней зоне поля, что сопоставимо с симуляцией, при этом падений не зафиксировано ни в одном испытании.
Согласование восприятия и действия
Для оценки сопряжения восприятия и действия политика активно изменяет ориентацию головы и туловища робота, чтобы держать мяч в пределах видимости камеры. Политика существенно снижает ошибку оценки позиции мяча на сорок шесть процентов.
Анализ походки
Для анализа разнообразия и маневренности изученных двигательных паттернов показано, что одна политика плавно переходит между ходьбой, разворотом, ударом левой ногой и ударом правой ногой, демонстрируя большую маневренность по сравнению с базовой схемой на правилах.

Работа контроллера в различных условиях. Снимки A по C отражают реальные матчи на Всемирных Играх Человеческих Роботов. Снимки D по F показывают реальные матчи на RoboCup. Снимки G по I демонстрируют реактивные реакции и адаптацию в реальном времени к мячу. Снимки J по L иллюстрируют устойчивое поведение при изменении рельефа и визуальной обстановки.
Каким образом система захвата движений NOKOV применялась в исследовании?
Система захвата движений NOKOV поддержала две задачи сбора данных в данном исследовании:
1. Захват человеческих движений: фиксация тридцати секунд ударов человека для создания эталонного набора движений, используемого дискриминатором AMP.
2. Измерение истинных координат: отслеживание позиций робота и мяча и их сравнение с визуальными детекциями для количественного моделирования системы виртуального восприятия.
Эти два типа данных захвата движений поддержали обучение в симуляции и перенос политики футбольного гуманоида в реальный мир. NOKOV система захвата движений предоставила как человеческие двигательные эталоны для изучения естественных паттернов удара, так и высокоточные измерения истинных координат для моделирования реального зрительного восприятия.
Ответственный автор
Минго Чжао, исследователь Департамента автоматизации Университета Цинхуа, директор Лаборатории управления роботами, директор Междисциплинарного центра роботов по вдохновению от мозга при Центре беспилотных систем, главный ученый компании Booster Robotics. Его исследования направлены на создание платформ для исследований искусственного общего интеллекта путем интеграции чипов и вычислений по принципу работы мозга, а также на управление роботами на основе биовдохновленных вычислений.
Часто задаваемые вопросы
Q1: Какую роль сыграла система захвата движений NOKOV в данном исследовании футбольного гуманоида?
A1: Система захвата движений NOKOV применялась для двух основных задач сбора данных: захват человеческих движений при ударе для формирования эталонного набора AMP и измерение истинных координат робота и мяча для моделирования системы виртуального восприятия.
Q2: Почему потребовались данные человеческих движений для футбольного гуманоида?
A2: Человеческие движения при ударе использовались для создания эталонного набора данных тренировки дискриминатора AMP, помогая политике обучения с подкреплением усваивать естественные паттерны движений параллельно с выполнением футбольной задачи.
Q3: Как исследователи справились с шумами визуального восприятия?
A3: Исследователи использовали истинные координаты робота и мяча, измеренные системой захвата движений NOKOV, и сравнили их с визуальными детекциями. Эти данные применены для количественного моделирования шумов восприятия, задержек и сбоев детекции в симуляции.
Q4: Как показал себя гуманоидный робот в реальных испытаниях?
Контроллер достиг примерно восьмидесяти-девятидесяти процентов успешности ударов на позициях в передней зоне поля и успешно завершил аппаратные эксперименты без падений. Он также прошел тестирование на разных типах покрытия и визуальных условиях и был применен в реальных соревнованиях по футболу среди гуманоидов.
Согласно соответствующим отчетам Университета Цинхуа, контроллер также поддержал команду Tsinghua Hephaestus в победе над взрослыми гуманоидными футбольными чемпионатами RoboCup в два тысячи двадцать пятом и два тысячи двадцать шестом году, а также защите титула на Всемирных Играх Человеческих Роботов в два тысячи двадцать шестом году.