Команда исследователей под руководством профессора Ли Кэ из Школы науки и инженерии управления Шаньдунского университета предложила единую архитектуру для захвата пятипалого роботизированного манипулятора человекподобного типа. Исследование сочетает генерацию траекторий на основе демонстрации с обучением с подкреплением множественных агентов для улучшения скоординированного захвата различных категорий объектов.
На этапе получения демонстраций система захвата движений NOKOV зафиксировала естественные движения человеческой руки при пятипалом захвате и предоставила трёхмерные траектории захвата и высокоточные данные о движении суставных узлов. Эти данные были преобразованы в траектории углов суставов и использованы алгоритмом DM-KMP для генерации целевых траекторий, что послужило априорной информацией для последующего обучения с подкреплением множественных агентов.
Основная информация
Параметр | Содержание |
Исследовательская команда | Школа науки и инженерии управления Шаньдунского университета |
Статья | Человекоподобный роботизированный захват пятью пальцами посредством обучения с подкреплением множества агентов с потенциально-ориентированной оптимизацией и планированием весовых коэффициентов |
Объект исследования | Человекоподобная роботизированная рука с пятью пальцами |
Задача исследования | Скоординированный ловкий захват разнообразных категорий объектов |
Метод | DM-KMP и PWS-MADDPG |
Роль системы NOKOV | Получение демонстраций человеческого захвата |
Измеряемый объект | Движения человеческой руки при пятипалом захвате |
Выходные данные | Трёхмерные траектории захвата и данные о движении суставных узлов пальцев |
Использование данных | Генерация целевых траекторий суставов для DM-KMP и предоставление априорной информации для обучения с подкреплением |
Полученный результат | Алгоритм PWS-MADDPG достиг средней вероятности успешного захвата 85.48 процентов по одиннадцати категориям объектов |
Научно-исследовательский контекст
Ловкий захват человекоподобной роботизированной рукой с пятью пальцами представляет сложную задачу в неструктурированных средах из-за широкого разнообразия формы, веса, материала и условий контакта объектов. Традиционное обучение на основе демонстраций часто требует отдельных траекторий для разных типов объектов, что ограничивает обобщающую способность. Обучение с подкреплением одиночного агента также сталкивается с трудностями в координации асинхронного движения большого пальца и остальных пальцев.
Для решения этих проблем исследовательская команда предложила единую учебную систему, объединяющую генерацию траекторий на основе человеческих демонстраций и обучение с подкреплением множества агентов. Система использует данные демонстраций для инициализации поведения захвата, после чего применяет обучение с подкреплением для совершенствования координации нескольких пальцев.
В работе представлена методика DM-KMP, сочетающая динамические примитивы движения с ядровыми примитивами движения. DM-KMP обучается на ограниченном наборе человеческих демонстраций и генерирует более плавные целевые траектории для суставов при выполнении задач захвата.
При обучении политике каждый палец человекоподобной руки моделируется как независимый агент в рамках системы обучения с подкреплением множественных агентов. В статье дополнительно предлагаются корректировка действий на основе потенциала и форма вознаграждения с плановой настройкой весов для улучшения исследования среды, координации и сходимости в процессе тренировки.

Подпись 1. Схема предложенного метода. (a) Блоки обучения на основе демонстраций. (b) Блоки большого пальца и остальных пальцев. (c) Блоки системы MARL. (d) Блоки планирования весовых коэффициентов.
Указанные алгоритмические решения и экспериментальные результаты являются достижением исследовательской команды. Система захвата движений NOKOV применялась на этапе получения демонстраций для предоставления данных о движении в учебную систему.
Роль системы захвата движений NOKOV в данном исследовании
Параметр | Содержание |
Измеряемый объект | Движения человеческой руки во время натуральной демонстрации пятипалого захвата |
Размечение маркерами | Маркеры, установленные на суставных узлах пальцев |
Выходные данные | Трёхмерные траектории поведения при захвате |
Использование данных | Последующая обработка до траекторий углов суставов и использование алгоритмом DM-KMP для обучения и генерации целевых траекторий |
В процессе получения человеческих демонстраций исследовательская команда использовала систему захвата движений NOKOV для фиксации естественного поведения пятипалого захвата. Установка маркеров на суставные узлы пальцев позволила собрать трёхмерные траектории захвата и высокоточные данные о движении суставов. После предварительной обработки соответствующие траектории углов суставов передавались алгоритму DM-KMP для обучения и генерации целевых траекторий, которые затем обеспечивали априорную информацию для последующего обучения с подкреплением множественных агентов.
Проектирование эксперимента и результаты
Экспериментальная проверка включала получение человеческих демонстраций, симуляционную среду на базе Gazebo и платформу реального роботизированного захвата. Реальная система состояла из роботизированного манипулятора KUKA LBR iiwa, ловкой руки Shadow и интегрированной системы восприятия и управления захватом.

Подпись 2. Схема экспериментов. (a) Демонстрация. (b) Симуляционная среда. (c) Реальная среда.
В статье отмечается, что роботизированные манипуляторы в симуляционных и реальных экспериментах применялись исключительно для позиционирования ловкой руки в точке захвата и не участвовали в процессе тренировки политики.
На приведённом ниже рисунке представлены траектории углов суставов пяти пальцев человеческой демонстрирующей руки при захвате губчатого кирпича после обработки алгоритмом DM-KMP. Результаты показывают, что после применения методики DM-KMP траектории суставов становятся более гладкими и непрерывными, что может служить опорными движениями для обучения с подкреплением множественных агентов.

Подпись 3. Траектории углов суставов человекоподобной роботизированной руки с пятью пальцами при захвате кирпичика из поролона после обработки системой DM-KMP.
В опубликованных экспериментах алгоритм PWS-MADDPG продемонстрировал среднюю вероятность успешного захвата равную 85.48 процентам по одиннадцати категориям объектов. По сравнению с DDPG и MADDPG в статье указаны улучшения на 40.31 процента и 20.05 процента соответственно. Данные показатели отражают характеристики системы управления захватом исследовательской группы и не являются прямыми заявлениями относительно характеристик системы захвата движений.
Исследование также включало тесты захвата с учётом силы взаимодействия, среди которых выделялись специально разработанный чашечный сенсор давления и деформируемые бумажные стаканы при различных условиях нагрузки. Указанные тесты применялись для оценки регулирования усилия и стабильности поведения захвата при изменяющейся массе груза.
Значимость исследования
Приведённый пример демонстрирует методику применения данных о движении человека в качестве структурированной информации для исследований человекоподобного ловкого захвата. Записывая естественные движения человеческой руки при пятипалом захвате, система захвата движений NOKOV обеспечила траектории и данные о движении суставов, поддержав инициализацию политики на основе демонстраций. Данное исследование впоследствии применило обучение с подкреплением множества агентов для дальнейшей оптимизации скоординированного управления роботизированной рукой.
Для робототехнических лабораторий данный пример служит наглядным руководством того, как фиксация движений поддерживает переход от человеческих демонстраций к обучению политики роботизированного захвата, сохраняя сбор данных, разработку алгоритмов и проверку производительности в качестве отдельных этапов научной работы.
Библиографические сведения статьи
Название статьи: Humanoid Five-Digit Robotic Grasping via Multi-Agent Reinforcement Learning With Potential-Guided Optimization and Weight Scheduling
Ссылка: Wang, Jiashuai, et al. Humanoid Five-Digit Robotic Grasping via Multi-Agent Reinforcement Learning With Potential-Guided Optimization and Weight Scheduling. IEEE Transactions on Automation Science and Engineering (2026).
Информация об издании: vol. 23, pp. 6299-6314, 2026
DOI: 10.1109/TASE.2026.3672621
Часть вопросов и ответов
Вопрос 1:Что именно фиксировала система захвата движений NOKOV в рамках данного исследования?
Ответ 1: Система зафиксировала естественные движения человеческой руки при пятипалом захвате на этапе сбора демонстраций.
Вопрос 2:Какие данные получила система?
Ответ 2: Были предоставлены трёхмерные траектории поведения захвата и высокоточные данные о движении суставных узлов пальцев, подвергнутые последующей обработке до траекторий углов суставов.
Вопрос 3:Каким образом применялись данные о движении?
Ответ 3: Данные использовались алгоритмом DM-KMP для обучения и генерации целевых траекторий суставов, обеспечивая априорную информацию для последующего обучения с подкреплением множественных агентов.
Вопрос 4:Можно ли применить данный подход перехода от демонстраций к обучению с подкреплением к другим задачам ловкого манипулирования?
Ответ 4: Предложенная архитектура предполагает потенциальную возможность масштабирования на другие задачи ловкого манипулирования, однако её эффективность будет определяться спецификой постановки задачи, качеством демонстрационных данных, конструированием функции вознаграждения и условиями проведения тренировки.