Человек редко разговаривает совершенно неподвижно. Мы взмахиваем руками, киваем, меняем позу, подчёркиваем отдельные слова жестами — причём большая часть этих движений возникает почти автоматически. Для робота же даже простой жест остаётся сложной вычислительной задачей: нужно понять смысл сказанного, определить подходящий момент для движения, выбрать сам жест и одновременно убедиться, что он физически безопасен.

Китайская робототехническая компания Galbot представила систему RoboGesture, которая пытается решить эту проблему. Она анализирует речь человека сразу на нескольких уровнях и в реальном времени генерирует движения, соответствующие смыслу, ритму и интонации разговора. Разработчики рассчитывают, что благодаря этому гуманоидные роботы станут гораздо естественнее вести себя при непосредственном общении с людьми. Система должна быть представлена на конференции ECCV 2026.
По словам разработчиков, RoboGesture замыкает цепочку «услышать — ответить — показать жестом» примерно за две секунды. Это особенно важно для гуманоидов, которым предстоит работать не только на производстве, но и в ситуациях, где требуется непосредственное человеческое общение.
Почему роботам так трудно жестикулировать?
Современный робот уже способен распознать человеческую речь и сформулировать вполне осмысленный ответ. Но между текстом ответа и естественным движением тела существует огромная пропасть.
Допустим, человек говорит: «Посмотрите туда». Для человека совершенно естественно одновременно повернуть голову и указать рукой в нужную сторону. Роботу же необходимо определить, какое именно движение соответствует фразе, когда его начать, насколько быстро выполнить и как завершить, чтобы оно не выглядело случайным или механическим.
Традиционные системы часто решают проблему с помощью заранее записанного набора движений. В результате робот может повторять несколько одних и тех же жестов независимо от контекста. Такая речь быстро начинает напоминать выступление персонажа из старой компьютерной игры: слова меняются, а анимация почти всегда остаётся прежней.
RoboGesture предлагает другой подход — генерировать движение непосредственно из текущей речи.
Робот слушает не только слова
Одна из ключевых особенностей RoboGesture заключается в том, что система анализирует сам звуковой сигнал, а не исключительно его текстовую расшифровку.
Это существенно, потому что письменная транскрипция теряет значительную часть информации, содержащейся в человеческой речи. Одно и то же слово можно произнести спокойно, резко, с удивлением или с особым акцентом. Меняются высота голоса, громкость, ритм, интонация и расстановка ударений — и вместе с ними меняется эмоциональный смысл фразы.
RoboGesture преобразует входящий звук в специальные аудиотокены с помощью кодека Mimi. Затем система анализирует речь на нескольких уровнях.
Более низкие уровни отвечают за быстро меняющиеся характеристики звука — например, ритм и интонационные изменения. Более глубокие признаки позволяют понять общий смысл произносимой фразы. Объединяя эту информацию, система решает две задачи: когда роботу стоит сделать жест и каким он должен быть.
Именно здесь появляется важное отличие от простого преобразования текста в анимацию. Робот пытается реагировать не только на то, что сказано, но и на как это сказано.
300 категорий жестов
Чтобы система не ограничивалась несколькими универсальными движениями, исследователи обучили её на 300 категориях жестов.
Это не означает, что робот имеет ровно 300 заранее запрограммированных анимаций. RoboGesture использует эти категории как более широкий набор примеров и смысловых ориентиров для генерации движения.
Далее информация о речи поступает в модель генерации движений на основе диффузионного трансформера.
Диффузионные модели хорошо известны благодаря генерации изображений, однако тот же общий принцип можно применять и к другим типам данных. В данном случае модель работает не с пикселями, а с непрерывным пространством движений робота.
Она учитывает текущую речь и предыдущие движения, а затем формирует следующее движение таким образом, чтобы оно естественно продолжало уже начавшийся жест. Благодаря этому отдельные действия не должны выглядеть как набор независимых команд: движение может плавно переходить из одного состояния в другое.
Робота нужно заставить не «зацикливаться»
При создании системы исследователи столкнулись с любопытной проблемой, которую назвали modality eclipse — «затмением модальности».
Суть в том, что модель, генерирующая движение, может слишком сильно опираться на собственные предыдущие действия. Если робот только что сделал определённый жест, система может продолжить двигаться в том же направлении, даже если человек уже произнёс совершенно другую фразу.
Получается своеобразная инерция: робот продолжает «жить прошлым» вместо того, чтобы реагировать на новую информацию.
Для решения этой проблемы RoboGesture использует специальный метод Anti-Inertia classifier-free guidance masking. Он заставляет модель сильнее учитывать поступающий аудиосигнал и меньше зависеть от предыдущей траектории движения.
Это важный момент для естественного общения. Человек способен мгновенно прекратить один жест и перейти к другому, если разговор изменился. Для робота подобная гибкость требует отдельного алгоритмического решения.
А если красивый жест окажется опасным?
Есть ещё более серьёзная проблема. Даже если искусственный интеллект правильно понял речь и сгенерировал визуально убедительное движение, это вовсе не означает, что его можно безопасно выполнить физическим роботом.
У гуманоидной машины есть суставы с ограниченным диапазоном движения, собственное тело, окружающие предметы и другие люди. Алгоритм генерации может предложить траекторию, которая математически выглядит нормально, но приводит к столкновению руки с корпусом или создаёт неустойчивое положение.
Поэтому в RoboGesture между генератором движения и реальным роботом установлен дополнительный фильтр безопасности на основе модельно-прогнозирующего управления (MPC).
Он проверяет сгенерированную траекторию на соответствие физическим ограничениям и при необходимости корректирует движение перед выполнением. В частности, система должна снижать вероятность самостолкновений и неустойчивых движений.
Результат выглядит весьма заметно: во время испытаний доля кадров, в которых фиксировалось самостолкновение, снизилась с 4,16% до 0,13% после применения защитного фильтра.
Как выглядит полный цикл общения?
RoboGesture не является изолированным модулем, который просто заставляет робота махать руками.
Полная система объединяет несколько компонентов. Сначала автоматическое распознавание речи преобразует слова человека в данные для дальнейшей обработки. Затем языковая модель формирует ответ, система синтеза речи озвучивает его, а аудиомодуль анализирует характеристики произносимой фразы.
Параллельно генератор жестов определяет подходящие движения. Перед отправкой команд исполнительным механизмам траектория проходит через защитный MPC-фильтр.
В результате робот получает своеобразный замкнутый цикл: слушает человека → понимает запрос → формирует ответ → произносит его → одновременно сопровождает речь подходящими движениями.
Именно такая интеграция отличает RoboGesture от простого генератора анимаций.
На каком роботе всё это проверяли?
Исследователи протестировали систему на гуманоидном роботе Unitree G1, оснащённом ловкими роботизированными кистями BrainCo.
Это важно, поскольку RoboGesture создавался именно для физических роботов, а не для виртуальных персонажей. Любое движение здесь в конечном счёте должно пройти через реальные электромеханические приводы и соответствовать ограничениям конкретной машины.
Поэтому дополнительный слой безопасности — не второстепенная функция, а необходимая часть всей архитектуры. Красивый жест на экране можно сгенерировать практически без ограничений. Заставить настоящий двухногий аппарат повторить его рядом с человеком — совсем другая задача.
Зачем роботам вообще нужны жесты?
На первый взгляд может показаться, что всё это лишь попытка сделать машины более «человечными». На практике невербальная коммуникация может оказаться важной частью функциональности робота.
В обычном разговоре мы постоянно передаём информацию не только словами. Указываем направление, показываем размер предмета руками, киваем в знак согласия, меняем позу, подчёркиваем важность сказанного.
Если гуманоид должен взаимодействовать с людьми в магазине, гостинице, образовательном учреждении, медицинской среде или общественном пространстве, способность использовать подобные сигналы может сделать взаимодействие понятнее.
При этом речь идёт не о том, чтобы заставить робота изображать человека любой ценой. Скорее, разработчики пытаются использовать хорошо знакомый людям канал коммуникации, который способен дополнить голосовую информацию.
Следующий шаг — действительно естественный диалог
RoboGesture пока остаётся исследовательской технологией, и до полностью естественного общения между человеком и машиной ещё далеко. Но направление развития показательно. Современные гуманоидные роботы постепенно учатся не только ходить, сохранять равновесие и манипулировать предметами. Теперь всё больше внимания уделяется тому, как именно машина ведёт себя рядом с человеком.
В идеале собеседнику не придётся отдельно ждать ответа робота, а затем — его жеста. Система должна воспринимать речь, смысл, интонацию и контекст как единое событие и практически одновременно формировать голосовую и физическую реакцию.
Galbot рассчитывает именно на такой сценарий: RoboGesture должно связать речь и движения в одну систему невербальной коммуникации. Если подобные технологии продолжат развиваться, гуманоидный робот перестанет выглядеть машиной, которая сначала говорит, а потом запускает заранее подготовленную анимацию. Он начнёт использовать тело как естественное продолжение своей речи.
