Роботы, управляемые современными ИИ-моделями, часто двигаются рывками и с паузами. Пока система обрабатывает новые данные с камер и планирует следующее действие, машина вынуждена ждать. Исследователи Массачусетского технологического института (MIT) разработали метод VLASH, который заметно сокращает эти задержки и делает движения более плавными и быстрыми.

Сейчас многие роботы используют модели типа vision-language-action (VLA, “зрение-язык-действие”). Они анализируют изображение с камер, понимают текстовые инструкции и выдают последовательность действий. После выполнения этой последовательности система снова смотрит на окружение и только потом планирует следующий шаг. Такой цикл создаёт паузы и делает движения менее естественными.
VLASH решает проблему, позволяя роботу планировать будущие действия ещё во время выполнения текущих. Система не просто опирается на то, где робот находится сейчас, а оценивает, где он окажется после завершения текущей последовательности движений. На основе этого прогноза сразу готовится следующий шаг.
По словам исследователей, такой подход предотвращает нестабильность, которая возникает, когда планирование идёт по уже устаревшим данным. Даже если окружение меняется, текущее положение и запланированные движения дают достаточно информации, чтобы достаточно точно предсказать ближайшее будущее состояние робота.
Как удалось ускорить работу
Только за счёт устранения пауз между «порциями» действий время реакции сокращается более чем в 30 раз. Дополнительно исследователи применили метод квантования действий (action quantization). Он позволяет генерировать более крупные блоки движений, следующих по одной траектории. Точность при этом немного снижается, но общая скорость выполнения задач вырастает в два–три раза.
Чтобы модели лучше работали с информацией о будущем состоянии, команда разработала специальную технику аугментации данных при обучении. Перестраивая и повторно используя уже имеющиеся тренировочные данные, исследователи сократили время обучения в пять раз — без увеличения вычислительных затрат.
Что показали испытания
В симуляциях VLASH стабильно обеспечивал более быстрые движения при сохранении точности. На реальных роботах метод улучшил результаты в задачах захвата и переноса предметов, укладки и сортировки.
В одном из демонстрационных тестов робот с VLASH раскладывал цветные кубики по коробкам в два раза быстрее базовых систем, сохраняя точность на уровне 90% — как у лучших обычных методов. Система также справилась с более динамичными задачами, включая настольный теннис и игру Whack-a-Mole.
Технология не требует дополнительных вычислительных ресурсов и может повысить эффективность роботов в ситуациях, где важна скорость реакции, — например, при поисково-спасательных работах и экстренном реагировании.
В будущем исследователи планируют объединить VLASH с генеративными «мировыми моделями», которые способны предсказывать не только положение робота, но и изменения в окружающей среде. Это потенциально расширит возможности системы для более сложных сценариев.
Пока VLASH показывает, что роботы могут стать заметно быстрее и плавнее, если научить их думать на шаг вперёд, не прерывая текущих движений.
