Исследователи из Окинавского института науки и технологий (OIST) создали виртуальных роботов с искусственным интеллектом, которые осваивают язык примерно вдвое быстрее обычных систем. Секрет — в поощрении любопытства, а не только в выполнении заданий. В результате роботы начинают спонтанно «играть» и лучше справляются с незнакомыми ситуациями.

В отличие от больших языковых моделей, которые просто предсказывают следующее слово по огромным массивам данных, команда использовала архитектуру, вдохновлённую работой мозга, — Predictive Coding-inspired Variational Recurrent Neural Network (PV-RNN). Модель стремится минимизировать «свободную энергию»: одновременно повышать точность предсказаний и по возможности меньше менять свои внутренние представления о мире.
К этой системе добавили обучение с подкреплением. Робот получал внешнюю награду за выполнение языковых заданий и внутреннюю — за удовлетворение любопытства. То есть за исследование новых, непривычных ситуаций, которые требовали обновления внутренней модели. Баланс между стабильностью и исследованием позволил находить решения сложных задач эффективнее.
Игра и неожиданное поведение
Во время обучения «любопытные» роботы начали вести себя почти по-детски. Даже после того, как осваивали задание, они продолжали экспериментировать — например, сталкивали предметы, хотя никто их этому не учил. Исследователи обнаружили, что такое спонтанное исследование ускоряет усвоение языка.
«Нас поразило игроподобное поведение и способность справляться с исключениями, которые возникли самостоятельно в процессе обучения», — отметил Теодор Тинкер (Theodore Tinker), первый автор работы и аспирант лаборатории когнитивной нейроробототехники OIST.
Умение обращаться с исключениями
Эксперименты также пролили свет на классическую проблему лингвистики — «бедность стимула» Ноама Хомского: как дети так быстро учат язык, получая неполные и несовершенные данные.
Одного любопытства оказалось недостаточно. Нужна ещё богатая языковая среда. Роботы, которые видели только 48 комбинаций, обоблизовали знания примерно на 25%. Те, кто сталкивался со 180 комбинациями, достигали около 85%. Разнообразие языкового опыта резко повышало способность понимать ранее не встречавшиеся инструкции.
Ещё один неожиданный результат — U-образная кривая обучения, знакомая по развитию детей. Когда исследователи специально поменяли значения двух заданий местами, роботы сначала правильно усваивали исключения. Затем, по мере обобщения общих правил, их точность временно падала, а потом снова восстанавливалась. Это напоминает, как дети какое-то время говорят «хочу» вместо «хочут» или «бегал» вместо «бежал», прежде чем освоить исключения.
В модели не было заложено никаких специальных механизмов для работы с исключениями. Такое поведение возникло само.
Прозрачность как преимущество
Важное достоинство PV-RNN — прозрачность. В отличие от огромных «чёрных ящиков», исследователи могут в реальном времени наблюдать, как робот обновляет свои внутренние убеждения. Это делает систему удобной площадкой и для изучения искусственного интеллекта, и для понимания того, как человек осваивает язык.
«Роботы не думают как дети, а их среда очень абстрактна по сравнению с плотным языковым окружением ребёнка. Но именно эта абстрактность позволяет изучать влияние любопытства в убедительной модели того, как люди учатся обрабатывать язык», — пояснил Дзюн Тани (Jun Tani), руководитель лаборатории и старший автор исследования.
Работа показывает: если дать искусственному интеллекту не только награды за правильные ответы, но и стимул исследовать неизведанное, он начинает учиться быстрее и гибче. И при этом неожиданно воспроизводит некоторые черты детского познания.
