Любопытство позволяет искусственному интеллекту учиться вдвое быстрее / Все новости / Главная

Исследователи из Окинавского института науки и технологий (OIST) создали виртуальных роботов с искусственным интеллектом, которые осваивают язык примерно вдвое быстрее обычных систем. Секрет — в поощрении любопытства, а не только в выполнении заданий. В результате роботы начинают спонтанно «играть» и лучше справляются с незнакомыми ситуациями.

В отличие от больших языковых моделей, которые просто предсказывают следующее слово по огромным массивам данных, команда использовала архитектуру, вдохновлённую работой мозга, — Predictive Coding-inspired Variational Recurrent Neural Network (PV-RNN). Модель стремится минимизировать «свободную энергию»: одновременно повышать точность предсказаний и по возможности меньше менять свои внутренние представления о мире.

К этой системе добавили обучение с подкреплением. Робот получал внешнюю награду за выполнение языковых заданий и внутреннюю — за удовлетворение любопытства. То есть за исследование новых, непривычных ситуаций, которые требовали обновления внутренней модели. Баланс между стабильностью и исследованием позволил находить решения сложных задач эффективнее.

Игра и неожиданное поведение

Во время обучения «любопытные» роботы начали вести себя почти по-детски. Даже после того, как осваивали задание, они продолжали экспериментировать — например, сталкивали предметы, хотя никто их этому не учил. Исследователи обнаружили, что такое спонтанное исследование ускоряет усвоение языка.

«Нас поразило игроподобное поведение и способность справляться с исключениями, которые возникли самостоятельно в процессе обучения», — отметил Теодор Тинкер (Theodore Tinker), первый автор работы и аспирант лаборатории когнитивной нейроробототехники OIST.

Умение обращаться с исключениями

Эксперименты также пролили свет на классическую проблему лингвистики — «бедность стимула» Ноама Хомского: как дети так быстро учат язык, получая неполные и несовершенные данные.

Одного любопытства оказалось недостаточно. Нужна ещё богатая языковая среда. Роботы, которые видели только 48 комбинаций, обоблизовали знания примерно на 25%. Те, кто сталкивался со 180 комбинациями, достигали около 85%. Разнообразие языкового опыта резко повышало способность понимать ранее не встречавшиеся инструкции.

Ещё один неожиданный результат — U-образная кривая обучения, знакомая по развитию детей. Когда исследователи специально поменяли значения двух заданий местами, роботы сначала правильно усваивали исключения. Затем, по мере обобщения общих правил, их точность временно падала, а потом снова восстанавливалась. Это напоминает, как дети какое-то время говорят «хочу» вместо «хочут» или «бегал» вместо «бежал», прежде чем освоить исключения.

В модели не было заложено никаких специальных механизмов для работы с исключениями. Такое поведение возникло само.

Прозрачность как преимущество

Важное достоинство PV-RNN — прозрачность. В отличие от огромных «чёрных ящиков», исследователи могут в реальном времени наблюдать, как робот обновляет свои внутренние убеждения. Это делает систему удобной площадкой и для изучения искусственного интеллекта, и для понимания того, как человек осваивает язык.

«Роботы не думают как дети, а их среда очень абстрактна по сравнению с плотным языковым окружением ребёнка. Но именно эта абстрактность позволяет изучать влияние любопытства в убедительной модели того, как люди учатся обрабатывать язык», — пояснил Дзюн Тани (Jun Tani), руководитель лаборатории и старший автор исследования.

Работа показывает: если дать искусственному интеллекту не только награды за правильные ответы, но и стимул исследовать неизведанное, он начинает учиться быстрее и гибче. И при этом неожиданно воспроизводит некоторые черты детского познания.

 

Похожие новости
Комментарии

comments powered by Disqus
Мы в социальных сетях: