Современные нейросети умеют за секунды суммировать отчёты и отвечать на вопросы по документам. Но когда информация разбросана по десяткам слайдов, таблиц и графиков, даже самые мощные модели нередко пропускают важные детали. В финансах, юриспруденции или стратегии такая ошибка может дорого стоить.

Исследователи из Georgia Tech и J.P. Morgan создали систему SlideAgent, которая помогает большим языковым моделям лучше понимать сложные визуальные документы. Главная идея проста: разбирать материал так же, как это делают люди — сначала целиком, потом по страницам, а в конце — по отдельным элементам.
Как работает SlideAgent
Обычные мультимодальные модели часто пытаются «проглотить» всю страницу сразу. Из-за этого они могут неправильно посчитать столбцы на диаграмме или пропустить сноску. SlideAgent действует иначе.
Система анализирует документ на трёх уровнях:
- весь документ целиком (общая логика и структура),
- отдельные страницы и разделы,
- конкретные элементы — графики, таблицы, блоки текста.
Специализированные агенты работают на каждом уровне, а затем результаты объединяются в единую структурированную картину. Благодаря этому модель точнее отвечает на вопросы и лучше связывает информацию с разных слайдов.
«Центральным источником вдохновения стало то, как люди обычно читают длинную презентацию, — объясняет ведущий автор исследования Ицяо (Арен) Цзинь (Yiqiao Jin), аспирант Georgia Tech. — Сначала мы понимаем общий сюжет, потом находим нужные страницы, а уже потом при необходимости углубляемся в конкретные графики или таблицы».
Насколько это эффективнее
Систему протестировали на реальных финансовых презентациях, технических слайдах и наборах данных с вопросами по изображениям. SlideAgent стабильно превосходила ведущие коммерческие и открытые модели. В сложных задачах прирост точности достигал 10%.
По сравнению с базовой проприетарной моделью улучшение составило 7,9%, а по сравнению с открытыми моделями — 9,8%. Особенно заметный выигрыш наблюдался при сравнении данных между разными страницами и при анализе связей между визуальными элементами.
В высокоответственных сферах даже небольшая ошибка — неверно прочитанная цифра или пропущенная сноска — может повлиять на отчётность, оценку рисков или стратегические решения. SlideAgent показывает, что рост точности необязательно требует всё более огромных моделей. Иногда достаточно более умного способа организации работы с информацией.
Авторы подчёркивают: вместо того чтобы просто наращивать размер нейросетей, стоит уделять больше внимания архитектуре рассуждений. Именно такой подход может сделать ИИ в офисе заметно надёжнее.
