Языковые модели не могут отследить перечитывание текста: неожиданные результаты теста на синтаксис

Добавь сайт в закладки! Инструкция по ссылке.

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Масштабное исследование с участием 368 читателей и 409 нейросетевых оценок показало, что генерация следующего токена не отражает работу мозга при исправлении ошибок в сложных предложениях

Исследователи из Нью-Йоркского университета (New York University) и Университета Массачусетса в Амхерсте (University of Massachusetts Amherst) обнаружили, что широко используемая метрика вероятности следующего токена в языковых нейросетях не адекватно демонстрирует, как человеческий мозг справляется с ошибками понимания во время чтения. В исследовании, представленном в журнале Национальной академии наук США (Proceedings of the National Academy of Sciences, PNAS), были сопоставлены движения глаз 368 взрослых читателей с 409 оценками вероятности слов, полученными от различных языковых моделей.

Эксперимент показал, что простой принцип предсказания следующего слова описывает лишь базовое беглое чтение и совершенно не учитывает процессы синтаксического переосмысления и возвратные движения глаз, которые человек выполняет при столкновении со сложными фразами.

Для проверки когнитивной точности нейросетей исследователи применили метод отслеживания глаз (eye-tracking) и разделили процесс чтения на 4 отслеживаемых параметра: время первого прямого прохода по слову, факт совершения регрессии (возвратного движения взгляда к ранее прочитанным словам), время до регрессии и общее время повторного чтения.

Участникам предлагалось читать контролируемые предложения с синтаксической неоднозначностью — так называемые «гарден-пат» (garden-path) фразы, которые изначально сбивают с толку и требуют переосмысления смысла ближе к концу. Во всех протестированных моделях математический показатель «сюрпризал» (surprisal) — мера неожиданности слова для алгоритма на основе предыдущего текста — коррелировал с замедлением читателя при первом проходе, но значительно недооценил временные затраты на повторный анализ структуры.

Изображение сгенерировано: Nano Banana

Результаты эксперимента подтверждают многоступенчатую гипотезу о процессе чтения у человека. Предсказание следующего слова способствует пониманию знакомых понятий и быстрой интеграции смыслов в простом тексте, но оказывается неприемлемым для описания механизмов обнаружения ошибок и реструктуризации предложений. Когда первоначальная интерпретация текста становится неуместной, человек осознанно возвращает взгляд к конкретным ключевым словам для исправления логики, тогда как «статистический сюрпризал» нейросетей оценивает лишь линейную вероятность токенов без построения и пересчёта иерархических грамматических связей.

Авторы подчеркивают, что данное исследование не ставит целью дискредитировать языковые модели как инструмент, но указывает на четкие ограничения их использования в когнитивных науках. Вероятность следующего токена больше не может считаться единственным и полным эквивалентом сложности текста для человеческого восприятия.

Для разработчиков, создающих системы оценки понятности интерфейсов или вспомогательные инструменты для людей с нарушениями чтения, использование классической авторегрессионной вероятности оказывается недостаточным. Будущие сервисы оценки сложности текста должны включать явные механизмы структурного анализа, регистрации и подсчета ошибок, а также «синтаксического ремонта».

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка