Нейросети самостоятельно освоили роли членов предложения для понимания текста
Исследование Йельского университета, Университета Джонса Хопкинса, Нью-Йоркского университета и Microsoft Research показало, что большие языковые модели без внешнего контроля выучили символьную структуру языка: каждое слово хранится вместе со своей синтаксической ролью. Ученым удалось расшифровать этот внутренний код и управлять поведением моделей, меняя роли слов в предложении.
Большие языковые модели, лежащие в основе современных ИИ-чат-ботов, самостоятельно научились разбирать предложения по ролям слов — определять, кто действует, что делает и с кем. К такому выводу пришли специалисты Йельского университета, Университета Джонса Хопкинса, Нью-Йоркского университета и Microsoft Research. Результаты работы опубликованы на сервере препринтов arXiv.
Традиционно интеллект описывали как работу с символами — словами в предложении или знаками в логической формуле, которые складываются в упорядоченные конструкции. Современные нейросети устроены иначе: они хранят информацию в виде длинных наборов чисел, где никакой видимой структуры нет. Тем не менее именно они лучше всего справляются с языком, математикой, логикой и программированием. Ученые предположили, что символьная структура в нейросетях всё же есть, просто она спрятана внутри этих чисел.
Чтобы проверить догадку, исследователи попытались разгадать «шифр», которым нейросеть записывает прочитанный текст. Они исходили из того, что в этом шифре каждое слово хранится вместе со своей ролью в предложении, и составили по такому принципу собственную формулу, настроив ее на множестве примеров. Затем они шифровали фразы своей формулой и подставляли результат вместо настоящего «продукта мышления» нейросети. Если такую подделку удавалось прочитать так же, как оригинал, значит, ученые правильно угадали устройство шифра.
Так они проверили несколько небольших нейросетей и семь крупных языковых моделей, включая Gemma-3, Llama-3.1, Qwen3 и GPT-OSS. Догадка подтвердилась во всех случаях. Подробнее всего ученые изучили модель GPT-OSS, которой давали задачи по арифметике, логике, выполнению программного кода и грамматике — например, перевести предложение в страдательный залог или сделать из него вопрос. С подмененными представлениями модель решала задачи почти так же хорошо, как в обычном режиме, а наибольшее расхождение составило 2,36% в арифметике.
Найденную структуру исследователям удалось использовать для точечного управления моделью. Например, в предложении «Шпион помог умному поэту» они переносили слово «умный» из роли определения к дополнению в роль определения к подлежащему, и модель начинала вести себя так, будто получила фразу «Умный шпион помог поэту». В среднем такие вмешательства срабатывали в 90% случаев. Кроме того, метод правильно обрабатывал сочетания слов и ролей, которых не видел при обучении. По словам авторов, это значит, что модели действительно связывают элементы и их позиции по единым правилам, а не запоминают каждое сочетание отдельно.
Ученые считают, что нейросети воспроизводят символьные системы приближенно, а не точно. На это, в частности, указывает любопытный результат: вспомогательная модель, которую обучили восстанавливать предложение по внутреннему представлению GPT-OSS, справлялась с задачей лучше, если получала не настоящие данные нейросети, а их «очищенную» формульную версию. В одном из случаев точность выросла с 71% до 96%.
Авторы допускают, что похожим образом может работать и человеческий мозг, но подчеркивают: без отдельных исследований на данных мозговой активности делать такие выводы рано. Люди и нейросети демонстрируют общий принцип обучения и забывания информации, однако переносить результаты, полученные на языковых моделях, напрямую на биологические системы ученые пока не готовы.
4



