Bizibah Павел Гуров

Почему длинный контекст лучше держится в русском

Падежи, согласование и длинные словоформы работают на модель: ей проще помнить, кто с кем и что сделал через сорок тысяч токенов.

1 минута чтения llm, лингвистика

LLM лучше понимают длинный контекст в польском и русском, чем в английском.

Таблица языков со звёздочками по трём столбцам: длинный контекст, извлечение, структурная стабильность. Польский впереди, русский следом

С точки зрения архитектуры трансформеров русский язык идеален для длинного контекста.

1. Морфологическая избыточность. Русский — флективный язык с падежами, родами, согласованием и относительно свободным порядком слов. 👉 Модель легче «помнит», кто с кем и что сделал через 20–50k токенов.

2. Длина слов и токенизация. Русские словоформы длиннее английских, меньше омонимии, ниже вероятность attention collision в длинных документах. 👉 Легче найти иголку в стоге сена.

Почему он чуть ниже польского?

Меньше качественных long-context корпусов. По сравнению с польским: меньше длинных, хорошо размеченных документов; меньше instruction-style long-context данных; меньше синтетических needle-задач при обучении.

Перекос в стиле данных. Русские данные часто художественные, публицистические, форумные. А вот структурных длинных документов меньше, чем в польских и немецких корпусах.