Почему длинный контекст лучше держится в русском
Падежи, согласование и длинные словоформы работают на модель: ей проще помнить, кто с кем и что сделал через сорок тысяч токенов.
LLM лучше понимают длинный контекст в польском и русском, чем в английском.

С точки зрения архитектуры трансформеров русский язык идеален для длинного контекста.
1. Морфологическая избыточность. Русский — флективный язык с падежами, родами, согласованием и относительно свободным порядком слов. 👉 Модель легче «помнит», кто с кем и что сделал через 20–50k токенов.
2. Длина слов и токенизация. Русские словоформы длиннее английских, меньше омонимии, ниже вероятность attention collision в длинных документах. 👉 Легче найти иголку в стоге сена.
Почему он чуть ниже польского?
❌ Меньше качественных long-context корпусов. По сравнению с польским: меньше длинных, хорошо размеченных документов; меньше instruction-style long-context данных; меньше синтетических needle-задач при обучении.
❌ Перекос в стиле данных. Русские данные часто художественные, публицистические, форумные. А вот структурных длинных документов меньше, чем в польских и немецких корпусах.