Bizibah Павел Гуров

Как «будет» превратилось в «бздеть»

В топе тегов моего новостного проекта появилось слово, которого в самих новостях не было. Разбор одной очень странной ошибки лемматизации.

1 минута чтения код, лингвистика, данные

В общем, есть у меня один проект свой, в котором я собираю новости с самых популярных ресурсов, а потом каждой новости присваиваю теги.

Вчера смотрю отчёт за день, в котором публикуются теги, набирающие популярность, и вижу в топе русское слово «бздеть». Выглядит так, словно резко выросла к нему популярность и новостные ресурсы стали писать на эту тематику. Это очень странно. К тому же в последней связанной с этим тегом новости этот тег не присутствует.

В общем, полез в базу — там 23 упоминания тега за позавчера, да и вообще много раз оно встречается за пару месяцев.

Самое странное в том, что в самих новостях его нет. Отдельно по новостям поискал — там тоже нету, «перебздеть» только есть, если искать по «бзд».

Думаю, что за магия, и решил воспроизвести по шагам. Обнулил вчерашние теги и запустил тегирование заново.

В общем, ошибка была в той библиотеке, которую я использую для преобразования слов к нормальной форме: «синих» → «синий», «писал» → «писать» и так далее.

Она преобразовывала «будет» в «бздеть» 😅

Вообще слово «быть» слишком общее и у меня вроде в стоп-словах находится. Сейчас уже проблему в базе и репорте исправил.

Вот эта библиотека: https://pypi.org/project/simplemma/