Как «будет» превратилось в «бздеть»
В топе тегов моего новостного проекта появилось слово, которого в самих новостях не было. Разбор одной очень странной ошибки лемматизации.
В общем, есть у меня один проект свой, в котором я собираю новости с самых популярных ресурсов, а потом каждой новости присваиваю теги.
Вчера смотрю отчёт за день, в котором публикуются теги, набирающие популярность, и вижу в топе русское слово «бздеть». Выглядит так, словно резко выросла к нему популярность и новостные ресурсы стали писать на эту тематику. Это очень странно. К тому же в последней связанной с этим тегом новости этот тег не присутствует.
В общем, полез в базу — там 23 упоминания тега за позавчера, да и вообще много раз оно встречается за пару месяцев.
Самое странное в том, что в самих новостях его нет. Отдельно по новостям поискал — там тоже нету, «перебздеть» только есть, если искать по «бзд».
Думаю, что за магия, и решил воспроизвести по шагам. Обнулил вчерашние теги и запустил тегирование заново.
В общем, ошибка была в той библиотеке, которую я использую для преобразования слов к нормальной форме: «синих» → «синий», «писал» → «писать» и так далее.
Она преобразовывала «будет» в «бздеть» 😅
Вообще слово «быть» слишком общее и у меня вроде в стоп-словах находится. Сейчас уже проблему в базе и репорте исправил.
Вот эта библиотека: https://pypi.org/project/simplemma/