Публікація:
Дослідження методів автоматичної обробки текстової інформації для створення корпусів української мови

dc.contributor.authorПанченко, К. А.
dc.date.accessioned2026-07-11T19:02:16Z
dc.date.issued2026
dc.description.abstractThe current development of natural language processing (NLP) models requires large, high-quality, and verified text corpora. For the Ukrainian language, existing resources are mostly static and lack dynamic vocabulary from social networks. This work focuses on developing an automated system for creating a verified Ukrainian language corpus using Telegram data and official news websites. The methodology involves building a robust NLP pipeline for text preprocessing and applying a semantic verification algorithm. By utilizing TF-IDF vectorization and cosine similarity, the system compares unstructured messenger posts with reliable news sources. This approach filters out disinformation and noise, ensuring a high-quality dataset suitable for training modern AI models.
dc.identifier.citationПанченко К. А. Дослідження методів автоматичної обробки текстової інформації для створення корпусів української мови // Радіоелектроніка та молодь у XXI столітті : матеріали 30-го Міжнар. молодіж. форуму, 22–24 квітня 2026 р. Харків, 2026. Т. 6. С. 84-86.
dc.identifier.urihttps://openarchive.nure.ua/handle/document/35440
dc.language.isouk
dc.publisherХНУРЕ
dc.subjectобробка текстової інформації
dc.subjectстворення корпусів української мови
dc.titleДослідження методів автоматичної обробки текстової інформації для створення корпусів української мови
dc.typeConference proceedings
dspace.entity.typePublication

Файли

Оригінальний пакунок

Зараз показано 1 - 1 з 1
Завантаження...
Зображення мініатюри
Назва:
MRF_2026_T6-84-86.pdf
Розмір:
383.73 KB
Формат:
Adobe Portable Document Format

Пакунок ліцензії

Зараз показано 1 - 1 з 1
Завантаження...
Зображення мініатюри
Назва:
license.txt
Розмір:
10.74 KB
Формат:
Item-specific license agreed upon to submission
Опис: