Публікація: Дослідження та порівняння методів екстракції даних з неструктурованих текстових документів на основі NLP-моделей
Завантаження...
Дата
Автори
Назва журналу
ISSN журналу
Назва тому
Видавець
Анотація
Об’єкт дослідження – процес екстракції даних з неструктурованих текстових документів. Предмет дослідження – методи екстракції даних з текстових документів на основі NLP-моделей. Мета роботи – дослідження та порівняння методів екстракції даних з неструктурованих текстових документів на основі NLP-моделей. Методи дослідження – методи обробки природної мови, розпізнавання іменованих сутностей, rule-based підхід, моделі машинного навчання та трансформерні моделі (spaCy, BERT, DistilBERT), методи оцінювання якості (precision, recall, F1-score). У роботі досліджено та порівняно методи екстракції даних з неструктурованих текстових документів на основі NLP-моделей на прикладі текстових резюме. Реалізовано rule-based підхід, модель на основі spaCy, трансформерні моделі DistilBERT та BERT-base-cased, а також гібридний підхід. Проведено експериментальне оцінювання ефективності методів із використанням метрик якості та виконано їх порівняльний аналіз. Результати дослідження показали доцільність використання комбінованих підходів для підвищення якості екстракції інформації.
Опис
Ключові слова
екстракція даних, неструктуровані текстові документи, обробка природної мови
Цитування
Тернинко Д. І. Дослідження та порівняння методів екстракції даних з неструктурованих текстових документів на основі NLP-моделей : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на другому (магістерському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 84 с.