Публікація: Інформаційна технологія інтелектуального синтезу мовлення на основі текстових даних
Завантаження...
Дата
Автори
Назва журналу
ISSN журналу
Назва тому
Видавець
Анотація
Об’єкт дослідження – синтез мовлення з текстових даних. Предмет дослідження – використання Flow Matching для швидкого та якісного синтезу мовлення. Мета роботи – розробка моделі для синтезу мовлення, шляхом створення архітектури моделі, її програмної реалізації та навчання моделі і подальше використання її для синтезу мовлення. Методи дослідження – теоретичний збір необхідної інформації, а саме збір даних про функціонування мовлення, фонетики, аналіз існуючих рішень та їхніх переваг і недоліків. Експериментальне дослідження, шляхом розробки архітектури та її програмної реалізації використовуючи мову програмування Python на базі фреймворку PyTorch та супутніх бібліотек оброки даних. У результаті роботи було проведено теоретичний аналіз існуючих архітектур, з врахуванням їхніх недоліків було створено власну архітектуру з використанням Flow Matching. Модель було навчено на датасеті LJSpeech та паралельно навчено ще одну копію моделі на українському датасеті filatov-24000. Отримані навчені моделі змогли показати кращий результат ніж проаналізовані минулі архітектури, які були навчені на аналогічних наборах даних.
Опис
Ключові слова
акустична модель, вокодер, генераційна модель, мел-спектограма, просодія, синтез мовлення, фонеми
Цитування
Агафонов В. Д. Інформаційна технологія інтелектуального синтезу мовлення на основі текстових даних : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на першому (бакалаврському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 71 с.