Публікація:
Дослідження нейромережевих методів розпізнавання мовлення за аудіосигналом та візуальними даними обличчя диктора

Завантаження...
Зображення мініатюри

Дата

Назва журналу

ISSN журналу

Назва тому

Видавець

Дослідницькі проекти

Організаційні одиниці

Випуск журналу

Анотація

Мета роботи — дослідження нейромережевих методів розпізнавання мовлення за аудіосигналом та візуальними даними обличчя диктора, а також розробка програмного модуля аудіовізуальної обробки мовлення. Досліджуються сучасні нейромережеві методи автоматичного розпізнавання мовлення, підходи до візуального розпізнавання мовлення за рухом губ та аудіовізуальні методи обробки мовної інформації. У роботі розглянуто моделі DeepSpeech, DeepSpeech 2, wav2vec 2.0, Whisper, LipNet та AV-HuBERT, а також засоби OpenCV, MediaPipe Face Mesh і MoviePy для програмної реалізації. У результаті роботи розроблено програмний модуль мовою Python, який витягує аудіодоріжку з відеофайлу, виконує розпізнавання мовлення за допомогою Whisper, обробляє відеокадри, визначає ключові точки обличчя та виділяє область губ диктора. Тестування показало, що модуль коректно формує текстовий результат за аудіоканалом і зберігає візуальні фрагменти області губ для подальшого аналізу.

Опис

Ключові слова

автоматичне розпізнавання мовлення, область губ, аудіовізуальна обробка

Цитування

Максименко В. Ю. Дослідження нейромережевих методів розпізнавання мовлення за аудіосигналом та візуальними даними обличчя диктора : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на першому (бакалаврському) рівні, спеціальність 172 Телекомунікації та радіотехніка / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 77 с.

DOI

Схвалення

Рецензія

Доповнено

На які посилаються