Публікація: Використання дифузійних моделей для відновлення табличних даних
Завантаження...
Дата
Автори
Назва журналу
ISSN журналу
Назва тому
Видавець
Анотація
Об’єкт дослідження – задача відновлення пропущених значень у гетерогенних табличних наборах даних. Предмет дослідження – використання дифузійних моделей та гібридних генеративних архітектур для імпутації табличних даних. Мета роботи – розробка гібридного генеративного фреймворку LIR для статистично коректного відновлення пропусків із меншою затримкою виведення порівняно з базовими дифузійними моделями. Методи дослідження – теоретичний аналіз, математичне моделювання з використанням стохастичних диференціальних рівнянь, емпіричний та статистичний аналіз розробленого методу на реальних датасетах. Роботу присвячено вирішенню компромісу між дистрибутивною точністю та обчислювальною ефективністю при імпутації табличних даних. Розроблено фреймворк LIR, який поєднує детермінований «теплий старт» на основі ансамблю проекторів зі стохастичним вдосконаленням у латентному просторі VAE за допомогою SDEdit. Математично обґрунтовано межу збурення для низькорозмірних просторів та впроваджено адаптивне планування кроку дифузії. Експерименти на реальних наборах даних підтвердили, що фреймворк забезпечує точність відтворення спільного розподілу, зіставну з повнотраєкторними моделями, водночас скорочуючи кількість нейронних обчислень на 30%.
Опис
Ключові слова
генеративна модель, дифузійна модель, табличні дані, імпутація даних, латентний простір, пропущені значення
Цитування
Гончаренко О. В. Використання дифузійних моделей для відновлення табличних даних : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на другому (магістерському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 122 с.