Публікація:
Навчання з підкріпленням на основі зворотного зв’язку від штучного інтелекту для вирівнювання моделей

Завантаження...
Зображення мініатюри

Дата

Назва журналу

ISSN журналу

Назва тому

Видавець

Дослідницькі проекти

Організаційні одиниці

Випуск журналу

Анотація

Об’єкт дослідження – процес алгоритмічного вирівнювання та оптимізації поведінки генеративних нейронних мереж в умовах відсутності ручного зворотного зв'язку. для Предмет дослідження – методи, алгоритми та архітектурні рішення побудови автоматизованого RLAIF-пайплайну, що включає конституційне AI-оцінювання, навчання проксимальну оптимізацію політики. моделі винагороди та Мета роботи – підвищення точності, безпеки й фактичної достовірності генерації тексту у великих мовних моделях шляхом дослідження та програмної реалізації оптимізованого алгоритмічного пайплайну навчання з підкріпленням на основі зворотного зв'язку від штучного інтелекту. Методи дослідження – методи машинного навчання та навчання з підкріпленням, статистичне моделювання переваг (модель Бредлі-Террі), трансформерна архітектура нейронних мереж, алгоритми оптимізації політики (PPO), а також методи порівняльного аналізу та оцінювання якості текстових систем.

Опис

Ключові слова

автоматизоване оцінювання, вирівнювання моделей, навчання з підкріпленням, модель винагороди

Цитування

Селін Я. Ю. Навчання з підкріпленням на основі зворотного зв’язку від штучного інтелекту для вирівнювання моделей : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на другому (магістерському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 67 с.

DOI

Схвалення

Рецензія

Доповнено

На які посилаються