Публікація: Навчання з підкріпленням на основі зворотного зв’язку від штучного інтелекту для вирівнювання моделей
Завантаження...
Дата
Автори
Назва журналу
ISSN журналу
Назва тому
Видавець
Анотація
Об’єкт дослідження – процес алгоритмічного вирівнювання та оптимізації поведінки генеративних нейронних мереж в умовах відсутності ручного зворотного зв'язку. для Предмет дослідження – методи, алгоритми та архітектурні рішення побудови автоматизованого RLAIF-пайплайну, що включає конституційне AI-оцінювання, навчання проксимальну оптимізацію політики. моделі винагороди та Мета роботи – підвищення точності, безпеки й фактичної достовірності генерації тексту у великих мовних моделях шляхом дослідження та програмної реалізації оптимізованого алгоритмічного пайплайну навчання з підкріпленням на основі зворотного зв'язку від штучного інтелекту. Методи дослідження – методи машинного навчання та навчання з підкріпленням, статистичне моделювання переваг (модель Бредлі-Террі), трансформерна архітектура нейронних мереж, алгоритми оптимізації політики (PPO), а також методи порівняльного аналізу та оцінювання якості текстових систем.
Опис
Ключові слова
автоматизоване оцінювання, вирівнювання моделей, навчання з підкріпленням, модель винагороди
Цитування
Селін Я. Ю. Навчання з підкріпленням на основі зворотного зв’язку від штучного інтелекту для вирівнювання моделей : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на другому (магістерському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 67 с.