Публікація:
Дослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу

dc.contributor.authorАргунов, М. К.
dc.date.accessioned2026-10-10T06:58:34Z
dc.date.issued2026
dc.description.abstractОб’єкт дослідження – процес побудови малої мовної моделі на базі архітектури Transformer. Предмет дослідження – методи підготовки даних, архітектурні рішення та стратегії навчання, що впливають на якість генералізації моделі. Мета роботи – демонстрація повного шляху побудови мовної моделі від підготовки та фільтрації даних до оцінки на прикладній задачі машинного перекладу (DE→EN). Методи дослідження – експериментальний метод (побудова та навчання моделі з різними конфігураціями даних), порівняльний аналіз (зіставлення результатів моделей, навчених на фільтрованих та нефільтрованих даних). Розроблено триетапний конвеєр фільтрації веб-корпусу OSCAR, що відсіює приблизно 90% документів. Реалізовано кастомну encoder-decoder Transformer-архітектуру з приблизно 100M параметрами із сучасними модифікаціями (GQA, RoPE, SwiGLU, Pre-LN). Проведено передтренування та дотренування на задачі машинного перекладу. Емпірично підтверджено, що модель, передтренована на 250M фільтрованих токенів, перевершує модель на 384M нефільтрованих токенів за якістю генералізації, що еквівалентно приблизно 35% економії обчислювальних витрат
dc.identifier.citationАргунов М. К. Дослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на першому (бакалаврському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 76 с.
dc.identifier.urihttps://openarchive.nure.ua/handle/document/36269
dc.language.isouk
dc.subjectвеб-корпус,
dc.subjecttransformer
dc.subjectякість даних
dc.subjectфільтрація даних
dc.subjectпередтренування
dc.subjectмовна модель
dc.subjectмашинний переклад
dc.titleДослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу
dc.typeOther
dspace.entity.typePublication

Файли

Оригінальний пакунок

Зараз показано 1 - 2 з 2
Завантаження...
Зображення мініатюри
Назва:
2026_B_ShI_Argunov_MK.pdf
Розмір:
696.22 KB
Формат:
Adobe Portable Document Format
Завантаження...
Зображення мініатюри
Назва:
Dodatok_Argunov.pdf
Розмір:
239.15 KB
Формат:
Adobe Portable Document Format

Пакунок ліцензії

Зараз показано 1 - 1 з 1
Завантаження...
Зображення мініатюри
Назва:
license.txt
Розмір:
10.74 KB
Формат:
Item-specific license agreed upon to submission
Опис: