Публікація: Дослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу
Завантаження...
Дата
Автори
Назва журналу
ISSN журналу
Назва тому
Видавець
Анотація
Об’єкт дослідження – процес побудови малої мовної моделі на базі архітектури Transformer. Предмет дослідження – методи підготовки даних, архітектурні рішення та стратегії навчання, що впливають на якість генералізації моделі. Мета роботи – демонстрація повного шляху побудови мовної моделі від підготовки та фільтрації даних до оцінки на прикладній задачі машинного перекладу (DE→EN). Методи дослідження – експериментальний метод (побудова та навчання моделі з різними конфігураціями даних), порівняльний аналіз (зіставлення результатів моделей, навчених на фільтрованих та нефільтрованих даних). Розроблено триетапний конвеєр фільтрації веб-корпусу OSCAR, що відсіює приблизно 90% документів. Реалізовано кастомну encoder-decoder Transformer-архітектуру з приблизно 100M параметрами із сучасними модифікаціями (GQA, RoPE, SwiGLU, Pre-LN). Проведено передтренування та дотренування на задачі машинного перекладу. Емпірично підтверджено, що модель, передтренована на 250M фільтрованих токенів, перевершує модель на 384M нефільтрованих токенів за якістю генералізації, що еквівалентно приблизно 35% економії обчислювальних витрат
Опис
Ключові слова
веб-корпус,, transformer, якість даних, фільтрація даних, передтренування, мовна модель, машинний переклад
Цитування
Аргунов М. К. Дослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на першому (бакалаврському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 76 с.