Публікація:
Дослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу

Завантаження...
Зображення мініатюри

Дата

Назва журналу

ISSN журналу

Назва тому

Видавець

Дослідницькі проекти

Організаційні одиниці

Випуск журналу

Анотація

Об’єкт дослідження – процес побудови малої мовної моделі на базі архітектури Transformer. Предмет дослідження – методи підготовки даних, архітектурні рішення та стратегії навчання, що впливають на якість генералізації моделі. Мета роботи – демонстрація повного шляху побудови мовної моделі від підготовки та фільтрації даних до оцінки на прикладній задачі машинного перекладу (DE→EN). Методи дослідження – експериментальний метод (побудова та навчання моделі з різними конфігураціями даних), порівняльний аналіз (зіставлення результатів моделей, навчених на фільтрованих та нефільтрованих даних). Розроблено триетапний конвеєр фільтрації веб-корпусу OSCAR, що відсіює приблизно 90% документів. Реалізовано кастомну encoder-decoder Transformer-архітектуру з приблизно 100M параметрами із сучасними модифікаціями (GQA, RoPE, SwiGLU, Pre-LN). Проведено передтренування та дотренування на задачі машинного перекладу. Емпірично підтверджено, що модель, передтренована на 250M фільтрованих токенів, перевершує модель на 384M нефільтрованих токенів за якістю генералізації, що еквівалентно приблизно 35% економії обчислювальних витрат

Опис

Ключові слова

веб-корпус,, transformer, якість даних, фільтрація даних, передтренування, мовна модель, машинний переклад

Цитування

Аргунов М. К. Дослідження повного циклу розробки генеративних мовних моделей: від підготовки даних до оптимізації інференсу : пояснювальна записка до кваліфікаційної роботи здобувача вищої освіти на першому (бакалаврському) рівні, спеціальність 122 Комп’ютерні науки / М-во освіти і науки України, Харків. нац. ун-т радіоелектроніки. Харків, 2026. 76 с.

DOI

Схвалення

Рецензія

Доповнено

На які посилаються