Lapa LLM
Data-Efficient Adaptation of Multilingual LLMs to Ukrainian
Як ми створили Lapa LLM для української мови?
Питання
Навіщо ця робота
Ця стаття описує роботу з даними, на якій ґрунтується Lapa LLM — українська мовна модель з відкритим доступом на основі Gemma-3-12B. У ній розглянуто неефективну токенізацію, нестачу якісних даних та інструкційних прикладів. Проєкт надає українській NLP-спільноті моделі, навчальні дані, класифікатори якості й код для подальшого використання.
Lapa LLM названо на честь українського дослідника Валентина Лапи. Про проєкт ↗
Підхід
Візуальне пояснення
Три зміни в роботі з даними
Адаптація словника
Поліпшити українську токенізацію без навчання всієї моделі з нуля.
Фільтрування за якістю
Перенести сигнали якості між мовами через перекладені дані.
Інструкційні дані
Поєднати переклад, перетворення завдань і цільовий синтез.
Внесок роботи
Адаптована модель використовує приблизно дві третини початкової кількості токенів для того самого тексту — у статті зазначено зменшення в 1,5 раза. Також наведено сильні результати на українських тестах та інструкційних завданнях і відкрито моделі, дані, класифікатори й код.
Оригінальна робота й ресурси
У збірнику Proceedings of the Fifth Ukrainian Natural Language Processing Conference (UNLP 2026), с. 155–168, Львів, Україна. Асоціація комп’ютерної лінгвістики.
Бібліографічний опис
Paniv, Y., Didenko, B., Haltiuk, M., Humennyy, V., Kravchenko, A., Kyslyi, R., Makovska, V., Orlovskyi, A., Ruban, B., Rudko, M.-Y., Senyk, A., Drushchak, N., Chaplynskyi, D., & Romanyshyn, M. (2026). Data-Efficient Adaptation of Multilingual LLMs to Ukrainian. In Proceedings of the Fifth Ukrainian Natural Language Processing Conference (UNLP 2026), 155-168. Association for Computational Linguistics. https://aclanthology.org/2026.unlp-1.14/
BibTeX
@inproceedings{paniv-etal-2026-data,
title = {Data-Efficient Adaptation of Multilingual {LLM}s to {U}krainian},
author = {Paniv, Yurii and Didenko, Bohdan and Haltiuk, Mykola and Humennyy, Vladyslav and Kravchenko, Andrian and Kyslyi, Roman and Makovska, Viktoriia and Orlovskyi, Artem and Ruban, Bohdan and Rudko, Maksym-Yurii and Senyk, Anastasiia and Drushchak, Nazarii and Chaplynskyi, Dmytro and Romanyshyn, Mariana},
booktitle = {Proceedings of the Fifth {U}krainian Natural Language Processing Conference ({UNLP} 2026)},
year = {2026},
address = {Lviv, Ukraine},
publisher = {Association for Computational Linguistics},
pages = {155--168},
url = {https://aclanthology.org/2026.unlp-1.14/}
}