Волонтерський проєкт LapaLLM, започаткований групою українських дослідників, продовжує роботу над адаптацією великих мовних моделей до української мови. Керівник проєкту, аспірант Українського католицького університету Юрій Панів, в інтерв’ю розповів про поточні результати, виклики та стратегічні пріоритети розвитку технологій обробки природної мови в Україні – пише dou.
Поточний стан проєкту
LapaLLM залишається волонтерською ініціативою, до якої наразі залучено 13 спеціалістів. Команда успішно дотренувала 12-мільярдну модель на базі архітектури Gemma з урахуванням українського мовного контексту. Наступним етапом стало експериментальне тренування більшої моделі — Mistral Small (120 млрд параметрів, архітектура Mixture of Experts). Для цього дослідники отримали доступ до суперкомп’ютера JUPITER у межах європейської програми EuroHPC. Доступ охоплює 5000 нод-годин на вузлах із чотирма відеокартами GH200.
Одним із ключових результатів роботи стало створення відкритого лідерборду для оцінки якості роботи мовних моделей з українською мовою, а також публікація більшості тренувальних датасетів і програмного коду. Це дозволяє іншим дослідникам самостійно відтворювати результати та розвивати власні рішення.
У лідерборді наразі відсутні закриті комерційні моделі (зокрема від Anthropic). Причина — висока вартість тестування: один повний прогін бенчмарків через API оцінюється у 400–500 доларів США. Команда планує розширити перелік протестованих моделей після отримання грантового фінансування, включивши моделі обсягом до трьох трильйонів параметрів.
Необхідність розвитку українських мовних моделей
За оцінкою керівника проєкту, потреба у якісних рішеннях для української мови має кілька вимірів. По-перше, продуктивність: поширені міжнародні моделі часто демонструють нижчу якість роботи українською порівняно з англійською, зокрема через кальковані терміни та недостатнє розуміння контексту. По-друге, питання приватності: можливість локального розгортання моделей у закритому контурі є критичною для обробки чутливих даних у державному секторі, бізнесі та оборонній сфері. По-третє, формування національної експертизи в галузі обробки природної мови.
Серед моделей обсягом до 30 млрд параметрів найкращі результати в роботі з українською мовою, згідно з вимірюваннями LapaLLM, показує Gemma 4. Її перевага пояснюється мультилінгвальною орієнтацією розробника та розширеним словником токенізатора (близько 200 тисяч токенів).
Оцінка державних ініціатив
Щодо проєкту «Сяйво», який реалізується за участі Міністерства цифрової трансформації та компанії «Київстар», Юрій Панів зазначив, що Мінцифри виконує роль замовника та працює над законодавчим регулюванням питань авторського права на дані. Серед технічних напрацювань відомства — ШІ-асистент у застосунку «Дія» та інструменти для автоматичного маскування персональних даних.
Водночас керівник LapaLLM звертає увагу на тривалість розробки «Сяйва» (близько півтора року) та неодноразові перенесення термінів релізу. На його думку, доцільнішим підходом могло б стати створення вузькоспеціалізованих рішень під конкретні сценарії використання (зокрема RAG-системи) з подальшою демонстрацією вимірюваних результатів.
Перспективи галузі та професії
Щодо загального стану ринку великих мовних моделей, Юрій Панів прогнозує можливе «лускання бульбашки» у середньостроковій перспективі за відсутності суттєвого фінансового прориву. Ознаками напруження вже стали підвищення цін на API-послуги та зменшення лімітів використання навесні поточного року. Водночас попит на спеціалістів у сфері навчання та адаптації мовних моделей збережеться через наявність нерозв’язаних завдань у робототехніці, автономних системах та інших напрямах.
Для України пріоритетним залишається розвиток власної експертизи. Керівник LapaLLM закликає дослідників і розробників самостійно експериментувати з тренуванням моделей, оскільки саме практичний досвід дозволяє глибше зрозуміти принципи їхньої роботи та обмеження.
Видання GALERANEWS зазначає, що проєкт LapaLLM демонструє, що навіть в умовах обмежених ресурсів українська спільнота здатна створювати конкурентоспроможні інструменти для роботи з національною мовою та робити їх відкритими для подальшого розвитку.