Центр компетенцій WINWIN AI при Міністерстві цифрової трансформації України спільно з Українським католицьким університетом та ініціативою lang-uk офіційно представив Ukrainian LLM Leaderboard — відкритий національний рейтинг, який оцінює якість роботи великих мовних моделей (LLM) саме з українською мовою – розповідає dev.ua.
Дотепер більшість глобальних бенчмарків тестували моделі переважно англійською. Якість роботи з українською часто оцінювалася опосередковано — через машинний переклад, що приховувало специфічні помилки, русизми, кальки та нерозуміння локального контексту. Новий рейтинг усуває цю прогалину.
Мета та методологія
Рейтинг створено як відкриту платформу. Усі дані, код та результати тестування опубліковано на Hugging Face, що забезпечує повну прозорість і можливість самостійної перевірки методології.
Моделі оцінюються на завданнях, максимально наближених до реального використання:
- машинний переклад і стиснення текстів (FLORES-200, Long FLORES, WMT);
- пошук відповідей у документах (SQuAD);
- логічне міркування (ARC Challenge);
- виконання складних інструкцій (IFEval);
- завдання рівня ЗНО та математичні обчислення.
Розробниками методології виступили експерти УКУ та спільноти lang-uk Юрій Панів і Дмитро Чаплінський, які понад десять років працюють над технологіями обробки української мови. Цю ж систему оцінювання вже застосовували під час розробки вітчизняної моделі Lapa LLM.
Поточні лідери рейтингу
За даними Ukrainian LLM Leaderboard (станом на 29 липня 2026 року, сортування за середнім рангом) провідні позиції посідають:
- google/gemma-4-26B-A4B-it (reasoning) — найвищі показники у дотриманні інструкцій та логічних завданнях.
- INSAIT-Institute/MamayLM-Gemma-3-27B-IT-v2.0 — сильні результати в машинному перекладі та логіці.
- INSAIT-Institute/MamayLM-Gemma-3-12B-IT-v2.0 — стабільно високі результати серед моделей середнього розміру.
- lapa-llm/lapa-v0.1.2-instruct — один із найкращих показників у перекладі (FLORES та Long FLORES).
- INSAIT-Institute/MamayLM-Gemma-3-12B-IT-v1.0.
Серед інших моделей, що демонструють конкурентні результати, — версії Lapa, квантовані варіанти MamayLM, а також окремі моделі сімейств Gemma, Qwen та Llama.
Рейтинг не обмежується одним узагальненим балом. Модель може показувати високі результати в одному типі завдань (наприклад, перекладі) і значно слабші — в іншому (логіка чи виконання інструкцій). Це дозволяє користувачам обирати модель під конкретні потреби.
Видання GALERANEWS дізналося, що у подальшому планується розширення рейтингу: додавання тестів на роботу із зображеннями, оцінювання етичності відповідей, аналіз вартості використання моделей українською мовою, а також окремий блок завдань, характерних для державного сектору (робота з нормативними документами, адміністративними процедурами та персональними даними).