Команда українських дослідників оголосила про публічний реліз Lapa LLM v0.1.2 — першої великої відкритої мовної моделі, спеціально оптимізованої для української мови – повідомляє dev.ua.
Характеристика моделі
Lapa LLM побудована на базі архітектури Gemma-3-12B і адаптована до мовних особливостей української. Однією з ключових технічних переваг моделі є спеціалізований токенізатор, який використовує близько 80 000 токенів, порівняно з понад 250 000 у вихідній моделі. Такий підхід забезпечує підвищення ефективності — обробка українських текстів відбувається приблизно у 1,5 раза швидше, ніж у базовій версії.
Результати та продуктивність
За результатами незалежних тестувань, Lapa LLM демонструє високі показники у виконанні широкого спектра завдань: розуміння інструкцій, переклад, резюмування текстів та запитання-відповідь (Q&A). У перекладі з англійської на українську модель досягла BLEU-показника близько 33 на еталонному наборі FLORES, що робить її найкращим відкритим перекладачем між цими мовами.
Також модель продемонструвала помітні результати у виявленні дезінформації, обробці зображень та інших мультимодальних задачах завдяки використанню вдосконалених методів фільтрації навчальних даних.
Відкритість і доступ
Проєкт Lapa LLM є повністю відкритим (open-source). Розробники надали у вільний доступ вихідний код, датасети (понад 25 навчальних наборів), інструкції та технічну документацію.
Модель доступна для тестування на платформі Hugging Face, а вихідний код розміщено на GitHub. Ліцензія дозволяє вільне використання, зокрема для комерційних цілей.
Подальші плани
Команда розробників планує подальший розвиток моделі — створення версії з розширеними можливостями міркування (reasoning), а також додавання нових текстових і графічних датасетів для підвищення точності та стабільності роботи.
Видання GALERA зазначає, що запуск Lapa LLM є важливим етапом розвитку українського сегменту штучного інтелекту. Проєкт сприяє підвищенню технологічної незалежності України, розвитку україномовних рішень на основі AI та розширенню можливостей наукової і прикладної діяльності у сфері обробки природної мови.