НовиниУкраїна

Відкрита українська мовна модель Lapa LLM отримала публічний реліз

Команда українських дослідників оголосила про публічний реліз Lapa LLM v0.1.2 — першої великої відкритої мовної моделі, спеціально оптимізованої для української мови – повідомляє dev.ua.

Характеристика моделі

Lapa LLM побудована на базі архітектури Gemma-3-12B і адаптована до мовних особливостей української. Однією з ключових технічних переваг моделі є спеціалізований токенізатор, який використовує близько 80 000 токенів, порівняно з понад 250 000 у вихідній моделі. Такий підхід забезпечує підвищення ефективності — обробка українських текстів відбувається приблизно у 1,5 раза швидше, ніж у базовій версії.

Результати та продуктивність

За результатами незалежних тестувань, Lapa LLM демонструє високі показники у виконанні широкого спектра завдань: розуміння інструкцій, переклад, резюмування текстів та запитання-відповідь (Q&A). У перекладі з англійської на українську модель досягла BLEU-показника близько 33 на еталонному наборі FLORES, що робить її найкращим відкритим перекладачем між цими мовами.

Також модель продемонструвала помітні результати у виявленні дезінформації, обробці зображень та інших мультимодальних задачах завдяки використанню вдосконалених методів фільтрації навчальних даних.

Відкритість і доступ

Проєкт Lapa LLM є повністю відкритим (open-source). Розробники надали у вільний доступ вихідний код, датасети (понад 25 навчальних наборів), інструкції та технічну документацію.
Модель доступна для тестування на платформі Hugging Face, а вихідний код розміщено на GitHub. Ліцензія дозволяє вільне використання, зокрема для комерційних цілей.

Подальші плани

Команда розробників планує подальший розвиток моделі — створення версії з розширеними можливостями міркування (reasoning), а також додавання нових текстових і графічних датасетів для підвищення точності та стабільності роботи.

Видання GALERA зазначає, що запуск Lapa LLM є важливим етапом розвитку українського сегменту штучного інтелекту. Проєкт сприяє підвищенню технологічної незалежності України, розвитку україномовних рішень на основі AI та розширенню можливостей наукової і прикладної діяльності у сфері обробки природної мови.

Back to top button