НовиниУкраїна

Національна LLM «Сяйво»: строки запуску, розробка та інтеграція в «Дію»

У межах реалізації стратегії цифрової трансформації України триває активна фаза розробки першої національної великої мовної моделі (LLM) — «Сяйво». Проєкт впроваджується на засадах публічно-приватного партнерства між WINWIN AI Center of Excellence при Міністерстві цифрової трансформації України та компанією «Київстар» – розповідає dou.

Залучення приватного інвестора дозволило повністю звільнити Державний бюджет України від видатків на створення та первинне тренування моделі. Компанія «Київстар» взяла на себе організаційні витрати, забезпечення обчислювальної інфраструктури та фінансування розробки.

Технічна база та підготовка датасетів

Національна мовна модель будується на основі архітектури Gemma 3 від Google з її подальшим глибоким донавчанням і адаптацією під українську мову та локальний контекст.

Ключовим етапом розробки є формування репрезентативного національного корпусу даних. Наразі акумулюються та обробляються матеріали з понад 90 джерел, серед яких:

  • державні установи та архіви (зокрема, Укрдержархів надав понад 10 ТБ історичних і державних документів);
  • заклади вищої освіти та науково-дослідні інститути;
  • провідні національні медіа.

Значна частина паперових архівів проходитиме процес оцифрування. Паралельно розробляється нормативно-правова база (юридичний фреймворк) щодо захисту інтелектуальної власності та визначення правил використання державних даних для тренування ШІ.

Система тестування та контролю якості

Для верифікації роботи моделі залучено експертну групу з понад 70 фахівців, яка здійснює оцінку за чотирма основними напрямами:

  • Мовознавчий: перевірка граматичної точності та стилістичної відповідності.
  • Культурно-історичний: коректність інтерпретації національного контексту.
  • Етико-правовий: відповідність регламентам безпеки, відсутність дискримінаційних чи упереджених суджень.
  • Науково-технічний: стійкість до дезінформації та мінімізація явищ «галюцинування» ШІ.

Перевірка здійснюватиметься як за допомогою автоматизованих бенчмарків, так і шляхом ручного експертного оцінювання з порівнянням результатів у міжнародних рейтингах.

Етапи впровадження та подальше використання

  • Розробка моделі стартувала у червні 2025 року. Поточний графік реалізації передбачає такі ключові етапи:
  • Завершення розробки тестової версії: грудень 2026 року.
  • Відкриття публічного доступу: січень 2027 року.

Після завершення випробувань компанія «Київстар» передасть модель у власність держави. Базову версію «Сяйва» разом із зібраними датасетами планується викласти у відкритий доступ (open-source) для подальшої адаптації розробниками, бізнесом та науковими спільнотами.

Видання GALERANEWS зазначає, що на державному рівні модель стане технологічною основою для інтеграції штучного інтелекту в цифрові екосистеми, зокрема для функціонування сервісу «Дія AI» та інтерактивного освітнього інструменту AI-тьютор у додатку «Мрія».

Back to top button