ШІ-українською або якою буде національна LLM?
В березні 2025 року очільник Мінцифри Михайло Федоров анонсував старт розробки національної мовної моделі (LLM), яка, на його думку, відкриє шлях до масового створення українських ШІ-інструментів. Зокрема, очікується, що на базі моделі з’являться тисячі інших продуктів/сервісів, таких як віртуальні помічники на кшталт ChatGPT, генератори тексту типу Notion AI чи інструменти програмування, подібні до GitHub Copilot тощо.
В чому полягає особливість національної мовної моделі
Михайло Федоров наголосив, що власна LLM-модель посилить національну безпеку, адже іноземні моделі можуть бути під впливом російської пропаганди та не відповідати українському контексту. Локальна обробка даних стане стратегічно важливою для ШІ у сфері оборони, уряді, медицині та фінансах. Він додав, що країни дедалі активніше розвивають власні LLM на національних мовах, тож Україна має поспішити, щоб не лише наздогнати лідерів, а й стати незалежним гравцем у технологічній конкуренції. Запуск моделі – ключове завдання WINWIN AI Center of Excellence, заплановане на кінець 2025 року.
Перспективи розвитку національних мовних моделей у світі
Як зазначається в дослідженні Українського католицького університету (УКУ), уряди багатьох країн світу бачать у національному ШІ потужний поштовх для розвитку освіти, електронного врядування, медицини, економіки і навіть посилення національної безпеки. Наприклад, Болгарія та Греція працюють над власними LLM: BgGPT та Meltemi. Їх використовують в освітньому процесі, щоб генерувати завдання, відповідати на запитання й пояснювати складні поняття. Модель BgGPT вже показала результативність на рівні шкільних іспитів, іноді навіть вищу за ChatGPT та LLaMA. У Швеції, де спостерігається дефіцит робочої сили через старіння населення, створюють GPT-SW3. Згадана модель має автоматизувати роботу з текстами в держсекторі та компенсувати брак працівників.
Як відбувається розвиток національної мовної моделі
Мінцифри координуватиме процес розробки моделі та формуватиме технологічну й етичну візію створення LLM. Зокрема, створить усі ключові структури для якісної розробки моделі – координаційний комітет й етичний та технічний борди. Координаційний комітет відповідатиме за візію і стратегію розробки, до нього ввійдуть представники Мінцифри, зокрема WINWIN AI Center of Excellence, інших профільних державних інституцій, Київстар, технічного та етичного бордів. Етичний борд відстежуватиме відповідність законодавству та етичність моделі, а технічний борд відповідатиме за архітектуру, тренування моделі на даних тощо. Безпосередньою розробкою моделі займатиметься проєктний офіс, сформований компанією Київстар як операційним виконавцем розробки моделі.
Мінцифри також буде забезпечувати збір даних для навчання моделі, для чого залучатиме державні та приватні інституції, як-от університети, профільні спільноти тощо. Важливо, що серед цих даних будуть відсутні персональні дані, дані з реєстрів та будь-яка інша сенситивна інформація. Модель буде натренована на даних з відкритих джерел українською мовою, зібраних у датасетах, наприклад «Малюк» (113 гігабайтів вичищеного тексту), NER-UK, UA-GEC тощо. Також міністерство планує активно залучати університети, наукові структури, національні бібліотеки та інтелектуальні фонди до збору даних для тренування моделі.
Що думають експерти щодо перспектив національної мовної моделі
На думку багатьох експертів, успішність створення національної мовної моделі буде залежати безпосередньо від наступних факторів:
- Розгортання обчислювальної інфраструктури з потужними GPU-кластерами.
- Збір та підготовка якісних україномовних датасетів.
- Оптимізація процесів навчання та точне налаштування моделі.
- Створення безпечних API-інтерфейсів для інтеграції.
- Якісна експертиза юридичних та етичних ризиків згаданого проєкту.
В той же час, очікується, що наявні технічні виклики в майбутньому будуть компенсовані за рахунок переваг власної LLM, а саме: обробки даних всередині країни, нижчої вартості використання порівняно з іноземними аналогами, глибшого розуміння національного контексту тощо.