Український програміст з Одеси, відомий під псевдонімом Слава С. (обліковий запис на платформі GitHub — slvDev), успішно здійснив запуск повноцінної великої мовної моделі (LLM) на мікроконтролері ESP32-S3. Вартість зазначеної плати становить менше 10 доларів США. Проєкт отримав назву ESP32-AI – розповідає highload.tech.
Технічні характеристики моделі та апаратної платформи
Модель містить 28,9 мільйона параметрів. Для забезпечення її функціонування в умовах вкрай обмежених ресурсів апаратної платформи (512 КБ оперативної пам’яті SRAM, 8 МБ додаткової PSRAM та 16 МБ флеш-пам’яті) було застосовано агресивну 4-бітну квантизацію. Після оптимізації обсяг моделі становить 14,9 МБ, що дозволяє повністю розмістити її у вбудованій флеш-пам’яті мікроконтролера.
Ключовим технічним рішенням стала адаптація підходу Per-Layer Embeddings (PLE), розробленого компанією Google. За словами автора проєкту, це перша відома демонстрація застосування зазначеної техніки на апаратному забезпеченні з такими обмеженнями. Попередні експерименти з мовними моделями на мікроконтролерах обмежувалися моделями обсягом приблизно 260 тисяч параметрів. Таким чином, реалізований проєкт перевищує попередні результати більш ніж у сто разів.
Показники продуктивності
За результатами тестування модель забезпечує генерацію тексту зі швидкістю близько 9,88 токена за секунду, що перевищує середню швидкість читання людини. Усі обчислення виконуються виключно локально на платі без будь-якого підключення до хмарних сервісів.
Основна модель, навчена на наборі даних TinyStories від Microsoft, здатна генерувати короткі зв’язні історії. Додатково розроблено модель під назвою Barista, яка спеціалізується на відповідях на запитання у вузькій тематиці еспресо-кави та працює приблизно вдвічі швидше.
Відкритий доступ та поширення проєкту
Репозиторій проєкту на платформі GitHub на момент публікації налічує понад 3,5 тисячі зірок та 440 форків. Автор розмістив у відкритому доступі повний код прошивки, скрипти навчання моделі, конвеєр квантизації, схему підключення та результати експериментів.
Обмеження практичного застосування
Незважаючи на високий технічний рівень реалізації, практичне застосування моделі має суттєві обмеження. Вона не призначена для створення повноцінних чат-ботів, написання програмного коду чи побудови автономних штучних інтелектуальних агентів. Функціонал обмежується генерацією простих історій або відповідями на запитання у вузькоспеціалізованій тематиці.
Видання GALERANEWS зазначає, що реалізація повноцінної мовної моделі на мікроконтролері вартістю менше 10 доларів США демонструє значний прогрес у сфері стиснення моделей штучного інтелекту та відкриває перспективи подальшого використання флеш-пам’яті як багаторівневого сховища в системах штучного інтелекту.