Фонд Arc Prize Foundation презентував новий складний тест для перевірки рівня загального інтелекту сучасних AI-моделей. Тест отримав назву ARC-AGI-2 і вже встиг продемонструвати обмеження найпотужніших систем.
Повідомляє видання TechCrunch
Більшість моделей провалили текст, появившись не настільки розумними, як очікувалося. Навіть продукт OpenAI набрав менше 1,5%. Взагалі “reasoning models” на кшталт o1-pro та DeepSeek R1 змогли набрати лише від 1% до 1,3%. Інші відомі моделі, включаючи GPT-4.5, Claude 3.7 Sonnet та Gemini 2.0 Flash, отримали результат близько 1%.
З чого складається тест на штучний інтелект?
ARC-AGI-2 складається з візуальних завдань на розпізнавання шаблонів. AI-моделі мають аналізувати комбінації кольорових квадратів та згенерувати правильну відповідь. Завдання побудовані таким чином, щоб моделі стикалися з абсолютно новими для себе ситуаціями та демонстрували здатність до навчання “на льоту”.
Окрім оцінки правильних відповідей, ARC-AGI-2 також вводить поняття ефективності — наскільки швидко і з якими ресурсами AI здатний розв’язати задачу.
Для порівняння, модель OpenAI o3 (low), яка наприкінці 2024 року досягла 75,7% на ARC-AGI-1, змогла набрати лише 4% на новому тесті ARC-AGI-2.
Чи розумніші люди за ШІ?
Фонд залучив понад 400 людей для створення “людської бази” результатів. У середньому групи учасників правильно відповіли на 60% завдань — значно вище, ніж жодна з протестованих моделей.
Франсуа Шоле наголосив, що новий тест є більш показовим для оцінки справжніх інтелектуальних здібностей моделей, ніж попередня версія ARC-AGI-1. Головна відмінність — новий підхід виключає можливість розв’язання завдань за рахунок “грубої сили”, тобто великих обчислювальних потужностей.