НовиниСвіт

Чи такий вже розумний ШІ? Найпотужніші моделі провалили тест

Фонд Arc Prize Foundation презентував новий складний тест для перевірки рівня загального інтелекту сучасних AI-моделей. Тест отримав назву ARC-AGI-2 і вже встиг продемонструвати обмеження найпотужніших систем. 

Повідомляє видання TechCrunch

Більшість моделей провалили текст, появившись не настільки розумними, як очікувалося. Навіть продукт OpenAI набрав менше 1,5%. Взагалі  “reasoning models” на кшталт o1-pro та DeepSeek R1 змогли набрати лише від 1% до 1,3%. Інші відомі моделі, включаючи GPT-4.5, Claude 3.7 Sonnet та Gemini 2.0 Flash, отримали результат близько 1%.

З чого складається тест на штучний інтелект?

ARC-AGI-2 складається з візуальних завдань на розпізнавання шаблонів. AI-моделі мають аналізувати комбінації кольорових квадратів та згенерувати правильну відповідь. Завдання побудовані таким чином, щоб моделі стикалися з абсолютно новими для себе ситуаціями та демонстрували здатність до навчання “на льоту”.

Окрім оцінки правильних відповідей, ARC-AGI-2 також вводить поняття ефективності — наскільки швидко і з якими ресурсами AI здатний розв’язати задачу.

Для порівняння, модель OpenAI o3 (low), яка наприкінці 2024 року досягла 75,7% на ARC-AGI-1, змогла набрати лише 4% на новому тесті ARC-AGI-2.

Чи розумніші люди за ШІ?

Фонд залучив понад 400 людей для створення “людської бази” результатів. У середньому групи учасників правильно відповіли на 60% завдань — значно вище, ніж жодна з протестованих моделей.

Франсуа Шоле наголосив, що новий тест є більш показовим для оцінки справжніх інтелектуальних здібностей моделей, ніж попередня версія ARC-AGI-1. Головна відмінність — новий підхід виключає можливість розв’язання завдань за рахунок “грубої сили”, тобто великих обчислювальних потужностей.

Back to top button