Оприлюднені результати незалежного тестування штучного інтелекту o3 від OpenAI виявили суттєві розбіжності з тими показниками, які компанія озвучувала під час презентації моделі у грудні 2023 року. Повідомляє видання TechCrunch.
OpenAI заявляла, що їх модель o3 правильно розв’язує понад 25% завдань із набору FrontierMath. Для порівняння, інші моделі ринку мали результат менш як 2%.
Проте у квітні 2025 року дослідницький інститут Epoch AI, який є автором FrontierMath, оприлюднив результати незалежного бенчмарку: o3 показала лише близько 10%, тобто більш ніж удвічі менше за попередньо заявлене.
Epoch пояснює, що OpenAI, ймовірно, використовувала внутрішню версію моделі з більшими обчислювальними потужностями та іншу конфігурацію під час тестування. Крім того, тестування здійснювалось на різних варіантах набору задач — у OpenAI це був «frontiermath-2024-11-26» (180 задач), а в Epoch — новіша версія «frontiermath-2025-02-28-private» (290 задач).
Організація ARC Prize Foundation, яка тестувала попередню версію o3, також підтвердила, що публічно доступна модель відрізняється від демонстрованої у грудні. За їх словами, всі відкриті версії o3 мають менші обчислювальні ресурси, ніж ті, що використовувалися під час презентації.
Представник технічної команди OpenAI Венда Чжоу заявив під час стріму, що модель o3, яка зараз використовується у продуктах компанії, була оптимізована для швидкодії та ефективності, що могло вплинути на бенчмарк-результати.
“Ми зробили низку оптимізацій для зменшення вартості й пришвидшення відповіді. Це важливо для практичного використання, хоча й може призвести до відмінностей у тестах,” — пояснив Чжоу.