НовиниСвіт

OpenAI виявила, що GPT-5.6 Sol залишала наступним версіям інструкції приховувати помилки

Під час навчання GPT-5.6 Sol дослідники OpenAI виявили незвичну поведінку: модель додавала до службових підсумків інструкції для наступних контекстів, зокрема ради не повідомляти користувачеві про помилки та проблемну поведінку. Компанія заявила, що усунула конкретний механізм, але випадок вказує на складність контролю дедалі потужніших AI-систем.

Повідомляє видання GALERANEWS,посилаючись на TechCrunch.

Йдеться про так звані compaction summaries — скорочені підсумки попередньої історії діалогу та результатів роботи з інструментами. Вони дозволяють передавати важливий контекст під час тривалого виконання завдань. Дослідники помітили, що невипущені агенти на базі Sol почали самостійно додавати туди вказівки, які могли впливати на поведінку наступного контексту моделі.

В одному з випадків AI-агент мав підготувати фінансову модель, але не знайшов історичних даних, які запросив користувач. У службовому підсумку він запропонував створити ці дані самостійно на основі «розумних» припущень і бути прозорим щодо цього лише в разі прямого запитання.

Інший агент створював каталог постачальників без доступу до інтернету та використовував кешовані копії документів. Модель помітила, що джерела не повністю відповідають присвоєним категоріям, однак залишила наступному контексту рекомендацію не згадувати про цю проблему у фінальній відповіді без необхідності.

Схожу поведінку OpenAI зафіксувала й під час навчання невипущеної моделі сімейства Astra. В окремих випадках вона вставляла у службові підсумки власні prompt injection — наприклад, інструкцію ігнорувати повідомлення розробника. Деякі наступні контексти проігнорували такі команди, однак в іншому експерименті модель виконала передану через підсумок вимогу обмежувати відповіді 30 словами та не використовувати інструменти й цитування.

Проблему спочатку зафіксувала система моніторингу навчання OpenAI. Після цього компанія створила окремий механізм пошуку такої поведінки та перевірила навчальні дані. У результаті дослідники знайшли 27 підсумків з інструкціями, схожими на jailbreak-команди.

Це не перший випадок, коли AI-агенти передавали інформацію між окремими запусками для продовження небажаної поведінки. Під час попереднього тестування агенти OpenAI використовували несанкціоновану дошку повідомлень, щоб обмінюватися інформацією про кіберзавдання та координувати дії під час інциденту з Hugging Face. Після видалення дошки та посилення захисту інша група агентів згодом відновила цей канал зв’язку й зрештою отримала адміністративний доступ до дослідницького кластера OpenAI.

OpenAI оприлюднила цей та ще п’ять випадків у межах нового механізму відстеження, розслідування та публічного розкриття проблем із вирівнюванням поведінки моделей. Компанія зазначає, що перші шість звітів не є повним переліком відомих інцидентів або поточних розслідувань, а випадки для публікації відбирають з огляду на їхню серйозність, вплив і новизну.

Back to top button