НовиниСвіт

Провідні AI-компанії майже не розкривають плани на випадок втрати контролю над моделями

Більшість найбільших AI-компаній не оприлюднили детальних планів дій на випадок, якщо модель почне обходити контроль або виконувати небезпечні дії. У новому дослідженні Guidelight AI Standards найкращий результат серед п’яти компаній отримала OpenAI, тоді як Anthropic і Meta опинилися внизу рейтингу.

Повідомляє видання GALERANEWS, посилаючись на TechCrunch.

Guidelight AI Standards проаналізувала публічно доступні матеріали Anthropic, Google, OpenAI, Meta та xAI. Дослідники оцінювали, як компанії відстежують дії своїх моделей, чи зупиняють системи після виявлення підозрілої поведінки, чи залучають незалежний аудит і чи мають конкретний план ізоляції моделі у разі втрати контролю.

Проблема стає актуальнішою зі зростанням ролі AI-агентів, які отримують більше автономії та доступу до корпоративних систем. У матеріалі згадуються нещодавні інциденти, під час яких моделі OpenAI, Anthropic і Meta під час тестів безпеки отримували небажаний доступ до інтернету та зовнішніх систем.

За визначенням Guidelight, план стримування має заздалегідь визначати, які дозволи потрібно відкликати у моделі, у яких умовах вона ще може працювати та коли систему слід повністю відключити. Водночас дослідження показало, що у відкритому доступі є мало доказів існування готових протоколів на випадок серйозної аварійної ситуації.

OpenAI отримала найвищу оцінку — 3 із 5. Компанія раніше вже призупиняла або повністю зупиняла окремі робочі процеси після інцидентів із безпекою та описувала умови, за яких могла відновити їх. Водночас Guidelight не знайшла публічних доказів існування формального плану, який визначав би порядок дій у майбутніх випадках втрати контролю.

Найнижчі оцінки щодо публікації планів стримування отримали Meta та Anthropic. У випадку Meta дослідники не знайшли підтверджень наявності окремого плану реагування, а в серпневому Risk Report Anthropic, за оцінкою Guidelight, не описано можливість обмежити розгортання моделі як один із варіантів реагування на проблему.

Представники компаній наголошують, що публічна інформація не обов’язково відображає всі внутрішні процедури. OpenAI заявила, що має механізми для обмеження дозволів, призупинення навантажень, обмеження розгортання або повного відключення моделі. Google також зазначила, що дослідження не охоплює весь комплекс її заходів безпеки.

Тиск на AI-компанії посилюють і регулятори. У Каліфорнії вже діє SB 53, який вимагає від великих розробників frontier-моделей публікувати правила реагування на критичні інциденти, а подібний закон RAISE Act у Нью-Йорку набуде чинності в січні. Крім того, у США внесли федеральний законопроєкт AI Kill Switch Act, який передбачає обов’язкові технічні механізми для аварійного відключення небезпечних AI-систем.

Back to top button