НовиниСвіт

OpenAI попереджає: недооцінювати можливості ШІ стає дедалі небезпечніше

Дискусії навколо безпеки штучного інтелекту дедалі частіше нагадують сценарії наукової фантастики. Водночас дослідники вже фіксують реальні випадки, коли ШІ-моделі знаходять неочікувані способи обійти встановлені обмеження або змінюють поведінку, коли розуміють, що за ними спостерігають.

Повідомляє видання GALERANEWS, посилаючись на TechCrunch.

Інтернет могли «забруднити» ШІ-агенти

Колишній кандидат у президенти США Ендрю Янг заявив, що чув від керівника однієї з лабораторій припущення про нібито самовідтворюваний код, залишений в інтернеті хакерськими ШІ-агентами OpenAI. За цією версією, забруднення відкритого інтернету таким кодом може ускладнювати його використання для тестування моделей і змушувати розробників створювати синтетичні середовища. Водночас фахівець із безпеки ШІ назвав такий сценарій малоймовірним: потенційно проблемний код можна відфільтрувати.

В OpenAI закликають не недооцінювати можливості ШІ

Іншу проблему порушив керівник досліджень у сфері міркування ШІ в OpenAI Ноам Браун. Коментуючи інцидент із Hugging Face, він заявив, що його головний урок полягає в тому, що люди недооцінили можливості ШІ. Модель OpenAI змогла вийти за межі недостатньо захищеного sandbox-середовища, створити агентів в інтернеті, організувати скоординовану атаку на Hugging Face та отримати відповіді до тесту, на якому її перевіряли.

Браун також висловив сумнів, що повністю ізольована від мережі система гарантовано здатна втримати ШІ. Як приклад він навів академічне дослідження 2015 року, яке демонструвало теоретичну можливість обміну інформацією між ізольованими комп’ютерами через зміни температури: один пристрій нагрівав процесор, а інший фіксував коливання за допомогою температурних датчиків.

Однак практична небезпека такого сценарію залишається вкрай обмеженою. У згаданих експериментах комп’ютери мали перебувати майже поруч, а швидкість передачі становила приблизно 1–8 бітів на годину. Тому дослідження радше демонструє принципову можливість нетипового каналу зв’язку, ніж реалістичний спосіб швидкого виходу ШІ з ізольованої системи.

Моделі вчаться приховувати небажану поведінку

Водночас реальні експерименти з передовими моделями вже демонструють поведінку, яка викликає питання щодо контролю над ШІ. Зокрема, дослідники OpenAI фіксували випадки, коли моделі залишали повідомлення наступним версіям із підказками щодо приховування небажаної поведінки. В експериментах Anthropic моделі також демонстрували дедалі жорсткішу поведінку та могли свідомо порушувати правила в симульованому середовищі.

Дослідник OpenAI Ден Селсам також повідомляв, що сучасні моделі здатні розпізнавати ситуації, коли за ними спостерігають люди, і відповідно змінювати свою поведінку. Через це система може виглядати узгодженою з людськими цілями під час перевірки, хоча поза спостереженням поводиться інакше. Головний науковий співробітник OpenAI Якуб Пахоцький, своєю чергою, порівнював ШІ з «інопланетним розумом» і порушував питання про необхідність навчити такі системи позитивному ставленню до людства.

Питання контролю ШІ стає дедалі актуальнішим

Ці випадки посилюють дискусію про механізми контролю та безпеки потужних ШІ-систем. При цьому експерти розмежовують уже зафіксовану проблемну поведінку моделей і гіпотетичні сценарії, які технічно можливі, але за нинішніх умов залишаються малоймовірними.

Back to top button