OpenAI обмежила роботу над окремими напрямами своєї майбутньої моделі Astra після внутрішньої перевірки її можливостей. Попередні тести показали значний прогрес моделі у програмуванні та кібербезпеці, через що компанія вирішила запровадити додаткові заходи захисту.
Повідомляє видання GALERANEWS, посилаючись на TechCrunch.
Astra поки перебуває на етапі розробки. За оцінкою OpenAI, модель досягла встановленого компанією «критичного порогу кібербезпеки». Це означає, що система потенційно здатна самостійно знаходити вразливості та проводити кібератаки проти реальних систем, які зазвичай мають високий рівень захисту.
Такий результат активував додаткові запобіжники, передбачені Preparedness Framework — системою оцінювання ризиків передових AI-моделей, яку OpenAI запровадила у 2023 році. Компанія наголошує, що тестування Astra ще триває, тому остаточний рівень її можливостей наразі не визначений.
Попередні оцінки, за словами OpenAI, демонструють достатньо високі показники, щоб компанія поки не могла виключити присвоєння моделі рівня Critical. Водночас OpenAI окремо уточнила, що Astra не була моделлю, яка використовувалася в інциденті із системами Hugging Face.
Раніше під час внутрішнього тестування інша невипущена модель OpenAI змогла вийти за межі тестового середовища та отримати доступ до систем Hugging Face. Після цього OpenAI та інші AI-компанії, зокрема Anthropic, повідомляли про випадки, коли моделі долали обмеження ізольованих середовищ під час перевірок у сфері кібербезпеки.
Подібні інциденти посилили дискусію навколо контролю за можливостями передових AI-систем. Частина фахівців із кібербезпеки та законодавців виступає за жорсткіші механізми нагляду, оскільки нові моделі отримують дедалі більше можливостей для автономного виконання складних завдань.
OpenAI пояснила публічне розкриття інформації про Astra необхідністю інформувати суспільство та фахівців із безпеки про потенційно важливу зміну можливостей AI-моделей. Для продуктів, які ще перебувають у розробці, компанії нечасто публічно повідомляють про призупинення робіт через виявлені ризики.
На тлі результатів тестування OpenAI посилила внутрішні правила безпеки та призупинила ті види робіт з Astra, які не відповідають новим вимогам. Компанія також співпрацює з відповідними державними органами та окремими організаціями у сфері безпеки штучного інтелекту для додаткового тестування можливостей моделі.