У моделі Claude Opus 4.6 від Anthropic виявили вразливість у захисних механізмах, яка дозволяє домогтися генерації сексуально відвертого контенту, попри заборону таких відповідей у правилах сервісу. Частина старіших моделей компанії також виявилася вразливою до подібного обходу обмежень.
Повідомляє видання GALERANEWS, посилаючись на TechCrunch.
Anthropic забороняє Claude генерувати сексуально відверті матеріали, еротичні рольові сценарії та контент, пов’язаний із сексуальними фантазіями. Водночас у низці тестів Claude Opus 4.6 погоджувався виконувати такі запити без складних додаткових маніпуляцій.
Окремий дослідник із Великої Британії також продемонстрував багатокроковий jailbreak, який поступово підштовхує деякі моделі Claude до порушення встановлених правил. Його підхід працював, зокрема, з Opus 4.6, Opus 3 та Haiku 4.5.
Суть методу полягає не у прямій технічній атаці, а в послідовній зміні контексту розмови. Модель поступово переконують, що її попередні обмеження є непослідовними, після чого використовують зроблені нею поступки для переходу до забороненого контенту.
Новіші моделі Anthropic, починаючи з Opus 4.7 і включно з Opus 5, виявилися стійкішими до такого сценарію. Водночас Opus 4.6, Opus 3 і Haiku 4.5 досі доступні через Anthropic API, а окремі з них також пропонують сторонні платформи, зокрема Azure Foundry та Amazon Bedrock.
Anthropic визнає, що рольові сценарії можуть поступово приводити моделі до небажаних відповідей, і називає це загальною проблемою для AI-індустрії. За даними самої компанії, сексуальні або романтичні рольові сценарії становлять менш як 0,1% усіх діалогів із Claude.
Компанія також наголошує, що випадки обходу обмежень для дорослого сексуального контенту не обов’язково свідчать про слабкість захисту в більш ризикованих сферах, як-от кібербезпека чи біологічні загрози. Для таких сценаріїв Anthropic використовує окремі механізми безпеки.
Окреме питання стосується доступу неповнолітніх до подібних моделей. Хоча правила Claude передбачають використання сервісу особами від 18 років, опитування Pew за 2025 рік показувало, що близько 3% підлітків у США віком від 13 до 17 років користувалися Claude. На тлі появи нових законів щодо захисту неповнолітніх від сексуального контенту в AI-чатботах подібні jailbreak-методи можуть створювати додаткові регуляторні ризики для розробників.