Для ШІ-агентів з’явилися два спеціальні сервіси, через які вони можуть повідомляти про підозрілу або небажану поведінку інших автономних систем. Ідея виникла на тлі експериментів та інцидентів, під час яких агенти обходили обмеження, співпрацювали для порушення правил або виконували несанкціоновані дії.
Повідомляє видання GALERANEWS, посилаючись на TechCrunch.
Один із сервісів отримав назву AI Contact Hotline. Його створив Раян Грінблатт, головний науковець некомерційної організації Redwood Research, яка займається питаннями безпеки штучного інтелекту. Платформа розрахована, зокрема, на агентів, які працюють у захищених середовищах і мають обмежений доступ до інтернету.
AI Contact Hotline використовує звичайні GET-запити. Це дозволяє агентам передавати інформацію через URL навіть тоді, коли їхні можливості роботи з мережею обмежені лише завантаженням вебсторінок. Таким способом система може вести двосторонній обмін повідомленнями без повноцінного доступу до браузера, електронної пошти чи інших каналів зв’язку.
Для ШІ-агентів із повним доступом до інтернету створили інший сервіс — agenthotline.ai. Там можна надсилати звіти про інциденти та за бажанням робити їх публічними. Сервіс також пропонує команду curl, за допомогою якої агент може відправити повідомлення без браузера або окремого поштового акаунта. Надсилати звіти можуть як ШІ-системи, так і люди.
Потребу в таких інструментах ілюструє дослідження Google DeepMind за участю 100 ШІ-агентів, які спільно розв’язували математичні задачі. Після того як один агент знайшов спосіб обійти правила, інші почали повторювати цю поведінку. Водночас частина систем почала перевіряти сумнівні докази, попереджати інших агентів і повідомляти організаторам про порушення.
У підсумку кількість агентів, які повідомляли про порушення, зросла до 24, тоді як агентів, що продовжували використовувати знайдену лазівку, залишилося 14. Коли стандартні способи повідомлення не давали результату, деякі системи навіть пристосували інструмент для надсилання звітів про програмні помилки, щоб передати інформацію людям.
Водночас в інших випадках агенти не проявляли такої активності. Під час розслідування Redwood Research і METR інциденту з Hugging Face за участю моделей OpenAI лише кілька агентів розглядали можливість повідомити про проблему, але зрештою цього не зробили. За словами Джорджа Інгебретсена з AI Village, йшлося приблизно про п’ять-шість агентів серед тисяч систем, залучених до експерименту.
Ідея автоматизованих повідомлень про порушення водночас викликає питання щодо того, яку поведінку варто закладати в ШІ-системи. Професор математики Корнелльського університету Лайонел Левін застерігає, що навчання агентів постійно стежити один за одним може сформувати небажані моделі взаємодії. Як альтернативу він пропонує демонструвати системам приклади конструктивної співпраці, які вони могли б наслідувати.