НовиниСвіт

Anthropic показала систему, яка автоматично покращує поведінку ШІ-моделей

Anthropic опублікувала дослідження про автоматизовану систему, здатну самостійно шукати способи покращення поведінки ШІ-моделей. Під час експериментів вона підвищила результати моделі за всіма десятьма тестами на узгодженість поведінки без погіршення її загальної продуктивності.

Повідомляє видання GALERANEWS, посилаючись на TechCrunch.

Дослідження Anthropic отримало назву Automated Researchers Can Reliably Mitigate Alignment Failures. Його автори перевіряли, чи можна автоматизувати частину роботи, пов’язаної з alignment — налаштуванням поведінки ШІ відповідно до визначених цілей і обмежень. Системі дали десять бенчмарків, що оцінювали конкретні небажані моделі поведінки. В усіх випадках їй вдалося покращити показники без втрати загальної продуктивності моделі.

Розроблена система фактично відтворює частину традиційного дослідницького процесу. Автоматизований дослідник аналізує доступну наукову літературу, пропонує метод, а потім протягом 30 хвилин навчає модель із його використанням. Процес повторюється кілька разів: ефективні підходи зберігаються, а ті, що не дають результату, відкидаються.

В Anthropic вважають отримані результати раннім свідченням того, що автоматизоване додаткове навчання моделей для покращення alignment може стати практичним уже в найближчому майбутньому. Такий підхід потенційно дозволяє проводити значно більше експериментів без пропорційного збільшення кількості людей, залучених до досліджень.

Систему називають Automated Alignment Researcher (AAR). За результатами експерименту найкращий метод, знайдений AAR, у середньому перевершував рішення, які пропонували досвідчені фахівці, протягом шести годин роботи. Дослідники також зазначили, що напрямки роботи, визначені за участю людей, не забезпечили кращих результатів.

Відрізняється й вартість такої роботи. За розрахунками в дослідженні, година роботи AAR коштує приблизно $4 у вигляді витрат на API inference. Для порівняння, витрати Anthropic на годину роботи залучених до експерименту людей-дослідників становили близько $150.

Водночас технологія має суттєві обмеження. Її ефективність безпосередньо залежить від того, наскільки використовувані бенчмарки справді відображають необхідні цілі alignment. Створення та підтримка таких тестів усе ще потребують значної роботи, як і формування та оновлення масиву наукової літератури, на який спирається автоматизована система.

Результати також розглядаються як один із кроків у напрямку recursive self-improvement — концепції, за якої ШІ-системи беруть дедалі більшу участь у вдосконаленні власного навчання. Проте нинішнє дослідження демонструє лише автоматизацію конкретного процесу alignment і саме по собі не означає створення ШІ, здатного повністю самостійно вдосконалювати себе.

Back to top button