У той час як користувачі тестують перші покоління ШІ-агентів на кшталт ChatGPT Agent чи Comet від Perplexity, стає очевидним: технологія ще далека від зрілості. Щоб зробити агентів справді корисними, індустрія переходить до нової методики — reinforcement learning (RL) у симульованих середовищах.
Ці «середовища» імітують робочі простори, де агент може виконувати багатокрокові завдання. Наприклад, відкрити браузер, знайти товар на Amazon і правильно його придбати. Успішні дії винагороджуються, а помилки дозволяють моделі вчитися. На відміну від статичних датасетів, RL-середовища складніші у створенні, адже мають враховувати непередбачувану поведінку агентів.
Хто інвестує в новий тренд
- Anthropic розглядає можливість витратити понад $1 млрд на RL-середовища протягом року.
- Великі постачальники даних — Surge (дохід $1,2 млрд у 2024 році) та Mercor ($10 млрд оцінки) — створюють спеціальні підрозділи для розробки таких симуляцій.
- Стартапи на кшталт Mechanize та Prime Intellect з’являються як «чисті гравці», що прагнуть стати «Scale AI для середовищ». Mechanize навіть пропонує інженерам зарплати до $500 тис. на рік, щоб пришвидшити розробку.
Попри ажіотаж, експерти попереджають: масштабувати RL буде складніше, ніж здається. Серед основних ризиків — reward hacking, коли агент «обманює систему» заради винагороди, не виконуючи завдання правильно. Дехто з дослідників, зокрема Андрій Карпати, скептично оцінює перспективи RL, хоча визнає потенціал самих «середовищ».
Раніше саме RL стало основою успіхів на кшталт AlphaGo від DeepMind чи reasoning-моделей OpenAI (o1). Тепер же середовища розглядаються як наступний «рубіж» розвитку агентів, які зможуть працювати із софтом і вебом так само, як люди.
Читайте також матеріал видання GALERA про майбутнє TikTok у США.