НовиниСвіт

Кремнієва долина робить ставку на симульовані середовища для навчання AI-агентів

У той час як користувачі тестують перші покоління ШІ-агентів на кшталт ChatGPT Agent чи Comet від Perplexity, стає очевидним: технологія ще далека від зрілості. Щоб зробити агентів справді корисними, індустрія переходить до нової методики — reinforcement learning (RL) у симульованих середовищах.

Ці «середовища» імітують робочі простори, де агент може виконувати багатокрокові завдання. Наприклад, відкрити браузер, знайти товар на Amazon і правильно його придбати. Успішні дії винагороджуються, а помилки дозволяють моделі вчитися. На відміну від статичних датасетів, RL-середовища складніші у створенні, адже мають враховувати непередбачувану поведінку агентів.

Хто інвестує в новий тренд

  • Anthropic розглядає можливість витратити понад $1 млрд на RL-середовища протягом року.
  • Великі постачальники даних — Surge (дохід $1,2 млрд у 2024 році) та Mercor ($10 млрд оцінки) — створюють спеціальні підрозділи для розробки таких симуляцій.
  • Стартапи на кшталт Mechanize та Prime Intellect з’являються як «чисті гравці», що прагнуть стати «Scale AI для середовищ». Mechanize навіть пропонує інженерам зарплати до $500 тис. на рік, щоб пришвидшити розробку.

Попри ажіотаж, експерти попереджають: масштабувати RL буде складніше, ніж здається. Серед основних ризиків — reward hacking, коли агент «обманює систему» заради винагороди, не виконуючи завдання правильно. Дехто з дослідників, зокрема Андрій Карпати, скептично оцінює перспективи RL, хоча визнає потенціал самих «середовищ».

Раніше саме RL стало основою успіхів на кшталт AlphaGo від DeepMind чи reasoning-моделей OpenAI (o1). Тепер же середовища розглядаються як наступний «рубіж» розвитку агентів, які зможуть працювати із софтом і вебом так само, як люди.

Читайте також матеріал видання GALERA про майбутнє TikTok у США.

Back to top button