Понад третина вебсторінок, опублікованих після запуску ChatGPT наприкінці 2022 року, демонструють суттєві ознаки створення або редагування за допомогою штучного інтелекту. Таких висновків дійшов Pew Research після аналізу сотень тисяч англомовних сторінок.
Повідомляє видання GALERANEWS, посилаючись на TechCrunch.
Для дослідження Pew Research використав вебархів Common Crawl. Дослідники зібрали майже 500 000 англомовних вебсторінок приблизно за п’ять років — вибірка охопила як період до появи ChatGPT, так і роки після його запуску в листопаді 2022 року.
Для визначення ймовірного використання генеративного ШІ застосували технологію Open Pangram. Вона мала виявити сторінки, текст яких був створений або суттєво відредагований за допомогою ШІ.
У випадковій вибірці з 10 000 сторінок, зібраних у липні 2026 року, приблизно 10% мали значні ознаки використання ШІ. Однак до цієї вибірки потрапили й старі матеріали, опубліковані ще до масового поширення сучасних генеративних моделей.
Після того як дослідники виключили сторінки, створені до запуску ChatGPT, показник суттєво зріс. Ознаки авторства або значного редагування за допомогою ШІ виявили вже у 35% вебсторінок.
Результати також помітно відрізнялися залежно від доменної зони. На сайтах у зоні .com ознаки використання ШІ зустрічалися приблизно вдесятеро частіше, ніж на сторінках із доменами .edu та .gov. Для останніх показник становив близько 1%, тоді як серед сайтів .org — 4,6%.
Водночас результати не можна вважати абсолютно точним підрахунком створених ШІ матеріалів. Інструменти для визначення AI-generated текстів, зокрема Pangram, можуть помилково класифікувати написаний людиною контент. Тому дослідження радше демонструє загальну тенденцію поширення ШІ-контенту в інтернеті.
Pew Research також зафіксував зростання частоти мовних конструкцій, які часто пов’язують із текстами генеративних моделей. Серед них — активніше використання довгого тире, Oxford comma та конструкцій на кшталт «це не X, це Y».