Этика

Анализ Pew показывает, что более одной трети новых английских веб-страниц содержат тексты, написанные ИИ

Анализ 500 000 веб-страниц, опубликованных с момента запуска ChatGPT, проведённый Центром исследований Pew, выявил машинно-сгенерированный текст более чем на одной трети нового англоязычного веб-контента, при этом коммерческие сайты лидируют по уровню внедрения. Эти выводы вызывают вопросы о подлинности контента, точности его обнаружения и необходимости более ясных стандартов раскрытия информации.

Майкл С ·

Анализ Pew показывает, что более одной трети новых английских веб-страниц содержат тексты, написанные ИИ
Редакционное изображение Mantis.

Согласно анализу, проведённому Центром исследований Пью, более одной трети английских веб-страниц, опубликованных со времени запуска ChatGPT, содержат текст, написанный машиной. Этот вывод, основанный на исследовании примерно 500 000 веб-страниц, сигнализирует о значительных изменениях в способах производства и распространения онлайн-контента в крупных масштабах. В отчёте не утверждается, что эти страницы были созданы полностью без участия человека. Исследователи признали неопределённость, присущую обнаружению машинного текста с помощью автоматических инструментов, и цифра в одну треть представляет собой снимок текущих возможностей обнаружения, а не окончательный подсчёт.

Анализ выявил значительные различия между различными типами веб-сайтов. Коммерческие домены .com гораздо чаще использовали тексты, созданные с помощью ИИ, чем правительственные или академические сайты. Эта тенденция указывает на то, что сокращение расходов и скорость производства контента могут стимулировать внедрение технологии в коммерческом секторе, тогда как институциональные сайты поддерживают более строгие редакционные стандарты или сталкиваются с другими нормативными требованиями. Исследователи Pew не предоставили разбивку по конкретным отраслям или бизнес-моделям, наиболее активно использующим эту технологию, оставляя открытым вопрос о том, какие сектора подверглись наибольшему влиянию. Отчёт Декодера документирует отчётность, лежащую в основе этой записи.

Обнаружение машинно-написанного текста остаётся технически неопределённым. Анализ Pew использовал автоматизированные методы обнаружения, которые имеют известные ограничения в различии между авторством человека и машины, особенно по мере того, как языковые модели становятся более сложными. Возможны ложные и ложноотрицательные результаты. Согласно отчету The Decoder, масштабы внедрения резко ускорились с конца 2022 года, опережая разработку надёжных стандартов обнаружения. Центр исследований Pew предоставляет полезные технические основы для оценки утверждения.

Прозрачность и подотчетность

Распространение текстов, написанных машинами, в сети вызывает фундаментальные вопросы о прозрачности и публичном доверии к информации в интернете. Большинство сайтов, содержащих обнаруженный ИИ-текст, не раскрывают этот факт читателям. Не существует обязательного стандарта, требующего от издателей маркировать контент, созданный ИИ, оставляя аудитории без четких сигналов о авторстве или редакционном процессе. Отсутствие такого раскрытия создает потенциальные проблемы для читателей, пытающихся оценить достоверность источника, журналистов, оценивающих справочные материалы, и регуляторов, стремящихся понять состав онлайн-информационных экосистем. Операционный компромисс также отражается в Общий обход.

Распределение выявления текстов, написанных ИИ, по доменам веб-сайтов и категориям публикаций в выборке Pew Research Center. Изображение: Mantis.
Распределение выявления текстов, написанных ИИ, по доменам веб-сайтов и категориям публикаций в выборке Pew Research Center. Изображение: Mantis.

Механизмы институциональной подотчетности не поспевают за внедрением. У издателей, платформ и поставщиков технологий мало четких обязательств по отслеживанию или отчетности о использовании ИИ в производстве контента. Отраслевые группы, такие как C2PA были предложены технические стандарты для происхождения контента, но их принятие остается ограниченным и добровольным. Без обязательного раскрытия информации или стороннего аудита у общественности есть ограниченные возможности оценить, насколько широко практика распространилась за пределами академических исследовательских образцов. Эта непрозрачность влияет на доверие к конкретным публикациям и, потенциально, к цифровой информации в более широком смысле.

Регуляторная среда и пробелы в политике

Регуляторы и законодатели начинают заниматься контентом, созданным искусственным интеллектом, хотя подходы остаются разрозненными. The Рамочная система управления рисками ИИ NIST и принципы ИИ ОЭСР устанавливают концепции управления для прозрачности и подотчетности, но внедрение на уровне содержания остается недостаточно развитым. Некоторые юрисдикции изучают требования к раскрытию информации для текста, сгенерированного ИИ, в конкретных контекстах, таких как реклама или государственные коммуникации, но комплексной рамочной системы для более широкой сети не существует. Скорость внедрения, зафиксированная Pew, опережает разработку политических ответов.

Хронология роста обнаружения текстов, написанных ИИ, на новых английских веб-страницах после публичного запуска ChatGPT. Изображение: Mantis.
Хронология роста обнаружения текстов, написанных ИИ, на новых английских веб-страницах после публичного запуска ChatGPT. Изображение: Mantis.

Разрыв между внедрением технологий и ясностью регулирования имеет реальные последствия. Творцы контента сталкиваются с неопределённостью относительно наилучших практик. Издатели, принимающие редакционные решения, лишены последовательных рекомендаций. Читатели не могут легко определить, был ли текст, который они читают, создан людьми, машинами или их комбинацией. Эта непрозрачность усложняет работу исследователей, архивистов и систем, таких как Common Crawl, которые пытаются сохранить и понять интернет как исторический архив. Различия между коммерческими и институциональными сайтами свидетельствуют о том, что рыночные стимулы и институциональные нормы приводят к различным результатам. Останется определить, станут ли доминирующим механизмом для управления этим контентом добровольные отраслевые стандарты, нормативные требования или их комбинация. Последний пункт можно проверить. Принципы ИИ ОЭСР.

Темы: ИИ, достоверность контента, управление интернетом, ответственность СМИ, цифровая этика

Канонический адрес статьи