Нейросети добрались до религии: 63 процента духовных книг на Amazon оказались фейками
Лидером по доле синтетического контента стала литература по магии и колдовству (78%), показал анализ более 2 000 наименований от исследовательской компании Originality.ai.
Почти две трети проанализированных на маркетплейсе Amazon книг о религии и духовных практиках, вероятнее всего, написаны искусственным интеллектом. К такому выводу пришли авторы нового исследования, изучившие свыше 2 000 недавно опубликованных изданий.
В отчете компании Originality.ai, специализирующейся на детекции сгенерированного контента, 1 272 из 2 034 книг (63%) в 14 религиозно-мировоззренческих категориях были классифицированы как «вероятно написанные ИИ».
Абсолютным лидером стал раздел «Викка, колдовство и язычество»: здесь подозрение в машинном происхождении пало на 78% исследованных книг. Тематика этих изданий в основном вращается вокруг исцеления кристаллами, травяных сборов и очищения от «негативных энергий». По словам автора исследования Майкла Фраймана, львиная доля книг о ведьмовстве сфокусирована именно на таких темах.
— Типичный покупатель подобной литературы — человек, который ищет способы самоисцеления, пытается поправить ментальное здоровье или хочет устроить «детокс» от привычной химии и фармацевтики, — пояснил Фрайман. — Викканские книги закрывают эти боли и страхи, не будучи связанными никакими научными стандартами и проверками.
Второе место по доле сгенерированных текстов занял индуизм (76%), за ним следует даосизм (74%). Между ними расположились сикхизм, буддизм, ислам, католицизм, протестантизм, православие и иудаизм. Доля ИИ-контента среди книг о мормонизме составила 42%, об атеизме — 40%, а о сатанизме — всего 22%. Впрочем, исследователи предупреждают, что размер выборки в разных категориях существенно различался.
Фрайман рассказал, что алгоритм анализировал аннотации книг, биографии авторов и ознакомительные фрагменты текста. Тексты, набравшие по шкале детектора 50 баллов и выше, помечались как «вероятно сгенерированные ИИ». При этом он подчеркнул, что результаты отражают лишь вероятность, а не служат неопровержимым доказательством.
— Мы не заявляем со стопроцентной уверенностью, что эти книги целиком написаны машиной, — отметил он. — Наша модель определяет степень вероятности участия ИИ.
Фрайман добавил, что исследователи также проводили выборочную ручную проверку сомнительных книг.
— К настоящему моменту наша команда уже наметанным глазом способна отличить машинный текст от написанного человеком, — добавил он.
Несмотря на уверенность авторов отчета, детекторы ИИ-текста по-прежнему печально известны регулярными ошибками и ложноположительными срабатываниями.
Так, в октябре 2024 года четыре популярных детектора выдали диаметрально противоположные результаты при анализе Декларации независимости США: сервис ZeroGPT счел исторический документ на 97,93% сгенерированным нейросетью, QuillBot признал его полностью написанным человеком, а GPTZero оценил вероятность человеческого авторства в 89%. А в марте Верховный суд Колумбии отклонил судебный иск из-за того, что детектор распознал в нем работу ИИ. Когда же адвокат прогнал через тот же сервис само постановление суда, система заявила, что вердикт судей на 93% сгенерирован нейросетью.
— Amazon прекрасно осведомлен о масштабах засилья ИИ-контента на платформе, однако полагается на «джентльменское соглашение», ожидая, что авторы сами добровольно признаются в использовании нейросетей, — говорит Фрайман, уточнив, что компания не делилась отчетом с маркетплейсом. — У нас нет данных о том, сколько писателей действительно раскрывают эти сведения.
Тем временем общественный резонанс вызывает и то, как разработчики ИИ используют бумажные книги для обучения моделей: технологические компании скупают миллионы томов, срезают корешки, оцифровывают страницы для тренировочных датасетов, а сами книги выбрасывают.
В августе журналистское расследование отследило партию редких печатных изданий, доставленную на объект Amazon в Лас-Вегасе. Там рабочие срезали переплеты и сканировали страницы для обучения ИИ. В Amazon подтвердили, что действительно закупают книги через коммерческие каналы для этих задач.
Примечания:
- Феномен «AI Slop» и самиздат на Amazon: Благодаря платформе KDP (Kindle Direct Publishing) любой желающий может выпустить электронную или печатную книгу (Print-on-Demand) за 10 минут. Это привело к наплыву «мусорного ИИ-контента» (AI slop). Мошенники генерируют через ChatGPT десятки книг в день по популярным поисковым запросам, ставят сгенерированные обложки и продают их за $2–$5, забивая поисковую выдачу.
- Викка: это современная неоязыческая религия и путь природного колдовства, основанный в середине XX века. Она относится к широкому полю эзотерики и оккультизма, но имеет четкие философские и ритуальные особенности, сосредоточенные на почитании природы.
- Почему эзотерика и Викка лидируют по числу фейков (78%):
- Отсутствие строгой фактологии: В отличие от точных наук или даже академического богословия, литература о «вибрациях кристаллов» и «лунной энергии» состоит из общих, обтекаемых метафор. Нейросети идеально имитируют такой стиль.
- Компилятивный характер: Тексты по магии часто состоят из перечисления списков (травы, камни, заговоры, даты), которые языковые модели генерируют без логических сбоев.
- Проблема детекторов ИИ: В статье справедливо приведены примеры с Декларацией независимости США. Детекторы ИИ (включая Originality.ai, GPTZero) работают на основе метрик Perplexity (непредсказуемость) и Burstiness (вариативность длины предложений). Поскольку библейские, религиозные и юридические тексты исторически тяготеют к ритмичности, торжественности и формульным фразам, алгоритмы часто принимают классический человеческий текст за работу нейросети.
- Уничтожение книг («Book Chopping»): Практика массового срезания переплетов на гильотинных резаках (guillotine scanning) используется для скоростной поточной оцифровки в автоподатчиках сканеров со скоростью сотни страниц в минуту. Тот факт, что техногиганты уничтожают редкие физические книги ради обучения моделей, которые затем наводняют рынок низкокачественными подделками, создает горькую цивилизационную иронию.