Anthropic, создатели нейросети Claude, недавно провели секретную операцию под названием «Проект Панама». Они не строили дата-центров и не нанимали тысячи программистов. Вместо этого компания скупала миллионы старых книг. Сотрудники срезали переплёты, сканировали страницы, а бумагу отправляли на переработку. Им нужен был один единственный ресурс — тексты, которые точно написали люди, а не другие нейросети.

Проблема «цифрового самопоедания»

Зачем такие сложности, если интернет полон бесплатных текстов? Раньше это работало. Первые модели ИИ учились на Википедии, форумах и статьях. Но после выхода ChatGPT ситуация изменилась. Сеть заполнилась текстами, которые создали сами нейросети.

Возникла опасная ловушка. Если новая модель учится на данных, созданных предыдущей моделью, она начинает терять детали. Это похоже на то, как если бы вы делали ксерокопию с ксерокопии. С каждым разом изображение становится всё более размытым, пока не превращается в кашу. В мире ИИ это называют «коллапсом модели». Нейросеть начинает повторять одни и те же шаблонные фразы, забывает редкие факты и в итоге теряет способность рассуждать.

Чтобы этого избежать, Anthropic пришлось вернуться к бумаге. Книги, напечатанные до эпохи нейросетей, — это «чистое золото». В них нет следов машинного обучения, только человеческая логика, ошибки и живой стиль.

Цена за чистоту данных

Эта чистота стоит огромных денег. Anthropic согласилась выплатить авторам 1,5 миллиарда долларов за использование библиотек, которые формально считались пиратскими. Если разделить эту сумму на количество книг, получается примерно 3000 долларов за один экземпляр.

Это самое крупное соглашение по авторским правам в истории США. Компания фактически признала: качественные данные от людей теперь стоят дороже, чем вычислительные мощности или новые алгоритмы. Когда интернет превращается в зеркальный лабиринт из сгенерированного текста, единственным выходом становится поиск оригинальных источников.

Как проверить свои данные и что делать

Если вы используете ИИ в бизнесе или собираете базу знаний для обучения помощника, вы тоже можете столкнуться с этой проблемой. Если в ваши архивы попадут тысячи текстов от ChatGPT, ваш личный агент начнёт «глупеть» и отвечать шаблонами.

Вот как можно обезопасить свои данные:

1. Проведите ревизию источников. Разделите ваши тексты на две папки: «Человек» и «Машина». В первую пойдут старые письма, реальные отчеты, записи звонков и документы из архива. Во вторую — всё, что было создано с помощью ИИ. 2. Маркируйте всё новое. Введите правило: любой текст, созданный нейросетью, должен иметь пометку в конце файла. Это поможет вам через год не перепутать оригинал с копией. 3. Ищите «живые» данные. Вместо того чтобы генерировать инструкции с помощью ИИ, запишите на диктофон, как ваш лучший сотрудник объясняет задачу новичку. Затем переведите эту запись в текст. Это будет гораздо ценнее для обучения, чем идеальный, но стерильный текст от модели.

Где это не сработает

Важно понимать: покупка миллионов книг не делает модель идеальной. Даже с самыми чистыми данными ИИ может ошибаться или галлюцинировать. Кроме того, не каждой компании нужно тратить миллиарды. Для большинства бизнес-задач достаточно небольшого, но очень чистого набора данных.

Качество всегда важнее количества. Сто страниц реальных договоров с вашими правками дадут больше результата, чем миллион страниц сгенерированного «мусора» из интернета.

Если вы сейчас собираете свои данные для обучения ИИ, не полагайтесь только на сеть. Чётко помечайте, что в вашем архиве написано человеком, а что сгенерировано машиной. Иначе через год вы сами не сможете отличить одно от другого.