Перейти к содержанию
среда, 29 июля 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Разработчики ИИ скупают бумажные книги для обучения моделей и затем их уничтожают

Источник: 3DNews:
AI researchers shredding piles of scanned books.
Generated by Sourceful Riverflow (RouterAI)

Крупные компании, занимающиеся разработкой искусственного интеллекта, начали массово приобретать физические книги для пополнения тренировочных наборов данных, после чего уничтожать их. Эта практика, ставшая известной благодаря отчётам отраслевых журналистов, вызывает вопросы о легальности и эффективности такого подхода.

В последние месяцы в индустрии искусственного интеллекта наметилась новая тенденция: разработчики крупных языковых моделей всё чаще обращаются к бумажным книгам как к источнику данных для обучения. Как сообщает портал 3DNews, компании закупают целые партии печатных изданий, сканируют их страницу за страницей для извлечения текста, а затем физически уничтожают книги. Такой метод позволяет обойти технические ограничения, связанные с защитой авторских прав на цифровые копии, и получить доступ к редким или давно не переиздававшимся произведениям. По оценкам инсайдеров, речь идёт о тысячах томов, приобретаемых через букинистические магазины и библиотечные распродажи. Особо ценятся издания, которых нет в цифровых архивах, а также книги с уникальным стилем или терминологией, способные обогатить обучающие выборки.

Согласно данным, опубликованным в профильных изданиях, объёмы закупок исчисляются десятками тысяч экземпляров. Одна из крупнейших сделок, совершённых нераскрытой компанией, включала приобретение около 50 тысяч книг у сети букинистических магазинов на Среднем Западе США. После доставки на склад книги сортируются, проходят через промышленные сканеры, способные обрабатывать до 1000 страниц в час, а затем отправляются в шредер. Затраты на такие операции, по оценкам экспертов, достигают нескольких миллионов долларов с учётом логистики и аренды оборудования. Компании оправдывают уничтожение книг необходимостью предотвратить повторное попадание редких изданий на рынок и избежать претензий со стороны правообладателей. Некоторые разработчики специально арендуют изолированные складские помещения, чтобы минимизировать утечки информации.

Технически процесс выглядит следующим образом: каждая книга раскладывается на отдельные листы, которые подаются в роботизированный сканер с функцией распознавания текста. Полученные цифровые файлы проходят дополнительную очистку от шумов и метаданных, после чего интегрируются в тренировочный датасет. Уничтожение бумажных носителей происходит непосредственно на площадке сканирования с использованием промышленных измельчителей, что исключает возможность восстановления или перепродажи. По словам представителя одной из компаний-разработчиков, такая процедура гарантирует, что исходный материал не будет использован конкурентами или не попадёт в открытый доступ в обход лицензионных соглашений. При этом используются нейросетевые алгоритмы для повышения качества распознавания старых шрифтов и рукописных пометок.

Контекст этой практики лежит в плоскости правовых споров вокруг обучения ИИ на авторских текстах. До последнего времени основным источником данных служили открытые веб-архивы и краудсорсинговые проекты, однако после серии судебных исков от издателей и писателей, в том числе против OpenAI и Meta, компании начали искать альтернативные пути. Использование физических книг рассматривается как способ получить контент, не нарушая правила цифрового копирования, хотя юристы отмечают, что сама по себе оцифровка и последующее извлечение текста всё равно может являться нарушением авторского права. Тем не менее, ряд разработчиков считает такой подход более этичным, чем массовое сканирование библиотечных фондов без ведома правообладателей. Ключевой аргумент — приобретение книги является легальным актом, а уничтожение после сканирования теоретически снижает риск многократного использования.

Для российского рынка эта новость имеет двойственное значение. С одной стороны, отечественные компании по разработке ИИ, такие как Яндекс и Сбер, традиционно ориентируются на открытые источники и собственные архивы, редко прибегая к массовой закупке печатной продукции. С другой стороны, уже замечены попытки ограниченного приобретения книг у российских букинистов для обучения специфических моделей, например, в области филологии или юриспруденции. Реакция профильного сообщества в РФ пока сдержанная: эксперты отмечают, что данная практика крайне ресурсозатратна и неэффективна с учётом доступности оцифрованных фондов крупных библиотек. Однако в случае ужесточения законодательства об авторском праве российские разработчики могут последовать примеру западных коллег. В частности, обсуждается возможность использования книг, выпущенных малыми тиражами и не попавших в цифровые хранилища.

Сравнение с альтернативными методами сбора данных показывает, что закупка и уничтожение бумажных книг — один из самых дорогих вариантов. Лицензирование цифровых копий у издательств обходится значительно дешевле, хотя и сопряжено с длительными переговорами. Использование общедоступных текстов из Project Gutenberg или интернет-архивов вообще бесплатно, но не гарантирует уникальности датасета. При этом уничтожение книг вызывает критику со стороны экологов и защитников культурного наследия, которые указывают на неоправданное уничтожение книжного фонда. Тем не менее, для некоторых компаний главным приоритетом является создание закрытого, неповторимого набора данных, который невозможно получить из общедоступных источников. В результате рынок бумажных книг для ИИ может стать новым сегментом букинистической торговли.

Перспективы этой тенденции остаются неясными. Вероятнее всего, в ближайшие годы мы увидим рост числа подобных операций, особенно среди стартапов, стремящихся быстро нарастить обучающие выборки без юридических рисков. Однако открытым остаётся вопрос о долгосрочной эффективности: насколько качество текста, извлечённого из потрёпанных книг с разной полиграфией, будет превосходить данные из цифровых источников. Кроме того, уже готовятся иски от организаций, представляющих интересы авторов, которые могут оспорить легитимность такого подхода. В любом случае, описанная практика иллюстрирует, насколько изобретательными становятся компании в борьбе за качественные данные для обучения искусственного интеллекта, даже если это ведёт к уничтожению физических носителей культуры. Возможно, в будущем появятся специализированные сервисы, предлагающие уже оцифрованные коллекции книг с гарантией легальности.

Читайте также