Бесплатного интеллекта не бывает: кто оплачивает данные для LLM
Инженер и бывший юрист анализирует, как в ML-конвейере теряется происхождение данных, и почему это стало центральной проблемой авторского права. На примере дела Anthropic он показывает, что судьбу моделей решает не абстрактное «обучение», а конкретные операции с копиями произведений.
Вопрос о том, можно ли обучать большие языковые модели на защищённых авторским правом материалах, обычно обсуждается в слишком общем виде. Популярная аналогия с человеком, который читает книги и учится писать, не учитывает масштаб и техническую природу процесса. Человек не создаёт массовых цифровых копий, не хранит их в дата-центрах и не выпускает систему, генерирующую тексты промышленными объёмами. Поэтому вместо широкого «можно или нельзя» инженер предлагает задавать конкретный вопрос: какие именно операции были выполнены с каждым произведением, откуда получена копия, на каком основании она хранится и в какие артефакты попала.
На практике ответить на этот вопрос мешает потеря контекста в ML-пайплайне. На входе у данных есть URL, дата скачивания и лицензия, но после очистки, дедупликации и формирования тренировочных смесей остаются лишь parquet-файлы, хэши и внутренние идентификаторы. README с лицензией может лежать рядом, но уже непонятно, к каким строкам он относится. В инфраструктуре это знакомый класс ошибок: артефакт жив, а контекст его появления умер. Только здесь потерянный контекст — это не номер коммита, а основание использования чужого произведения.
Для решения проблемы автор предлагает концепцию Data Bill of Materials (Data BOM) — машиночитаемую историю происхождения набора данных, которая должна передаваться через ETL вместе с объектом. В минимальном варианте она включает идентификатор датасета, версию, цель использования, список источников с типом лицензии и разрешёнными способами применения, сведения о пайплайне обработки и производных наборах. Ответственность предлагается распределить: владелец датасета отвечает за полноту записи и решение о включении источника, data platform обеспечивает перенос метаданных и неизменяемый журнал, юристы задают правила для лицензий и сигналов об отказе, а ML governance проверяет исключения и выпуск конкретного training mix. Без владельца такой документ быстро превращается в ничейный YAML.
Контраргумент очевиден: полный provenance дорог, для старых корпусов он может быть невосстановим, а детальный список источников способен раскрыть коммерческую тайну и облегчить атаки на датасет. Однако прозрачность не обязана быть одинаковой для всех: публике можно дать агрегированное описание, а аудитору, суду или регулятору — детальный журнал при наличии оснований. Разница между «невозможно опубликовать всё» и «можно не учитывать ничего» принципиальна. Именно эта инфраструктура понадобилась юристам в деле Bartz v. Anthropic, где компания собрала центральную библиотеку книг, часть которых получила из Books3, LibGen и PiLiMi, а позднее стала покупать бумажные экземпляры, срезать переплёты, сканировать и уничтожать оригиналы. Суд разделил операции: использование книг для обучения конкретных моделей признал fair use, создание цифровой замены законно купленной и уничтоженной книги — тоже, а хранение пиратских копий в универсальной библиотеке «навсегда» — нет. Это не общее разрешение, а вывод по конкретным истцам и доказательствам, но для инженера важна сама декомпозиция: источник копии, цель хранения и дальнейшее использование оказались разными вопросами. В 2026 году суд утвердил соглашение на 1,5 млрд долларов, охватывающее более 482 тысяч произведений, что закрыло требования по прошлым нарушениям, но не выдало Anthropic индульгенции на будущее.
Для российского рынка эта история имеет двоякое значение. С одной стороны, российское авторское право не знает доктрины fair use в американском смысле, а судебная практика по обучению ИИ пока практически отсутствует. С другой — многие российские компании используют зарубежные датасеты и модели, а значит, могут столкнуться с исками в иностранных юрисдикциях. Кроме того, ужесточение регулирования в ЕС и США заставляет разработчиков искать легальные источники данных, что повышает спрос на лицензированные корпуса и услуги по очистке прав. В этих условиях внедрение Data BOM становится не академическим упражнением, а способом снизить юридические риски и доказать добросовестность. Пока же отрасль только начинает осознавать, что бесплатный интеллект, построенный на бесконтрольно скачанных данных, может обернуться многомиллиардными исками.
По сравнению с альтернативами — например, обучением только на синтетических или открытых данных — подход с полным прослеживанием происхождения выглядит дороже и медленнее. Однако он даёт то, чего не хватает многим проектам: воспроизводимость и защиту в случае разбирательств. Синтетические данные не решают проблему полностью, так как могут наследовать предвзятости и ограничения исходных моделей, а открытые лицензии часто не покрывают коммерческое использование. Таким образом, Data BOM — это не серебряная пуля, а необходимый элемент зрелой MLOps-практики, который позволяет отделить законные операции от незаконных и выстроить доверие между разработчиками, правообладателями и регуляторами.
В перспективе можно ожидать появления стандартов и инструментов для автоматического сбора provenance, а также требований со стороны крупных заказчиков и инвесторов. Открытыми остаются вопросы: как быть с уже обученными моделями, чьи данные невозможно восстановить, и кто будет оплачивать создание инфраструктуры прозрачности — сами разработчики или общество через новые формы регулирования. Ясно одно: эпоха безответственного копирования всего интернета подходит к концу, и следующим шагом станет либо добровольное внедрение учёта данных, либо принудительное — через суды и законы.