Синтетические данные становятся все более популярными среди компаний, занимающихся искусственным интеллектом. Вместо того чтобы полагаться на реальные данные, такие как информация из интернета или лицензированные наборы, многие разработчики создают свои собственные обучающие данные с помощью ИИ. Это позволяет избежать некоторых юридических проблем, связанных с конфиденциальностью и авторскими правами, но также вносит неопределенность в вопросы собственности и качества данных.
Одним из основных рисков, связанных с синтетическими данными, является неопределенность в праве собственности. Согласно отчету Бюро авторских прав США, защита авторских прав на результаты генеративного ИИ зависит от наличия достаточного человеческого вклада. Если синтетический набор данных не имеет достаточной человеческой авторства, это может затруднить его защиту авторскими правами. В таких случаях компании должны рассмотреть возможность защиты данных как коммерческой тайны, что требует соблюдения определенных мер безопасности.
Кроме того, синтетические данные не исключают риски, связанные с исходными данными. Если модель, использованная для генерации синтетических данных, была обучена на нелицензированных данных, это может привести к юридическим последствиям. Исследования показывают, что использование сгенерированного контента в обучении может привести к ухудшению качества модели, что создает скрытую "долговую нагрузку" данных.
Регуляторные требования также становятся более строгими. Например, согласно Закону о ИИ в ЕС, поставщики должны публиковать подробные сведения о содержании своих обучающих данных, включая синтетические данные. Это создает дополнительные риски для компаний, которые должны быть готовы к потенциальным изменениям в законодательстве.
При проведении сделок по слиянию и поглощению важно тщательно проверять синтетические данные. Ключевые вопросы включают: какова доля синтетических данных в общем объеме обучающих данных, какие модели использовались для их генерации и какова их правовая база. Компании должны также удостовериться, что у них есть четкие права на использование синтетических данных для коммерческих целей.
В заключение, синтетические данные представляют собой новый класс активов, который требует внимательного анализа и оценки рисков. Их ценность зависит не только от того, что они были сгенерированы ИИ, но и от способности компании использовать их законно и защищать их коммерчески.