Аналитика

Главная›Аналитика›«Крупнейшая кража труда в истории»: что внутренняя переписка Microsoft меняет в споре NYT против OpenAI

«Крупнейшая кража труда в истории»: что внутренняя переписка Microsoft меняет в споре NYT против OpenAI

Представьте, что в суде зачитывают не показания вашего оппонента, а его собственную служебную записку трёхлетней давности. Ту, которую писали «для своих» и не думали, что её кто-то увидит. Именно это произошло 17 сентября в деле The New York Times против OpenAI и Microsoft.

Что случилось

Суд раскрыл ранее засекреченную часть ходатайства газеты. В нём процитирована внутренняя записка директора по прикладной науке Microsoft Брента Хехта от января 2023 года. Обучение языковых моделей на чужих текстах он назвал «поразительной кражей беспрецедентных масштабов» и «крупнейшей кражей труда в истории человечества».

Одними цитатами дело не ограничилось. По данным газеты, только в промежуточных обучающих наборах OpenAI нашлось более 91 тысячи копий материалов NYT и ещё двух изданий, а в одном датасете на базе Common Crawl оказалось свыше двух миллионов документов с nytimes.com. Большая часть этих текстов закрыта пейволлом. На этом основании Times просит вынести решение об ответственности без полноценного разбирательства по существу.

Параллельно 1 сентября Минюст США направил в суд заявление, в котором предлагает оценивать добросовестное использование (fair use) отдельно на этапе обучения модели. Это позиция стороны, а не судебный вывод, но вес у неё немалый.

Почему это важно не только американским медиа

Главный урок здесь не про ИИ. Он про доказательства. Годами спор об обучении нейросетей шёл в абстрактных категориях: «трансформативное использование», «модель не хранит копии». А теперь на столе конкретные цифры и признания самих разработчиков. Абстрактную защиту такие документы разбирают по кирпичику.

Для российского контекста это тоже актуально. С 1 сентября действует закон о поддержке технологий ИИ, но самые острые вопросы — авторское право на обучающие данные и ответственность за результат — он отложил до подзаконных актов. Пока правила не написаны, исход споров будет зависеть от того, кто лучше задокументировал свою позицию.

Что может сделать правообладатель уже сейчас

1. Зафиксировать, что и где у вас опубликовано

Архив публикаций с датами, закрытый доступ, условия использования сайта с прямым запретом на автоматический сбор данных. Без этого доказывать копирование будет в разы сложнее.

2. Проверить, не попали ли ваши тексты и изображения в датасеты

Часть открытых наборов данных можно проверить на наличие конкретных URL и произведений. Такой результат потом становится основой для претензии или переговоров о лицензии.

3. Думать о лицензии, а не только об иске

Урегулирование по делу Bartz v. Anthropic на 1,5 млрд долларов показало, что у контента для обучения появилась рыночная цена. Иногда выгоднее продать доступ на своих условиях, чем годами судиться.

Если вы по другую сторону

Компаниям, которые обучают или дообучают модели, история Microsoft тоже кое-что говорит: внутренняя переписка — это будущее доказательство. Происхождение данных, лицензии и решения юристов стоит оформлять так, будто завтра их прочитает судья.

В «Веллигал» — бутиковом клубе защиты интеллектуальной собственности для частных клиентов и технологических предпринимателей — мы помогаем выстроить такую защиту заранее, до того как спор станет публичным. Если ваш контент мог стать чьим-то обучающим набором или вы сами работаете с данными для ИИ, обсудим ваш кейс индивидуально.

Нужна консультация по вашей ситуации?

Оставьте заявку — куратор клуба свяжется с вами в течение 24 часов.

Подать заявку