Astonishing Theft: NYT и медиагиганты против OpenAI и Microsoft

Суд раскрыл внутренние письма Microsoft и OpenAI, где сотрудники называют AI-тренировку на чужом контенте 'astonishing theft'. Разбор брифа о summary judgment.

Источник: The Decoder


A sweating executive on the witness stand watches ASTONISHING THEFT highlights on a courtroom screen.

Astonishing Theft: когда твои люди называют твою практику ‘крупнейшей кражей в истории’

The New York Times и группа медиакомпаний подали совместный бриф о summary judgment в федеральный суд Нью-Йорка. 92 страницы. Миллиарды долларов в требованиях. И кое-что ещё: внутренние письма Microsoft и OpenAI, где их собственные сотрудники называют практику обучения на чужом контенте “astonishing theft of unprecedented proportions”.

Возможно, крупнейшей кражей труда в истории человечества.

Это не цитата из судебного иска противника. Это слова Brent Hecht, директора по прикладной науке Microsoft. Внутреннее письмо. Теперь — часть судебного протокола.

Что говорит Microsoft про саму себя

Brent Hecht написал, что практика обучения AI на чужом контенте — это “astonishing theft of unprecedented proportions” и, возможно, “largest theft of labor in human history”. Он также написал, что успешная защита fair use “arguably make a complete mockery of the idea of ‘fair use’”.

Microsoft ответила Financial Times: эти комментарии “reflect one employee’s individual perspective” и “are not a legal analysis”.

Один сотрудник. Индивидуальная перспектива. Не юридический анализ.

Проблема в том, что этот “один сотрудник” — директор по прикладной науке. Это не стажёр из отдела кофе. Это человек, который понимает, что делает компания, и имеет мнение об этом. Мнение, которое теперь публично.

Когда ваш директор по прикладной науке называет вашу бизнес-практику крупнейшей кражей в истории — у вас проблема. Не юридическая. Репутационная. Потому что если это “индивидуальная перспектива” — почему он всё ещё работает?

Что говорит OpenAI про саму себя

Nick Turley, глава ChatGPT в OpenAI, написал в_internal документе, что издатели сталкиваются с “existential threat”. Его продукты “are largely substitutive, period” и будут “increasingly replace publishers’ offerings as they get better”.

Инженер OpenAI добавил: “no matter how prominently we show the links, users won’t click”.

Вот это последнее — особенно хорошо. “Мы можем показывать ссылки, но пользователи всё равно не будут кликать”. То есть OpenAI знает: их продукт заменяет оригинальный контент, а не направляет к нему трафик. Они знают это до того, как это стало известно всем остальным.

Satya Nadella, CEO Microsoft, подтвердил под присягой: разговоры с чатботом заменили визиты к оригинальным источникам. Microsoft сказала Financial Times, что это касалось “broad principles” и не было “conclusion about copyright questions”.

CEO подтверждает под присягой факт. Компания говорит, что это не про авторское право. Логика безупречна — если под “логикой” понимать полное её отсутствие.

“Doom Loop” — как Microsoft описала то, что делает

Внутренний документ Microsoft описывает самоусиливающийся цикл под названием “doom loop”:

“Our AI content strategy has started a ‘doom loop’ that will hurt the performance of our models and the entire web at the same time: It is highly unusual that an end-product threatens the economic foundations of its essential suppliers, but that is the situation we have created for our LLM business with respect to its ‘content supply chain’.”

Перевод: наша стратегия AI-контента запустила “doom loop”, который навредит производительности наших моделей и всему вебу одновременно. Ненормально, что конечный продукт угрожает экономическим основам своих ключевых поставщиков — но это ситуация, которую мы создали для нашего LLM-бизнеса по отношению к его “цепочке поставок контента”.

Это не цитата из иска против Microsoft. Это внутренний документ Microsoft. Они сами описали то, что делают, как ситуацию, которая угрожает их собственным моделям и всему вебу.

Их данные показывают: click-through rates на Copilot были значительно ниже, чем в обычном поиске Bing. Для NYT — снижение на 87-93%. Для Daily News group — 83-91%. Для Ziff Davis — 51-94%.

То есть Copilot не направляет трафик к издателям. Он его убивает.

Paywall и “хак для обхода”

Greg Brockman, co-founder OpenAI, обсуждал в внутреннем сообщении способность моделей обрабатывать новости: “we are excellent at news btw. every time i do any generative stuff on NYT it seems to predict the next sentence pretty well”.

Сотрудник рассказал Brockman о “hack to get around nytimes paywall”. Brockman ответил: “ah nice”.

Около 2017 года Brockman также написал, что “deeply motivated by the gazillions”, которые он надеется заработать, коммерциализируя технологию OpenAI.

“Газиллионы”. Не “устойчивый бизнес”. Не “долгосрочная ценность”. Газиллионы.

OpenAI acquired “New York Times Annotated Corpus” — коллекцию из 1.8 миллиона статей — через третью сторону. Лицензия ограничивала использование “non-commercial linguistic education, research and technology development”. Сотрудники OpenAI знали, что использование корпуса для обучения моделей “would not be appropriate”. Но сделали это всё равно.

Фильтр как “случайное сокрытие”

Сразу после подачи исков OpenAI построила фильтр для подавления output, наиболее вероятно взятого из публикаций истцов. Контент компаний, не подавших в суд, остался незатронутым.

Истцы утверждают: фильтр был создан не для защиты авторских прав, а для предотвращения сбора доказательств.

Hecht из Microsoft предупредил об этом ещё до того, как фильтр появился. Он назвал это “accidental cover up” и предупредил, что это приведёт к тому, что “people who have a right over the content having less visibility into what was used for training”.

Случайное сокрытие. Как удобно.

Четыре фактора fair use — и почему они не работают

Истцы оспаривают защиту fair use по всем четырём статутным факторам:

  1. Использование substitutive и commercial, а не transformative.
  2. Статьи — выразительные работы, находящиеся в ядре защиты авторского права.
  3. Ответчики скопировали целые работы, хотя их собственные эксперты признали, что ни одна отдельная работа не была необходима.
  4. Рыночный вред: существуют лицензионные рынки, которые могли бы развиваться. OpenAI и Microsoft подписали лицензионные сделки с другими издателями. Но вместо того чтобы платить за контент истцов, они взяли его бесплатно и торговали им между собой.

Функционирующий лицензионный рынок делает аргумент fair use труднее для защиты. Ответчики не могут убедительно утверждать, что лицензирование было невозможно, когда они уже платят за сравнимый контент другим издателям.

AI может сгенерировать миллион “pink slime” статей за 6800 долларов

Истцы также оспаривают аргумент, что AI-модели не конкурируют с издателями. По ценам API OpenAI, генерация одного миллиона новостных статей по 500 слов стоит около 6800 долларов. Без участия ни одного журналиста.

Brief цитирует PrismNews, которая использовала всего четырёх сотрудников для управления 200 AI-генерируемыми изданиями, выдававшими себя за местные редакции и хобби-сайты.

OpenAI анонсировала инструмент “Media Manager” в 2024 году, который должен был позволить издателям отказаться от scraping. Проект был отложен.

Краткий ответ

The New York Times и группа медиакомпаний требуют миллиарды долларов от OpenAI и Microsoft. Внутренние письма показывают: директор по прикладной науке Microsoft назвал практику “astonishing theft of unprecedented proportions” и “largest theft of labor in human history”. Глава ChatGPT признал, что продукты “largely substitutive” и заменят издателей. CEO Microsoft подтвердил под присягой: чатботы заменили визиты к оригинальным источникам. Внутренний документ Microsoft описал “doom loop”, угрожающий их собственным моделям. Click-through rates на Copilot — на 87-94% ниже, чем в обычном поиске. OpenAI обошла paywall, использовала корпус NYT с не-commercial лицензией и построила фильтр для подавления доказательств после подачи исков.

Fair use не работает, когда твои собственные люди называют практику кражей. Когда ты уже платишь другим издателям за лицензирование. Когда твой CEO подтверждает под присягой, что продукт заменяет оригинальный контент.

Это не история про авторское право. Это история про то, как компании строят бизнес на чужом контенте, зная, что это кража, и надеясь, что юридическая защита fair use выдержит. Не выдержит.

← Все новости