Microsoft и OpenAI грабили контент газет: суд раскрыл масштабы скандала
Внутренние документы показывают, что руководители компаний знали о вреде ИИ для интернета, но действовали дальше
В декабре 2023 года New York Times подала один из крупнейших исков о нарушении авторских прав против OpenAI и Microsoft. Газета обвинила компании в том, что их ИИ-модели массово скабрили журналистский контент. На этой неделе суд рассекретил документы, в которых высокопоставленные сотрудники обеих компаний откровенно обсуждали последствия происходящего.
Самые громкие признания — от Брента Хехта, руководителя отдела прикладной науки в Microsoft. В своей внутренней презентации он прямо написал: Copilot's answer engine навредит «и производительности наших моделей, и всему интернету одновременно». Это не прогноз критика — это запись из внутренних документов компании.
Когда клики исчезают
Данные Microsoft рисуют неутешительную картину. Когда Copilot подсказывал ответы на вопросы вместо того, чтобы отправлять пользователей по ссылке, click-through rate (количество переходов на исходный сайт) для New York Times упал на 87–93% по сравнению с обычным поиском в Bing. Для сайтов Ziff Davis (издания, которые владеют Eurogamer и IGN) падение было от 51% до 94%.
Другими словами, когда ИИ давал готовый ответ в строке поиска, люди перестали кликать на оригинальные материалы, которые эти ответы питали.
«Самая крупная кража труда»
Хехт назвал эту ситуацию «doom loop» — порочный круг. В служебной записке от января 2023 года он написал ещё жёстче: «это самая крупная кража труда в истории человечества». Суть его критики в том, что конечный продукт (ИИ-ассистент) угрожает экономическим основам тех, кто его питает — авторов и издателей.
Документы также показывают, как OpenAI обходила защиту платежеёмкого контента. Исследователь компании Ник Райдер рассказал президенту Greg Brockman о «хаке для обхода paywall New York Times» — способе скачать платный контент без подписки. Brockman ответил просто: «ах, ловко».
В других внутренних записях Brockman размышлял, насколько хороши LLM для журналистских задач — de facto признавая, что модели обучены именно на таком контенте.
Стандартная защита не поможет
Обе компании обычно прячутся за доктриной fair use (справедливого использования) — мол, скрепинг контента для обучения моделей защищён авторским правом США. Но суд в своём решении обширно опровергает эту логику.
Особенно показательно показание CEO Microsoft Сатьи Наделлы. Под присягой на депозиции в начале 2026 года Надела сказал: если бы он знал, что OpenAI использует платный контент для тренировки LLM, он бы потребовал, чтобы компания переобучила свои модели. Перефразируя: он не отрицает факт использования платного контента, он просто говорит, что был бы против этого, узнав об этом раньше.
Суд продолжит рассмотрение дела. New York Times требует компенсацию в размере миллиардов долларов и запрета на использование её контента для обучения ИИ.





Обсуждение