Мы с вами наблюдаем новую промышленную революцию. И не просто наблюдаем, а являемся её частью, причём стали ею мы ещё задолго до того, как всё это началось.
Бум искусственного интеллекта, как принято считать, начался в 2022 году с выпуском ChatGPT на базе модели GPT-3.5 от OpenAI. Всего за почти четыре года наступила новая эпоха технологического прогресса, и, очевидно, она только набирает свои обороты.
Без нашей с вами активности ни одна модель машинного обучения, не говоря уже о нейросетях, не смогла бы выйти в свет. Любой наш клик, пролистывание, сообщение, предпросмотр видео или добавление товара в корзину фиксируется и предоставляет важные данные о нас с вами. И речь идёт не только об интернете. Представьте новую пекарню. Если никто однажды не откроет её страницу на карте, она не получит отзывов, фотографий и оценок. Для рекомендательной системы такого места просто не существует. Информация появляется только тогда, когда кто-то совершает действие.
Но если говорить об отслеживании наших действий в сети или появлении вашей пекарни на карте, то всё это происходит с нашего согласия. Мы готовы платить данными о себе за то удобство и те возможности, которые нам дают сервисы.
Совсем другой оборот принимает вопрос, например, когда компания хочет создать собственную языковую модель в коммерческих целях, но данных у разработчика ещё нет. Что делать? Можно предложить пользователям загружать PDF-файлы и другие документы и надеяться накопить нужный объём информации, но тогда, боюсь, вы быстро проиграете более богатым или влиятельным конкурентам. Компания, у которой есть деньги и которая хочет заработать ещё больше, просто идёт и платит. И платит много.
Мы рассмотрим, как за последние годы информация превратилась в ресурс, похожий на нефть или железо. Почему компании готовы платить миллионы долларов за доступ к форумам и библиотечным архивам.
Что вообще представляет собой информация в контексте машинного обучения и искусственного интеллекта? Это данные, на которых модель учится выявлять определённые паттерны и закономерности. Благодаря этому, получив новые, ранее не встречавшиеся данные, она может предсказывать наиболее вероятный ответ, генерировать текст, распознавать объекты на изображениях или выполнять другие задачи.
То есть любые видео, изображения, аудио, программный код, комментарии на форумах и в социальных сетях — всё это информация, которая нужна для развития ИИ, а потому она невероятно ценна, как уголь в 18 веке.
Форумы, по долгу своей службы, являются одним из лучших источников текстовой информации. Они появились очень давно, люди на них решали и продолжают решать самые разные вопросы, а потому они идеально подходят для сбора и обработки текста.
Одним из первых сигналов того, что информация перестала быть бесплатным ресурсом, стал Reddit.
В апреле 2023 года Reddit объявил, что закрывает бесплатный доступ к своему API. Компания не хотела, чтобы её контент бесконтрольно использовался для обучения больших языковых моделей. Уже через два месяца API стал платным. Многие сторонние приложения были вынуждены закрыться. Самый известный клиент Reddit для iOS, Apollo, прекратил существование. Его разработчик признался, что доступ к API обошёлся бы примерно в 20 миллионов долларов в год.
Уже в начале 2024 года Reddit заключил соглашение с Google примерно на 60 миллионов долларов в год за лицензирование своего контента для обучения искусственного интеллекта. А во время подготовки к IPO компания раскрыла, что стоимость подобных соглашений уже достигла более 200 миллионов долларов.
Весной 2024 года OpenAI практически каждую неделю объявляла о новых партнёрствах. Сначала было заключено соглашение со Stack Overflow, который незадолго до этого сократил около 28% сотрудников на фоне падения посещаемости сайта из-за развития ИИ.
Затем стало известно о партнёрстве OpenAI с Reddit. Спустя несколько дней появилась информация о сделке компании с News Corp, владеющей такими изданиями, как The Wall Street Journal, The Times и New York Post, на сумму более 250 миллионов долларов за пять лет.
Вслед за этим OpenAI объявила о соглашениях с Dotdash Meredith — не менее чем на 16 миллионов долларов, с Axel Springer — примерно на 13 миллионов долларов в год на срок до трех лет, с Financial Times — от 5 до 10 миллионов долларов в год.
Издательство Wiley заключило сделки с двумя неназванным компаниям за 21 и 23 миллиона долларов соответственно, а британская Informa получила в качестве стартовой суммы 10 миллионов долларов от Microsoft.
Shutterstock, крупнейшик сток для фото и видео, сообщил, что AI-лицензирование стало одним из быстрорастущих направлений: в 2023 году оно принесло около $104 млн.
Подобные сделки и соглашения продолжают заключаться и сегодня. Но ещё в 2024 году группа исследователей из Epoch AI опубликовала свой прогноз о том, что общедоступный контент, созданный человеком, в том числе продаваемый компаниями вроде Reddit, начнёт резко иссякать в качестве источника информации для обучения моделей начиная с 2026 года и практически исчерпается к 2032 году. Происходит это из-за роста объёмов данных, которые способны обрабатывать сами модели.
Поэтому следующий случай становится невероятно важным и, возможно, знаменует следующую веху рынка информации в сфере ИИ.
2 мая 2026 года очень популярный в своё время американский лоукостер Spirit Airlines прекратил свою деятельность. Как пишут СМИ, адвокаты продолжают распродавать активы компании. Один из них привлёк внимание Google.
Компания выиграла банкротный аукцион на корпоративные данные, выложив 10 миллионов долларов. То есть Google может стать владельцем около 100 миллионов сообщений, отправленных по электронной почте, и около 500 миллионов сообщений из Microsoft Teams, а также всех маркетинговых материалов, информации о персонале, документов по управлению проектами, финансовых баз данных, аудитов и презентаций. Компания уверяет, что информацию о клиентах и вообще какие-либо персональные данные она не получит.
Вероятно, количество подобных сделок в ближайшее время будет только расти, а значит, прогнозы Epoch AI близки к реальности. IT-гиганты начинают платить не за контент и сообщения в общем доступе, а за корпоративные данные, которые несли ценность, по крайней мере, когда их бывшие владельцы ещё вовсю работали.
Вдобавок к этому нельзя не рассмотреть опыт компании Anthropic, разработчика Claude. В июле 2026 года федеральный суд Сан-Франциско окончательно утвердил соглашение об урегулировании на 1,5 млрд долларов по делу, начавшемуся ещё в 2024 году после коллективного иска от издательств и множества независимых авторов. Они обвинили Anthropic в нарушении авторских прав из-за скачивания миллионов книг без разрешения и хранения их цифровых копий, полученных с торрент-трекеров.
Компания не признавала вину и подчеркивала, что конкретно эти версии книг не использовались для обучения моделей. Однако федеральный суд Сан-Франциско утвердил соглашение, по которому правообладателям будет выплачено около 3000 долларов за каждое произведение, представленное в соглашении. Это событие стало крупнейшим взысканием средств из-за нарушения авторских прав в истории и фактически обозначило новые рамки использования информации в сфере искусственного интеллекта: данные для обучения должны быть легальными.
Поэтому неудивительными стали известия, всплывшие на поверхность в ходе судебных разбирательств: ещё с начала 2024 года Anthropic реализует проект «Панама», в рамках которого активно скупает физические копии книг, сканирует их для обучения Claude, а затем уничтожает. За эти годы компания приобрела и навсегда уничтожила миллионы подержанных бумажных изданий, превратив их в расходный материал для обучения моделей.
Всего за несколько лет сформировался новый рынок. Если раньше электронные книги, статьи, фотографии и сообщения на форумах были просто контентом, то теперь они стали активами, за которые крупнейшие технологические компании готовы платить десятки и сотни миллионов долларов. И так же быстро этот рынок практически переизобрёл себя: он всё чаще обращается к физическим носителям информации, а также начинает обрастать законами и другими регуляциями.
И чем больше данных требуется искусственному интеллекту, тем дороже становится качество и происхождение информации. Круг замкнулся: то, что начиналось как наш бесплатный цифровой след и обычное общение в сети, превратилось в один из ценнейший ресурсов нашего времени. И, возможно, оставляя сегодня очередной, казалось бы, ничего не значащий комментарий на форуме, стоит помнить: прямо сейчас вы создаете актив, ради которого технологические гиганты готовы тратить сотни миллионов.