В этой статье я рассмотрю несколько тенденций в ИИ‑индустрии, которые не сильно освещаются в СМИ и не вызывают интереса у обычных читателей, но имеют огромный практический смысл. Мы с вами вместе проанализируем статистику за последние годы и разберём эти тенденции.

  • Центр тяжести в ИИ‑гонке смещается от гонки самих LLM в сторону развития поисковых инструментов и сопутствующей инфраструктуры.

  • Актуальность ответа LLM критически зависима не столько от данных, полученных при обучении, сколько от качества внешнего поиска и обработки найденной информации.

  • Уже сейчас связка нескольких, даже не самых мощных LLM, с несколькими независимыми поисковыми источниками может выдавать более актуальный и проверяемый результат, чем одна флагманская модель.

  • Количество вакансий в ИИ‑сфере растёт, но сама структура специализаций смещается от работы с моделями в сторону умения добывать, готовить и доставлять моделям сырые данные.

Красивая обёртка

Та гонка ИИ‑моделей между IT‑гигантами, что мы наблюдаем в инфополе, по большей части является искусственно созданной маркетинговой мишурой, рассчитанной на массового потребителя и призванной создавать благоприятный инвестиционный климат. Настоящая битва идёт на более глубоком уровне. На уровне поиска и доставки уникальной, актуальной и достоверной информации к LLM. И каждый год сегмент разработки худеет по отношению к общим затратам, а сегмент поиска толстеет. Корпорации понимают, что настоящая ценность не в том, как ИИ обрабатывает информацию, а в том, что она обрабатывает.

Я не утверждаю, что LLM‑гонки не существует или что она не актуальна, я говорю о том, что для обычных людей выбрана наиболее показательная площадка для проведения баталий между корпорациями. Очень удобно отчитываться о том, что выпущена новая модель, и она в пыль разметает старые бенчмарки. Это и красивые яркие образы, и победные заголовки. И нет, это не про очередной заговор корпораций, чтобы отвлечь людей от настоящей гонки. Это про удобство. Гораздо проще показать людям красивый бренд, чем объяснять, что такое краулинг, индексирование, ретривал. Так и создаётся впечатление, что гиганты бьются за первенство среди моделей.

Один из элементов таких показательных баталий — бенчмарки. Но если рассматривать эти бенчмарки абстрагировано, со стороны, то создаётся стойкое ощущение, что среди них много таких, которые созданы не для получения действительно полезных данных, а ради демонстрации хоть каких‑то преимуществ одних моделей перед другими. И я совсем не утверждаю, что они бесполезны в принципе, я говорю о том, что вокруг них создаётся завышенный информационный ажиотаж (косвенное подтверждение — раздел 2 отчёта OECD — Exploring Possible AI Trajectories Through 2030).

Как в реальности финансируются сектора. Поиск сдвигов в финансировании направлений от года к году

Я не имею возможности объять весь рынок. Но я буду опираться на открытые данные топ-10 IT‑гигантов, включая китайских тяжеловесов. Это даст достаточно репрезентативный срез, чтобы увидеть вектор смещения финансирования в область добычи информации.

Объясню мой метод подсчёта, а вы сами решите, валиден ли он. Сразу оговорюсь — я не ищу точных данных до цента, я не делаю бухгалтерский отчёт для корпораций. Я свожу всё к поиску дихотомии «сдвиг есть» или «сдвига нет». Я беру из отчётов совокупные расходы на ИИ шести американских корпораций (Microsoft, Alphabet, Amazon, Meta, Apple, NVIDIA) и четырёх китайских (Alibaba, Tencent, Baidu, ByteDance) за последние пять лет. Частично это отражено в графике № 1, но в самом графике показаны общие данные по всему ИИ‑рынку, я же в расчёты брал цифры именно 10 конкретных корпораций из открытых источников. Разделяю их на три направления. Инфраструктура (дата‑центры, чипы, сети), обучение самих языковых моделей (тренинг, исследовательские лаборатории) и поисковые инструменты (генеративная выдача, RAG, AI‑ответы поверх поиска). Инфраструктура у нас становится общим фоном, так как одни и те же серверы обслуживают и чат‑ботов, и поисковые запросы. Я смотрю не на абсолютные суммы, а на доли в общем бюджете. Смотрю, как доли меняются от года к году. Если доля тренинга падает, а доля поисковиков растёт по соотношению друг к другу, значит, вектор смещения есть, и мы его фиксируем. Если пропорции не меняются, то и вектора нет.

В эти расчёты не вошли многомиллиардные контракты на эксклюзивный доступ к профильным сайтам и базам данных. Reddit, Stack Overflow, медицинские и юридические архивы, лицензии на новостной контент. Во‑первых, компании не раскрывают их в деталях, и они лежат за рамками технологических инвестиций. Во‑вторых, надо отметить, что бюджеты там немалые, но сделаем допущение, что бюджеты из года в год в целом одинаковые. Хотя я уверен, что и эти цифры растут, но не смогу этого доказать.

График 2. Соотношение расходов на AI-модели и AI-поиск (2022–2026 гг.)
График 2. Соотношение расходов на AI‑модели и AI‑поиск (2022–2026 гг.)

График показывает, что в «нежелезной» части ИИ‑бюджета, то есть если вычесть дата‑центры и чипы, поисковые инструменты постепенно отжимают долю у обучения моделей. В 2022 году на каждый доллар, потраченный на тренинг, приходилось 39 центов на поиск. К 2026-му это соотношение выросло до 52 центов. Реальный прирост на треть за пять лет. Зелёная часть столбца растёт, белая сжимается. Это значит, что даже в той части бюджета, которая не ушла на инфраструктуру, центр тяжести смещается в сторону поиска.

Актуальная информация против зашитой в модель

«Сначала определи круг достоверных профильных источников по моей теме, затем собери в них актуальную и верифицированную информацию на сегодняшнюю дату по моему запросу. Выведи реальные ссылки на источники. Если не нашёл информацию — ответь, что не нашёл» — именно эта фраза сейчас открывает каждый мой запрос по серьёзной теме при работе в браузере. Этой фразой я активирую поисковые инструменты и заставляю искать не просто информацию по моей теме, а свежую актуальную информацию. Без такого уточнения модели, считая, что знаний в весах достаточно, выдают ответ, который помнят сами или могут выдумать его с честными глазами. Опираться на дефолтные данные — опрометчиво и не очень разумно, даже если у вас в запросах формализованные задачи, такие как написание кода, работа с текстом или с общеизвестными фактами. Языки программирования меняются, человеческий язык обогащается новыми терминами, общеизвестные факты переоцениваются.

Схема зависимости модели от широты поисковой инфраструктуры
Схема зависимости модели от широты поисковой инфраструктуры

Схема показывает, что доступ к актуальной и проверенной информации крайне важен. Флагман любого ИИ‑гиганта проигрывает обычным моделям с более широким доступом. Это понятно на любом уровне логики. Но если мы в этой схеме дадим доступ флагману ко всем видам БД, тут он несомненно уже покажет себя на этапе обработки и анализа полученной информации. Тут станут видны все его достоинства. Что это значит? Это значит, что LLM нельзя рассматривать и сравнивать отдельно от инфраструктуры и поиска. LLM это всего лишь часть огромного механизма. И это не самая главная часть.

Кашу маслом не испортишь

Ещё один важный аспект. Для самого хорошего ответа, не идеального, а именно хорошего, нужно использовать не одну LLM. Одна модель упрётся в знания своих поисковых инструментов. Тех, что имеются в арсенале конкретной корпорации.

  • Alphabet — Google Search

  • Microsoft — Bing Search

  • Baidu — Baidu Search

  • ByteDance — Doubao Search

  • Alibaba — Quark Search

  • Tencent — WeChat Search

  • Meta — Meta AI Search

  • NAVER — Naver Search

  • xAI — X Search

  • Moonshot AI — Kimi Search

У каждой поисковой системы свои слепые пятна, свои эксклюзивные доступы к разным БД. Для действительно хорошего ответа лучше всего использовать связки этих инструментов (свежее исследование 2026 года по ансамблям и роутингу агентов — arXiv:2606.28925). Лично мой любимый микс это два китайца и два американца. Желательно ещё и уточнять информацию, кто в какой сфере действительно силён и имеет самые хорошие БД.

Рынок труда

Разумеется, я должен в этой статье сделать некий вывод, полезный читателям. И такой вывод есть — следите за трендами, следите за деньгами в бигтехе, следите за работодателями. Сейчас деньги уходят из сектора обучения моделей в сектор поиска и доставки информации (статистика по вакансиям и бюджетам есть в Stanford AI Index Report).

Наблюдаемый тренд 2023 → 2026:

  • 2023: базовый спрос — специалисты по ML/AI.

  • 2024: быстро растёт спрос на Data Engineering и специалистов, связывающих AI с данными.

  • 2025: к LLM‑компетенциям массово добавляются RAG, retrieval, data pipelines и evaluation.

  • 2026: AI/ML и Data/Retrieval‑компетенции всё сильнее срастаются в единый инженерный стек.

Также сейчас уже чётко видно, что нужны специалисты, которые не просто работают с сырыми данными. Растёт спрос на тех, кто научит сами модели генерировать качественные синтетические данные, умеет жёстко фильтровать результат от шлака и в правильных пропорциях замешивать этот дата‑микс при обучении новых моделей, не допуская деградации.

Комментарии (0)