В этой статье я рассмотрю несколько тенденций в ИИ‑индустрии, которые не сильно освещаются в СМИ и не вызывают интереса у обычных читателей, но имеют огромный практический смысл. Мы с вами вместе проанализируем статистику за последние годы и разберём эти тенденции.
Центр тяжести в ИИ‑гонке смещается от гонки самих LLM в сторону развития поисковых инструментов и сопутствующей инфраструктуры.
Актуальность ответа LLM критически зависима не столько от данных, полученных при обучении, сколько от качества внешнего поиска и обработки найденной информации.
Уже сейчас связка нескольких, даже не самых мощных LLM, с несколькими независимыми поисковыми источниками может выдавать более актуальный и проверяемый результат, чем одна флагманская модель.
Количество вакансий в ИИ‑сфере растёт, но сама структура специализаций смещается от работы с моделями в сторону умения добывать, готовить и доставлять моделям сырые данные.
Красивая обёртка
Та гонка ИИ‑моделей между IT‑гигантами, что мы наблюдаем в инфополе, по большей части является искусственно созданной маркетинговой мишурой, рассчитанной на массового потребителя и призванной создавать благоприятный инвестиционный климат. Настоящая битва идёт на более глубоком уровне. На уровне поиска и доставки уникальной, актуальной и достоверной информации к LLM. И каждый год сегмент разработки худеет по отношению к общим затратам, а сегмент поиска толстеет. Корпорации понимают, что настоящая ценность не в том, как ИИ обрабатывает информацию, а в том, что она обрабатывает.
Я не утверждаю, что LLM‑гонки не существует или что она не актуальна, я говорю о том, что для обычных людей выбрана наиболее показательная площадка для проведения баталий между корпорациями. Очень удобно отчитываться о том, что выпущена новая модель, и она в пыль разметает старые бенчмарки. Это и красивые яркие образы, и победные заголовки. И нет, это не про очередной заговор корпораций, чтобы отвлечь людей от настоящей гонки. Это про удобство. Гораздо проще показать людям красивый бренд, чем объяснять, что такое краулинг, индексирование, ретривал. Так и создаётся впечатление, что гиганты бьются за первенство среди моделей.
Один из элементов таких показательных баталий — бенчмарки. Но если рассматривать эти бенчмарки абстрагировано, со стороны, то создаётся стойкое ощущение, что среди них много таких, которые созданы не для получения действительно полезных данных, а ради демонстрации хоть каких‑то преимуществ одних моделей перед другими. И я совсем не утверждаю, что они бесполезны в принципе, я говорю о том, что вокруг них создаётся завышенный информационный ажиотаж (косвенное подтверждение — раздел 2 отчёта OECD — Exploring Possible AI Trajectories Through 2030).
Как в реальности финансируются сектора. Поиск сдвигов в финансировании направлений от года к году
Я не имею возможности объять весь рынок. Но я буду опираться на открытые данные топ-10 IT‑гигантов, включая китайских тяжеловесов. Это даст достаточно репрезентативный срез, чтобы увидеть вектор смещения финансирования в область добычи информации.
Объясню мой метод подсчёта, а вы сами решите, валиден ли он. Сразу оговорюсь — я не ищу точных данных до цента, я не делаю бухгалтерский отчёт для корпораций. Я свожу всё к поиску дихотомии «сдвиг есть» или «сдвига нет». Я беру из отчётов совокупные расходы на ИИ шести американских корпораций (Microsoft, Alphabet, Amazon, Meta, Apple, NVIDIA) и четырёх китайских (Alibaba, Tencent, Baidu, ByteDance) за последние пять лет. Частично это отражено в графике № 1, но в самом графике показаны общие данные по всему ИИ‑рынку, я же в расчёты брал цифры именно 10 конкретных корпораций из открытых источников. Разделяю их на три направления. Инфраструктура (дата‑центры, чипы, сети), обучение самих языковых моделей (тренинг, исследовательские лаборатории) и поисковые инструменты (генеративная выдача, RAG, AI‑ответы поверх поиска). Инфраструктура у нас становится общим фоном, так как одни и те же серверы обслуживают и чат‑ботов, и поисковые запросы. Я смотрю не на абсолютные суммы, а на доли в общем бюджете. Смотрю, как доли меняются от года к году. Если доля тренинга падает, а доля поисковиков растёт по соотношению друг к другу, значит, вектор смещения есть, и мы его фиксируем. Если пропорции не меняются, то и вектора нет.
В эти расчёты не вошли многомиллиардные контракты на эксклюзивный доступ к профильным сайтам и базам данных. Reddit, Stack Overflow, медицинские и юридические архивы, лицензии на новостной контент. Во‑первых, компании не раскрывают их в деталях, и они лежат за рамками технологических инвестиций. Во‑вторых, надо отметить, что бюджеты там немалые, но сделаем допущение, что бюджеты из года в год в целом одинаковые. Хотя я уверен, что и эти цифры растут, но не смогу этого доказать.

График показывает, что в «нежелезной» части ИИ‑бюджета, то есть если вычесть дата‑центры и чипы, поисковые инструменты постепенно отжимают долю у обучения моделей. В 2022 году на каждый доллар, потраченный на тренинг, приходилось 39 центов на поиск. К 2026-му это соотношение выросло до 52 центов. Реальный прирост на треть за пять лет. Зелёная часть столбца растёт, белая сжимается. Это значит, что даже в той части бюджета, которая не ушла на инфраструктуру, центр тяжести смещается в сторону поиска.
Актуальная информация против зашитой в модель
«Сначала определи круг достоверных профильных источников по моей теме, затем собери в них актуальную и верифицированную информацию на сегодняшнюю дату по моему запросу. Выведи реальные ссылки на источники. Если не нашёл информацию — ответь, что не нашёл» — именно эта фраза сейчас открывает каждый мой запрос по серьёзной теме при работе в браузере. Этой фразой я активирую поисковые инструменты и заставляю искать не просто информацию по моей теме, а свежую актуальную информацию. Без такого уточнения модели, считая, что знаний в весах достаточно, выдают ответ, который помнят сами или могут выдумать его с честными глазами. Опираться на дефолтные данные — опрометчиво и не очень разумно, даже если у вас в запросах формализованные задачи, такие как написание кода, работа с текстом или с общеизвестными фактами. Языки программирования меняются, человеческий язык обогащается новыми терминами, общеизвестные факты переоцениваются.

Схема показывает, что доступ к актуальной и проверенной информации крайне важен. Флагман любого ИИ‑гиганта проигрывает обычным моделям с более широким доступом. Это понятно на любом уровне логики. Но если мы в этой схеме дадим доступ флагману ко всем видам БД, тут он несомненно уже покажет себя на этапе обработки и анализа полученной информации. Тут станут видны все его достоинства. Что это значит? Это значит, что LLM нельзя рассматривать и сравнивать отдельно от инфраструктуры и поиска. LLM это всего лишь часть огромного механизма. И это не самая главная часть.
Кашу маслом не испортишь
Ещё один важный аспект. Для самого хорошего ответа, не идеального, а именно хорошего, нужно использовать не одну LLM. Одна модель упрётся в знания своих поисковых инструментов. Тех, что имеются в арсенале конкретной корпорации.
Alphabet — Google Search
Microsoft — Bing Search
Baidu — Baidu Search
ByteDance — Doubao Search
Alibaba — Quark Search
Tencent — WeChat Search
Meta — Meta AI Search
NAVER — Naver Search
xAI — X Search
Moonshot AI — Kimi Search
У каждой поисковой системы свои слепые пятна, свои эксклюзивные доступы к разным БД. Для действительно хорошего ответа лучше всего использовать связки этих инструментов (свежее исследование 2026 года по ансамблям и роутингу агентов — arXiv:2606.28925). Лично мой любимый микс это два китайца и два американца. Желательно ещё и уточнять информацию, кто в какой сфере действительно силён и имеет самые хорошие БД.
Рынок труда
Разумеется, я должен в этой статье сделать некий вывод, полезный читателям. И такой вывод есть — следите за трендами, следите за деньгами в бигтехе, следите за работодателями. Сейчас деньги уходят из сектора обучения моделей в сектор поиска и доставки информации (статистика по вакансиям и бюджетам есть в Stanford AI Index Report).
Наблюдаемый тренд 2023 → 2026:
2023: базовый спрос — специалисты по ML/AI.
2024: быстро растёт спрос на Data Engineering и специалистов, связывающих AI с данными.
2025: к LLM‑компетенциям массово добавляются RAG, retrieval, data pipelines и evaluation.
2026: AI/ML и Data/Retrieval‑компетенции всё сильнее срастаются в единый инженерный стек.
Также сейчас уже чётко видно, что нужны специалисты, которые не просто работают с сырыми данными. Растёт спрос на тех, кто научит сами модели генерировать качественные синтетические данные, умеет жёстко фильтровать результат от шлака и в правильных пропорциях замешивать этот дата‑микс при обучении новых моделей, не допуская деградации.