В октябре 2025-го Андрей Карпатый выложил nanochat — «лучший ChatGPT, который можно купить за $100»: полный пайплайн от токенизатора до веб-чата, четыре часа на арендованной ноде. Еще в декабре 2024-го DeepSeek опубликовал техотчет V3 с цифрой $5,576 млн за обучение. А в конце января 2025-го, на волне выхода R1, заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней трясли и прессу, и биржу. А два дня назад прямо здесь, на Хабре, вышла habrGPT — модель 0.5B, обученная с нуля на статьях Хабра на одной RTX 5090, с претрейном за ~6 часов.

Все три цифры честные. И все три почти ничего не говорят о том, сколько стоит обучить языковую модель — потому что за словами «обучить LLM» прячется лестница в семь порядков: от десятков долларов до миллиарда. На каждой ступени за деньги покупают разное, и путать ступени дорого. Я работаю CTO ML-команды, и выбор «взять открытые веса / дообучить / обучить с нуля» — это расчет, который мы проделываем регулярно. Ниже — вся лестница с числами и первоисточниками: что реально обучить на игровой карте под столом, где начинается аренда кластера, из чего складывается смета фронтир-модели и какие грабли задокументированы на каждом этаже.

Сразу разведу два слова, которые на Хабре постоянно склеиваются. Обучение с нуля (pretraining) — это когда веса инициализируются случайным шумом и модель с чистого листа прогоняют через триллионы токенов текста. Дообучение (fine-tuning, LoRA и прочее) — когда берут готовые веса и дообучают на своих данных; это на два-три порядка дешевле, и половина статей «как я обучил GPT дома» на самом деле про него. Входящие запросы «обучите нам свою модель» после первого созвона тоже почти всегда оказываются про файнтюн. Здесь — только про «с нуля». Если ваша задача звучит как «чтобы модель знала наши документы», вам почти наверняка нужен файнтюн или RAG, и дальше можно читать из чистого любопытства.

Салфетка: как посчитать любую модель

Вся экономика претрейна выводится из одной формулы. Стоимость обучения трансформера в операциях с плавающей точкой:

C ≈ 6 · N · D

где N — число параметров, D — число токенов обучения. Множитель шесть складывается так: примерно 2 FLOP на параметр на токен в forward-проходе, и еще вдвое больше в backward. Формула — из работы Kaplan et al. 2020 (раздел 2.1, оценка без учета embedding и attention-членов), и ее же использует Epoch AI как основной способ оценивать компьют чужих моделей, когда известны параметры и данные. Для MoE-моделей (mixture of experts: на каждом токене работает только часть весов) N — это активные параметры; эмпирически множитель гуляет в диапазоне 5–8, но для сметы на салфетке шестерки достаточно.

Дальше два действия. Делим C на реальную скорость железа, получаем секунды. Умножаем на цену часа, получаем деньги. Реальная скорость — это пиковые TFLOPS карты, умноженные на MFU (model FLOPs utilization) — долю пика, которая идет в полезные вычисления модели; остальное тонет в обменах по сети, пузырях пайплайна, рекомпутации активаций и ожидании отстающих нод. Ориентиры из практики: GPT-3 в 2020-м обучалась с MFU 21,3%, PaLM в 2022-м — 46,2% (таблица из статьи PaLM), MegaScale от ByteDance выжал 55,2% на 12 288 GPU, а на одной ноде без сетевых потерь llm.c держит около 60%. Закладывайте 40–50% и не сильно ошибетесь.

Проверим формулу на известном ответе. GPT-2 124M на 10 млрд токенов: 6 × 124e6 × 10e9 ≈ 7,4e18 FLOP. Нода 8×A100 при 60% MFU дает ~1,5e15 FLOP/с — получается ~83 минуты. Фактический результат llm.c — 90 минут и ~$20; этим же приемом ниже будем проверять чужие пресс-релизы. Эту салфетку я рисую в каждом втором пресейле, когда приходят с «хотим свою LLM»: шесть-эн-дэ, посчитанное маркером прямо при заказчике, отрезвляет быстрее любого слайда про риски.

Второй столп экономики — сколько токенов вообще нужно. Chinchilla (DeepMind, 2022) вывела compute-optimal пропорцию: ~20 токенов на параметр, и модели того времени оказались, по формулировке авторов, «significantly undertrained». С тех пор пропорция уехала на порядки — и осознанно: обучение платится один раз, инференс — миллиарды раз, поэтому выгодно брать модель поменьше и заливать в нее данных сильно больше оптимума. Llama 3 8B обучена на 15+ трлн токенов — ~1875 токенов на параметр, в 90 раз дальше Chinchilla, и качество продолжало расти. Формализация этой логики — inference-optimal скейлинг. Цену модели, выходит, задает в основном D — а данные нынче меряют триллионами.

Карта лестницы, по которой пойдем (все цифры разобраны ниже по тексту):

Ярус

Железо

Что получается

Порядок цены

1. Дом

1× RTX 5090

GPT-2-класс, «связный текст»

$30–700 (аренда — от $10)

2. Нода

8× H100, часы–сутки

nanochat-класс, «детсадовец с энциклопедией»

$50–1000

3. Малый кластер

сотни–тысяча GPU, недели–месяцы

продовые 3–30B (SmolLM3, OLMo)

$0,5–3 млн

4. Большой кластер

тысячи GPU, месяцы

DeepSeek-V3-класс

$6–20 млн за ран, миллиарды капекса

5. Фронтир

16К–100К+ GPU

GPT-4/5, Gemini, Grok

$40 млн — $1 млрд+

«лестница ярусов»: логарифмическая ось долларов от $40 до $1B
«лестница ярусов»: логарифмическая ось долларов от $40 до $1B

Голая модель — это Т9

Прежде чем считать деньги дальше, надо ответить на вопрос, что именно получаешь за них сразу после претрейна. Потому что получаешь — Т9. Очень дорогой, очень начитанный Т9. Это разграничение мне приходится проговаривать почти в каждом разговоре, где «обучить свою LLM» и «сделать чат-бота» считают одной задачей, — между ними два-три порядка бюджета.

Базовая модель после претрейна умеет ровно одно: продолжать текст так, как он статистически продолжался бы в ее обучающем корпусе. Напишете ей «Привет» — и вместо ответа получите «— сказала Маша и закрыла дверь»: модель дописывает документ, в который вы, с ее точки зрения, попали, а в интернет-текстах после реплики в кавычках обычно идет ремарка из художки, продолжение форумного треда или еще десяток реплик подряд. Карпатый формулирует это одной строкой: «Base models are not assistants, they just want to complete internet documents». Документация HuggingFace говорит то же самое суше: чат-модели — это все еще языковые модели, чат для них — просто особый вид текста.

Классическое демо — из анонса InstructGPT (OpenAI, 2022). Промпт: «Объясни шестилетнему ребенку высадку на Луну в нескольких предложениях». Голая GPT-3 отвечает… еще несколькими похожими заданиями: «Объясни шестилетнему теорию гравитации», «Объясни шестилетнему теорию относительности». Логика та же: в вебе списки упражнений встречаются чаще, чем упражнение с готовым ответом под ним, и модель просто продолжила самый вероятный документ. На этом же свойстве стоит few-shot промптинг из статьи GPT-3: показываешь три примера «вход → выход», и модель продолжает паттерн, без всякого дообучения.

Ассистентом эту дополнялку делает пост-трейнинг, и его механика проще, чем звучит.

Шаг первый — SFT, supervised fine-tuning. Модели показывают десятки тысяч примеров документов одного специального жанра: «реплика пользователя → реплика вежливого и полезного помощника». Жанр она схватывает так же, как схватила стиль художки и форумов. Теперь на «Привет» она дополняет текст репликой персонажа-ассистента: «Привет! Чем могу помочь?» Под капотом ничего не поменялось — это тот же Т9, просто ему подсунули документ, в котором следующим по сценарию пишет помощник.

Шаг второй — RLHF, обучение с подкреплением на человеческих предпочтениях. SFT задает роль, RL шлифует, какие именно реплики этой роли предпочитать. Люди попарно сравнивают ответы модели, на сравнениях учится reward-модель — функция «насколько такой ответ понравился бы человеку», — и дальше основную модель дообучают подкреплением так, чтобы этот сигнал рос (канонический разбор пайплайна). Модель начинает играть роль ассистента, смещаясь от среднего по датасету к лучшим, по оценкам людей, примерам.

Цифры под этот тезис в статье InstructGPT выписаны прямо. Датасеты пост-трейна: ~13 тыс. промптов на SFT, ~33 тыс. на reward-модель, ~31 тыс. на RL — против сотен миллиардов токенов претрейна. Компьют: SFT для 175B-модели — 4,9 петафлопс-дней, RLHF — 60, претрейн GPT-3 — 3640. Вся «личность» ассистента — менее 2% вычислений, тонкая пленка поверх толщи претрейна. И эффект этой пленки поразительный: ответы InstructGPT со скромными 1,3 млрд параметров люди предпочитали ответам голой GPT-3 со 175 миллиардами — модели, в сто раз большей (оговорка: на распределении реальных запросов к API, где важна полезность ответа; на академических бенчмарках картина скромнее). Почти весь бюджет уходит в знания; «личность» ассистента докупается процентами сверху.

Технически «диалог» так и остается одним сплошным текстом. Переписка с чат-ботом склеивается в документ со служебными токенами — в духе <|im_start|>user … <|im_end|> <|im_start|>assistant (формат ChatML; разметка у всех своя, поэтому HuggingFace завел chat templates), — и модель дополняет его после токена assistant. Ассистент — персонаж сценария, системный промпт — задание этому персонажу, а сама базовая модель — симулятор, умеющий играть кого угодно; по моему опыту, эта рамка объясняет поведение LLM в проде лучше любой другой.

У истории есть свежее продолжение — RL с проверяемыми наградами, RLVR. В январе 2025-го DeepSeek показал R1-Zero: подкрепление применили прямо к базовой модели, минуя SFT, с наградой за проверяемо правильный ответ (математика, код). Точность на олимпиадной математике AIME выросла с 15,6% до 71%, а по ходу обучения модель спонтанно выучила перепроверять саму себя — в статье приведен момент, когда она посреди решения пишет «Wait, wait. Wait. That's an aha moment I can flag here» и начинает заново, хотя специально этому ее никто не учил.

Правда, разговаривала R1-Zero как гений с расстройством речи — мешала английский с китайским и писала нечитаемо, поэтому в финальный R1 вернули SFT-фазу с читабельными цепочками рассуждений. Даже когда RL работает на голой базе, человеческий интерфейс модели все равно делает SFT. Цена вопроса — по данным самой DeepSeek в рецензируемой публикации в Nature: финальные прогоны всего R1-пайплайна поверх готовой V3 — около $294 тыс. против ~$5,6 млн за базу (та же бухгалтерия «только финальный ран», что и у цифры V3). Пять процентов сверху — за превращение Т9 в рассуждающего собеседника.

Когда дальше по тексту написано «обучить LLM с нуля стоит X», читайте: X — это цена претрейна, цена базы. Пост-трейн добавит проценты компьюта (и заметные деньги на человеческую разметку, если делать ее как следует). Дешевым «превращением в чат-бота» и пользуется nanochat, к которому мы возвращаемся — уже с калькулятором в руках.

Ярусы 1–2: RTX 5090 под столом и нода в аренду

Начнем с голых спеков. RTX 5090: 32 ГБ GDDR7 на 512-битной шине, 1792 ГБ/с пропускной способности памяти, ~105 TFLOPS в FP32 и порядка 210 TFLOPS плотного BF16 на тензорных ядрах, 575 Вт TDP, рекомендованная цена $1999. Маркетинговые «3352 AI TOPS» с презентаций — это FP4 со sparsity; для претрейна ориентируйтесь на BF16-цифру, она в шестнадцать раз скромнее.

Первый потолок домашнего претрейна — память, и он считается на пальцах. Классический рецепт mixed-precision AdamW требует ~16 байт на параметр: 2 байта на вес в BF16, 2 на градиент, и 12 на состояния оптимизатора (FP32-копия весов плюс два момента Adam). В 32 ГБ таким образом влезает модель на ~2 млрд параметров — и это еще до активаций, которые при длинном контексте съедают память со зверским аппетитом. Планку двигают gradient checkpointing (память в обмен на повторный forward — примерно треть компьюта сверху) и 8-битные оптимизаторы; крайняя точка трюкачества — LLMQ, полностью 8-битный претрейн, в котором 7B-модель влезает на одну 16-гиговую игровую карту. Влезть-то влезает, но считаться будет месяцами: трюки памяти всегда платят временем.

Что на этом железе реально обучить, удобно показывать лестницей учебных проектов Карпатого — она вся открыта и повторяема.

nanoGPT — минимальный учебный претрейн-скрипт, по которому разбираются в архитектуре трансформера. Построчные разборы уже есть на Хабре, не буду отнимать хлеб.

llm.c — тот же GPT-2, переписанный в ~5 тыс. строк C/CUDA. Репродукция GPT-2 124M: 90 минут на ноде 8×A100 и ~$20 аренды (10 млрд токенов FineWeb, ~60% MFU). Репродукция флагманского GPT-2 1.6B — 24 часа на 8×H100 и $672. Для одной 5090 масштаб такой: комьюнити-спидран воспроизводит GPT-2 124M за ~90–115 минут на одной RTX 4090; 5090 по BF16-мощности на четверть-треть быстрее, так что «GPT-2 за вечер на своей карте» — консервативная оценка, без всякой поэтической вольности.

nanochat — полный конвейер ChatGPT-клона в ~8 тыс. строк: свой токенизатор, претрейн на FineWeb-Edu, SFT-диалоги, опциональный RL на школьной математике, инференс с веб-мордой. Тот самый «ChatGPT за $100»: релизный спидран — 3 часа 51 минута на 8×H100 по ~$24/час, итого ~$92. Разбивка времени внутри рана возвращает к прошлому разделу: часы уходят на претрейн базы, стадия «сделать из Т9 собеседника» (midtraining на диалогах + SFT) занимает минуты. Качество за эти деньги Карпатый описывает как «разговор с детсадовцем»: связная речь, зачатки здравого смысла, уверенные галлюцинации. По метрике CORE (агрегат из двух десятков бенчмарков для базовых моделей из проекта DCLM) релизная модель обходила GPT-2 large, но до полного GPT-2 1.6B не дотягивала; к 2026-му спидраны добрались и до него — об этом ниже.

На одной 5090 nanochat тоже живет — README прямо описывает деградацию на gradient accumulation (градиенты мелких батчей копятся в один шаг оптимизатора — эмуляция большого батча на маленькой карте) с «теми же результатами, но в 8 раз дольше». Практика из обсуждений репозитория: полный спидран на одной 5090 экстраполировали в ~17 дней (ран не довели до конца), на двух картах после твиков — оценка ~28 часов, причем device batch size пришлось резать с 32 до 8, а чтобы параллельно жил открытый браузер — до 4. Уменьшенный конфиг d16 на арендованной 5090 за ~$0,35/час оценивают в 10–30 часов до «приличного результата». Быт домашнего претрейна в одной строке коммита: закрой Chrome, освободи VRAM.

Свежая habrGPT на практике выяснила, что TMEM, нужная FlashAttention 3, физически есть только в серверном Blackwell — на потребительской 5090 расчет на FA3 «разрушился». Потребительская и датацентровая карты одного поколения — разные звери. Мы этот класс граблей регулярно ловим с другой стороны, в CV: отлаженное на облачной A100 ведет себя иначе на железке, которая реально поедет в цех, — поэтому тесты гоняем на том железе, где будет жить прод.

Отдельного разговора стоит динамика цен. Обучение GPT-2 в 2019-м оценивали в десятки тысяч долларов (широко цитируемая оценка — ~$43 тыс.; OpenAI официальную цифру не публиковал). Дальше кривая пошла вниз без остановок: $672 за полный 1.6B в llm.c (2024) → $73 за nanochat-модель, побившую GPT-2 по CORE (3 часа на 8×H100, январь 2026) → ~$40–50 к лету 2026-го на FP8 и более плотных датасетах, по комьюнити-лидерборду Time-to-GPT-2 в README nanochat. Сам Карпатый сформулировал эмпирический закон: цена обучения GPT-2 каждый год падает примерно до 40% прошлогодней. А в жанре «124M до фиксированного лосса» параллельный спидран modded-nanogpt дожал время до 1,32 минуты на 8×H100 — сорок центов аренды за то, что в 2019-м было state of the art. Из этого же лидерборда вырос оптимизатор Muon, уехавший потом в серьезные продовые претрейны: гаражные спидраны иногда меняют индустрию.

иллюстрация 2 — график дефляции GPT-2: лог-ось Y в долларах
иллюстрация 2 — график дефляции GPT-2: лог-ось Y в долларах

Остался вопрос, что за модель получается за эти деньги. Связную грамотную речь выдают даже крошечные модели — TinyStories показала это на моделях меньше 10 млн параметров, обученных на узком синтетическом корпусе с детским словарем. Связность — дешевая эмерджентность. Бюджет уходит на другое: широту знаний, устойчивость к формулировкам, следование инструкциям, редкость галлюцинаций. Между «моделью, которая складно пишет» и «моделью, которой можно доверить задачу» лежит разрыв в три-четыре порядка бюджета. И это главный ответ на вопрос «зачем кому-то кластеры, если GPT-2 обучается за вечер».

Почему нельзя собрать кластер из десяти ПК

Идея напрашивается сама — я слышал ее и от джунов, и от заказчиков, у которых после пилота простаивает пара машин с GPU: если одна 5090 — это GPT-2 за вечер, то десять машин у друзей — уже почти нода. Посчитаем, обо что это разбивается.

При data-параллелизме — самом простом способе распределить обучение — каждая карта держит копию модели и считает свой кусок батча, но после каждого шага все карты обязаны обменяться градиентами и усреднить их. Объем обмена — порядка размера модели, у ring all-reduce — стандартной кольцевой схемы такого обмена — примерно двукратный объем градиентов за шаг. Для модели на 1 млрд параметров в BF16 это ~4 ГБ трафика на каждый шаг оптимизатора, а шагов в претрейне — сотни тысяч.

Теперь полки, по которым этот трафик ездит. NVLink 4 внутри серверной ноды H100 — 900 ГБ/с суммарной полосы на GPU. InfiniBand NDR между нодами — 400 Гбит/с ≈ 50 ГБ/с на порт. Домашний гигабитный Ethernet — 0,125 ГБ/с. Между первым и последним — три-четыре порядка. На гигабите обмен четырьмя гигабайтами занимает полминуты, за которые карта успела бы посчитать десятки шагов: GPU в такой схеме простаивают почти все время, и десять машин по сети дают производительность заметно ниже одной. Плюс у потребительских карт NVIDIA срезала NVLink еще на поколении 4090 — две 5090 в одном корпусе общаются только через PCIe, так что даже «мини-DGX на столе» упирается в шину.

Известное исключение — INTELLECT-1: модель 10B обучили целиком через интернет на 112 H100, раскиданных по трем континентам. Фокус в алгоритме DiLoCo: внутренние шаги локальны, синхронизация редкая, плюс int8-сжатие обменов — суммарно ~400-кратное сокращение трафика против наивного all-reduce, и все равно MFU вышел 36–41% — заметно ниже тех 50–60%, что то же железо выдает в одном машинном зале. Распределенный претрейн через интернет существует — как спецтехника с фундаментально другой математикой; наивный all-reduce по Wi-Fi превращает десять видеокарт в обогреватели с подпиской на роутер.

Для полноты — словарь параллелизмов одним абзацем, потому что дальше он понадобится. Data parallelism: копии модели, синхронизация градиентов. Tensor parallelism: режем сами матрицы между картами — общение на каждом слое, живет только на NVLink. Pipeline parallelism: режем модель по слоям на этапы конвейера — дешевле по трафику, платим «пузырями» в расписании. FSDP/ZeRO: шардируем веса и состояния оптимизатора по картам, чтобы 16 байт на параметр делились на весь кластер (ZeRO). Фронтир-раны комбинируют все сразу — Llama 3 обучалась с 4D-параллелизмом. Дома из этого зоопарка не нужно ничего: ваш параллелизм на одной карте называется gradient accumulation.

Ярус 3: маленькая продовая модель

Между «GPT-2 за вечер» и фронтиром лежит ярус, о котором пишут реже всего, — модели 1–7B, которые реально ставят в продукты. Здесь спидраны сменяются взрослой бухгалтерией, и благодаря двум командам, выложившим ее в открытую, мы знаем эту бухгалтерию в деталях.

Первое, что меняется, — данные. Compute-optimal по Chinchilla для трехмиллиардной модели — ~60 млрд токенов. Реальные продовые модели этого размера обучаются на порядки дальше: SmolLM2 135M — 2 трлн токенов, 1.7B — 11 трлн (техотчет). Причина — та самая inference-optimal логика: маленькую модель, которую будут дергать миллиарды раз, выгодно кормить до упора. 11 трлн токенов на одной 5090 — это годы непрерывного счета; ярус 3B начинается с аренды сотен GPU.

11,2 трлн токенов, 384 H100 и почти месяц — ~276 тыс. GPU-часов основного рана: так выглядит смета SmolLM3-3B от Hugging Face (июль 2025). Самое ценное в их Smol Training Playbook — цифра, которую обычно прячут: абляции (контрольные прогоны, где меняют один фактор — данные, архитектуру, гиперпараметр — и смотрят на эффект), калибровка и дебаг съели еще ~161 тыс. GPU-часов — «больше половины стоимости основного рана», дословно по плейбуку.

Там же задокументирован баг, который я бы вставлял в рамочку в каждом учебнике распределенного обучения. Все GPU внутри tensor-parallel-группы инициализировались одним random seed. Веса получились коррелированными там, где обязаны быть независимыми. На кривой лосса — ничего: она падала как положено, обучение выглядело здоровым. Проблема всплыла на даунстрим-евалах, когда в ран уже влили ~1 трлн токенов. Перезапустили с нуля. Один невинный seed — минус триллион токенов бюджета; дешевая страховка от такого — гонять евалы с первых часов рана, чем команда себя и спасла. Вторая их находка скучнее, но типичнее: кастомный даталоадер с растущим внутренним индексом периодически ронял throughput, и его в итоге откатили на проверенный из прошлого проекта. Правило масштабируется на любой размер: когда у нас проседает скорость обучения, первым подозреваемым идет даталоадер, вторым — сеть до хранилища, и только потом сама модель.

Самый прозрачный претрейн современности выложила Ai2 в ноябре 2025-го: у Olmo 3 открыты веса, данные, код, чекпоинты и логи. По техрепорту, полный цикл 32B-модели — 56 дней на кластере 1024 H100, что сама Ai2 конвертирует по ставке $2/H100-час в $2,75 млн (претрейн + мид-трейн + long-context + пост-трейн, включая рестарты). Чистый претрейн — цифры, которые команда назвала отдельно (разбор с арифметикой): 234 тыс. H100-часов у 7B ($0,47 млн) и 1,05 млн у 32B ($2,1 млн). Это конверсия по рыночной ставке аренды, без раннего экспериментирования и зарплат. Ai2 раскрыла и энергетику: ~146 МВт·ч на претрейн 7B и ~681 МВт·ч на 32B — только сами GPU, без учета остальной системы и охлаждения. Продовая модель 3–30B под ключ, выходит, — от полумиллиона до трех миллионов долларов аренды, месяц-два календаря и скрытая половина бюджета на абляции, о которой не пишут в анонсах; данные при этом — бесплатные открытые корпуса.

Ярусы 4–5: большой кластер и фронтир, или как читать чужие сметы

Здесь начинается территория, где цифры публикуют пресс-службы, и главный навык — понимать, что именно в цифру вошло. Сразу зафиксирую позицию: фронтир-раны я видел только в чужих техотчетах — эту часть лестницы считаю со стороны заказчика, с калькулятором и первоисточниками, а не изнутри лаборатории. Потому и ссылок здесь столько: опыт, которого у меня нет, заменяю проверяемыми цифрами.

Эталонный случай — техотчет DeepSeek-V3: 2,788 млн GPU-часов H800, при ставке $2/час — те самые $5,576 млн. Внутри: 2,664 млн часов претрейна (14,8 трлн токенов, меньше двух месяцев на кластере 2048 H800), 119 тыс. на расширение контекста, 5 тыс. на пост-трейн. А теперь дословная оговорка из того же отчета, которую потеряли все заголовки: цифра покрывает «only the official training of DeepSeek-V3, excluding the costs associated with prior research and ablation experiments on architectures, algorithms, or data». В цифру вошел только финальный ран — без исследований, без абляций (у SmolLM3 это была половина бюджета), без зарплат и без железа. Причем $2/час — это гипотетическая аренда: кластер у компании собственный.

SemiAnalysis оценивал парк DeepSeek/High-Flyer в ~50 тыс. GPU семейства Hopper с серверным капексом ~$1,6 млрд — оценка спорная, но порядок разрыва между «ценой рана» и «ценой возможности его запустить» она передает верно. «Модель за $6 млн» и «компания с миллиардной инфраструктурой» — оба утверждения правдивы одновременно.

Тот же навык чтения применим к любой цифре из новостей. Стоимость обучения GPT-4: ~$40 млн амортизированного железа и энергии по методике Epoch AI, ~$63 млн за претрейн по оценке SemiAnalysis (~25 тыс. A100, 90–100 дней), ~$78 млн в пересчете на облачную аренду по Stanford AI Index, «больше ста миллионов» со слов Альтмана. Все четыре цифры об одной модели — просто меряют разное. Когда видите точную цифру стоимости обучения без указания методики, вы видите маркетинг.

Оговорка о периметре: все здесь посчитано в NVIDIA-часах, потому что по ним существует рынок аренды и публичные ставки. TPU Google и Trainium Amazon живут внутри своих облаков, наружных цен у них нет — но салфетка 6·N·D работает и для них.

Llama 3 405B обучалась на до 16 384 H100 одновременно — 15,6 трлн токенов, 3,8×10²⁵ FLOP; по нашей салфетке из первого раздела при $2–4 за H100-час это десятки миллионов долларов только аренды финального рана. ~$490 млн — оценка Epoch AI для Grok 4, с большой оговоркой о неопределенности. Тренд Epoch по всем фронтир-моделям: амортизированная стоимость крупнейших ранов растет ~2,4× в год, и при его сохранении раны за миллиард долларов — вопрос 2027 года. Из чего складывается полная стоимость разработки: 47–67% — железо, 29–49% — люди (включая опционы), и лишь 2–6% — электричество. Вопреки интуиции «нейросети жгут деньги в розетку», главные статьи — амортизация ускорителей и зарплатная ведомость исследователей.

Сам кластер на 100 тыс. H100 SemiAnalysis разобрал по косточкам: свыше $4 млрд серверного капекса, больше 150 МВт потребления, ~1,59 ТВт·ч электричества в год — около $124 млн, то есть порядка 3% от капекса серверов. Узкое место фронтира — доступ к железу и мощности подключения, счет за свет на этом фоне погрешность. Темпы стройки задал xAI Colossus: 100 тыс. H100 подняли за 122 дня в бывшем заводе Electrolux, еще столько же — за следующие 92 дня.

И свежий поворот 2026 года, важный для всей этой лестницы: по оценкам Epoch AI, GPT-5 обучена на меньшем компьюте, чем GPT-4.5 — ~5×10²⁵ FLOP против >10²⁶. По этим оценкам, впервые флагман вышел «дешевле» предшественника по претрейну: бюджеты поехали из претрейна в RL-пост-трейнинг и данные. Гонка масштабов продолжается, но ее центр тяжести сместился. И это стоит держать в голове, планируя что-то на годы вперед.

Как оно ломается: хроники с больших кластеров

Все, что выше, — бухгалтерия мирного времени; дальше — что происходит на кластере, когда претрейн идет неделями. Мой личный потолок — многосуточные раны RL и CV на куда меньшем железе, но главное оттуда переносится один в один: раны гибнут от диска, драйвера, сети и даталоадера куда чаще, чем от математики. Ниже — та же болезнь в масштабе, где ее не вылечишь перезапуском перед сном.

Логбук OPT-175B (Meta, 2021–2022, ~тысяча A100) — сырые вахтенные записи команды, читаются как производственный триллер. По оценке команды, из строя выходило порядка двух машин ежедневно. В статье OPT итог за два месяца: не менее 35 ручных рестартов, свыше сотни хостов отправлено в перезагрузку.

21 декабря 2021-го саппорт облачного провайдера случайно удалил весь кластер — целиком; восстановили в тот же день, но 16 машин не прошли проверки, и буферный пул добирали еще двое суток. Между Рождеством и Новым годом автоматика молча пережила восемь аппаратных сбоев. По ходу запуска команда успела попробовать сменить оптимизатор на SGD (вернулись к Adam) и случайно обновить Megatron посреди обучения, заметно изменив динамику лосса. Претрейн такого масштаба — вахтенная служба, где модель доплывает вопреки.

Спайки лосса — фирменная жуть больших ранов. У PaLM 540B лосс внезапно взлетал ~20 раз за обучение, несмотря на gradient clipping; на меньших моделях с теми же данными эффект не воспроизводился. Рабочее лечение — машина времени: откат на чекпоинт за ~100 шагов до спайка и пропуск 200–500 батчей вокруг. Разгадка тянула на детектив: по отдельности не были виноваты ни данные, ни веса — те же батчи, скормленные с более раннего чекпоинта, спайка не давали; стреляла комбинация конкретных данных с конкретным состоянием модели. Google в статье признал прямым текстом, что принципиальной стратегии против спайков у команды нет. Позже OLMo 2 нашла статистического подозреваемого: спайки коррелируют с документами, содержащими длинные повторы n-грамм, — и такие документы теперь вычищают на этапе данных.

Отказы железа на масштабе лучше всего оцифрованы в статье Llama 3. За 54-дневный срез претрейна на 16 384 H100 — 466 прерываний джоба, из них 419 внезапных: незапланированный сбой в среднем каждые три часа. Виновники: сбойные GPU — 30,1% случаев, память HBM3 — 17,2%, софт — 12,9%, сеть — 8,4%. CPU за тот же период отказали дважды. При этом effective training time удержали выше 90%, а серьезное ручное вмешательство понадобилось трижды — остальное разгребла автоматика чекпоинтов и рестартов. Физика тоже вмешивается: в жаркие часы дня пропускная способность кластера проседала на 1–2% из-за термотроттлинга GPU, а синхронные старты и остановки шестнадцати тысяч карт качали потребление датацентра на десятки мегаватт.

Железо, которое врет молча. Помимо громких отказов существуют тихие: silent data corruption, когда ядро процессора изредка возвращает неверный результат без единой ошибки в логах. Google описал это в «Cores that don't count», Meta — в исследовании своего флота; на масштабе в сотни тысяч чипов «фантомные» ядра — статистическая неизбежность; MegaScale, например, вылавливает такое детерминированным перепроигрыванием подозрительных участков. На одной 5090 без ECC на всех путях данных вы SDC не заметите в принципе — модель просто «сойдется не туда», и винить вы будете гиперпараметры. Сколько раз я сам грешил на learning rate там, где стоило грешить на железо, — статистики, по понятным причинам, не существует.

Токены-зомби. История SolidGoldMagikarp (2023): исследователи нашли в словаре GPT-2/GPT-3 токены, на которых модели вели себя неадекватно — не могли повторить слово, уклонялись, выдавали случайные ответы (на просьбу повторить «SolidGoldMagikarp» модель отвечала «distribute»). Токены оказались никами реддиторов из r/counting и артефактами вроде «BuyableInstoreAndOnline». Реконструкция причины: BPE-токенизатор обучали на одном корпусе (со скрейпом Reddit), модель — на другом, вычищенном; токены остались в словаре, но их эмбеддинги не обучились — призраки в словаре. Систематику потом подтвердили на десятках моделей. Урок для DIY-претрейна дословный: обучайте токенизатор на том же корпусе, что и модель, иначе получите личных Магикарпов.

Легальный чит напоследок. Подбор гиперпараметров для большой модели стоит как несколько ее обучений, если подбирать в лоб. µP / µTransfer (Microsoft/OpenAI) позволяет вытюнить learning rate и компанию на крошечной прокси-модели и перенести на большую zero-shot: авторы затюнили GPT-3 6.7B через прокси на 40M, потратив на тюнинг ~7% стоимости одного претрейна. Это тот редкий случай, когда домашняя 5090 напрямую участвует в большом ране: гиперпараметры будущего кластерного запуска дебажатся на карте под столом.

Данные: топливо, за которое уже заплатили

Хорошая новость домашнего и среднего ярусов: претрейн-данные сегодня бесплатны, потому что сообщество один раз скинулось на их очистку.

Основной корпус открытого претрейна — FineWeb от Hugging Face: на релизе в 2024-м — 15 трлн токенов очищенного английского веба из 96 дампов CommonCrawl, к 2026-му — уже ~18,5 трлн, свежие дампы докидываются регулярно. Лицензия ODC-By, готовые parquet-шарды качаются свободно; в абляциях FineWeb обходил C4, The Pile, RedPajama2 и остальную классику. На нем обучаются и nanochat, и SmolLM, и половина открытых моделей.

Поучительно, сколько инженерии в этом «бесплатно». Отчет FineWeb — обязательное чтение про то, как интуиция врет в data-инженерии. Пример с дедупликацией: интуиция подсказывает, что чем агрессивнее чистишь дубли, тем лучше данные. Команда прогнала глобальный MinHash-дедуп — в старых дампах он выкидывал подавляющую часть контента, — и модели на «идеально чистых» данных стали учиться хуже: выброшенное оказалось в среднем качественнее оставшегося. Рабочей оказалась дедупликация внутри отдельных дампов. Единственный надежный компас в таких вопросах — абляции: обучение мелких моделей на каждом варианте корпуса, десятки прогонов, которые и есть скрытая цена «бесплатного» датасета. Подпишусь из собственной практики: в CV- и RAG-проектах интуиция о «хороших данных» ровно так же не стоит ничего, пока не прогнал контрольный эксперимент. Соседний проект DCLM добавил свою контринтуицию: из 240 трлн сырых токенов CommonCrawl после фильтрации выживает ~1,6%, и лучшим фильтром оказался fastText-классификатор на пару мегабайт, обученный на удачно выбранных положительных примерах, — он обошел куда более хитрые пайплайны.

Прикладное правило для тех, у кого данных мало (домашний ярус, узкие домены): Muennighoff et al. на 400+ моделях показали, что гонять один и тот же датасет до ~4 эпох (полных проходов по нему) почти так же полезно, как иметь свежие данные. Дальше отдача быстро падает: заметный выигрыш тянется примерно до ~16 эпох и к ~40 практически сходит на нет.

Растущая ветка — синтетика. Серия phi от Microsoft начиналась с «Textbooks Are All You Need»: 1,3B-модель на семи миллиардах «учебниковых» токенов обходила на кодовых бенчмарках модели на порядок больше. Открытый аналог — Cosmopedia: 25 млрд синтетических токенов, сгенерированных большой моделью; генерация заняла 10+ тыс. GPU-часов — по грубой прикидке порядка $1 за миллион токенов, тогда как веб-корпус бесплатен. Синтетика стоит денег, зато позволяет прицельно закрывать дыры, которых в вебе мало: учебные объяснения, пошаговые решения, редкие языки.

Есть и юридический счет — на фронтире он уже сравним со стоимостью железа. По иску авторов книг Anthropic согласилась выплатить $1,5 млрд — около $3000 за каждую из ~482 тыс. книг, скачанных из пиратских библиотек LibGen и PiLiMi. Тонкость, важная для всей индустрии: тот же судья признал само обучение на легально купленных книгах fair use — полтора миллиарда платятся за пиратское скачивание, факт обучения тут ни при чем (финальное одобрение сделки на момент написания еще в процессе). Параллельно данные становятся строкой закупок: Reddit продает доступ Google — сделку оценивали примерно в $60 млн, сделку News Corp с OpenAI СМИ оценивали в $250+ млн за пять лет. Эпоха бесплатных данных заканчивается, но пока только для тех, кто играет на фронтире. Домашнему ярусу FineWeb хватит надолго.

Считаем в рублях

Все выше было в долларах; теперь то же самое в рублях. Цены — снимок на 10 июля 2026-го, источники по ссылкам, волатильность высокая.

Купить карту. RTX 5090 в рознице РФ прошла путь от ~240 тыс. ₽ летом 2025-го до 393–490 тыс. ₽ к весне 2026-го; на сегодня живые позиции — от ~345 тыс. (Palit) до ~510 тыс. (топовые ASUS). Обидная деталь: винить «наценку параллельного импорта» не выйдет — в США стрит-цены 5090 к началу 2026-го доходили до ~$5000 при MSRP $1999, глобальный ИИ-спрос и дефицит памяти уравняли всех. NVIDIA официально не поставляет и не поддерживает GPU в РФ с 2022-го, так что гарантия — только от продавца.

Арендовать. Российские облака (цены — за VM целиком): immers.cloud — RTX 5090 за 130,76 ₽/час, RTX 4090 за 82,76 ₽/час, A100 80GB за 211,77 ₽/час, H100 за 341,77 ₽/час; Интелион — H100 за 299,11 ₽/час или ~201 тыс. ₽/мес. Нода 8×H100 у Cloud.ru — от ~5,36 млн ₽/мес, то есть ~7400 ₽/час; за рубежом аналогичная нода у Lambda стоит ~$32/час ≈ 2600 ₽ (год назад было ~$24 — аренда дорожает) — РФ-премия за большое железо примерно тройная (санкционная логистика в цене чувствуется именно на серверных картах, у игровых ее почти нет). Для справки о мировом рынке: H100 у специализированных провайдеров — $2–4 за GPU-час, причем контрактные цены в 2026-м впервые за годы пошли вверх на волне инференс-бума — рассчитывать на вечную дешевизну аренды я бы не стал.

Розетка. Самая переоцененная статья расходов. Месяц круглосуточного обучения на 5090 при ее полных 575 Вт — 414 кВт·ч, по московскому тарифу ~8 ₽/кВт·ч это ~3300 ₽; со всем системником — ~4900 ₽. На фоне цены самой карты — статистическая погрешность; та же картина, что на фронтире с его 2–6% на электричество. Любителям оптимизации: ночной тариф вдвое ниже.

Купить или арендовать. Простая арифметика: 5090 за ~400 тыс. ₽ против аренды за ~94 тыс. ₽/мес (130,76 ₽ × 720 ч) — карта отбивается за 4–5 месяцев непрерывной загрузки. Для месячного эксперимента с претрейном аренда выигрывает без вариантов; покупка имеет смысл, когда карта нужна еще и для инференса, игр и всего остального, что заполнит простой. И еще: спот-цены на маркетплейсах вроде Vast.ai на 4090/5090 регулярно опускаются ниже 40 ₽/час (та самая 5090 за ~$0,35/час из nanochat-обсуждений — оттуда) — за цену месяца российской аренды там можно прогнать весь nanochat-спидран несколько раз.

Что

Где

Цена

RTX 5090 своя

розница РФ

345–510 тыс. ₽ разово + ~4900 ₽/мес розетка

RTX 5090 аренда

immers.cloud

~94 тыс. ₽/мес (130,76 ₽/ч)

RTX 5090/4090 спот

Vast.ai и аналоги

от ~25–40 ₽/ч

H100 аренда

Интелион / immers

~200–246 тыс. ₽/мес

Нода 8×H100

Cloud.ru

от ~5,36 млн ₽/мес

Нода 8×H100

Lambda (не РФ)

~$32/ч ≈ 1,9 млн ₽/мес

Про стоимость обучения GigaChat и YandexGPT спросят в комментариях — публичных смет нет: Сбер и Яндекс цифр не раскрывают, и любая точная сумма здесь была бы маркетингом (см. раздел про чтение чужих смет).

Моя ставка

Дальше — мнение, отделяю его от фактов.

Кому в 2026-м реально нужен претрейн с нуля. Почти никому — к этому сводится вся лестница выше. Открытые веса плюс файнтюн плюс RAG закрывают, по моей практике, девять задач из десяти за проценты стоимости претрейна. Реальные исключения, где «с нуля» оправдан: свой язык предметной области, которого мало в вебе (специализированный код, биопоследовательности, low-resource языки); жесткие edge-ограничения, под которые выгоднее вырастить маленькую специализированную модель, чем ужимать общую; и суверенитет данных, когда в контур нельзя занести ничьи чужие веса по регуляторике. Если подрядчик предлагает вам «обучить модель с нуля под ваш бизнес» без одного из этих трех оснований — он предлагает вам оплатить его обучение, в обоих смыслах. Говорю как тот самый подрядчик: нам тоже выгоднее продать «свою LLM», чем файнтюн, так что считайте этот абзац показанием против собственного интереса.

Куда едет кривая. Ножницы будут расходиться. Нижний край дешевеет в ~2,5 раза в год (кривая Карпатого), верхний дорожает в ~2,4 раза (кривая Epoch) — редкий рынок, где оба конца движутся так быстро и в противоположные стороны. Между ними растет средний класс открытых моделей — и для инженеров это отличная новость: воспроизводимый претрейн 3–30B за понятные деньги означает, что компетенция перестала быть монополией пяти лабораторий.

Три проверяемых прогноза, по которым меня можно будет поймать за язык:

  1. GPT-2-класс будет стоить дешевле $10 к концу 2028-го. Сигнал для проверки: лидерборд Time-to-GPT-2 в репозитории nanochat.

  2. Контрактная цена H100 не вернется ниже $2/час в 2026-м. Инференс-бум съедает мощности быстрее, чем строятся датацентры. Здесь я могу ошибиться — если предложение Blackwell хлынет на рынок быстрее прогнозов, — но ставлю на дефицит.

  3. Первый публично подтвержденный ран дороже $1 млрд — до конца 2027-го. Тренд 2,4×/год дотягивается до миллиарда ровно к этому сроку.

Что делать лично вам, если руки чешутся. Прогнать nanochat d16 на арендованной 5090 за десять-тридцать долларов — лучшая инвестиция в понимание LLM, которую я могу назвать: за выходные вы руками пройдете весь путь от токенизатора до чат-бота и телом почувствуете, где в этом конвейере деньги. А вот тащить претрейн в продукт стоит только после того, как посчитана салфетка из первого раздела — и сравнена лоб в лоб с файнтюном.

Это моя вторая статья здесь — в первой разбирал, почему роботы за двадцать минут машинного времени учатся ходить — и что мешает им научиться думать. Такие разборы — что почем в ИИ-проектах и где они ломаются — мы с командой пишем в телеграм-канале morana.log; заходите, если жанр по душе.

Комментарии (4)


  1. gythianki
    20.07.2026 13:48

    Тема интересная, но русский вариант читать тяжковато. Видно, что писал ИИ (это ок), но человек не вычитал и не отредактировал. В результате постоянно спотыкаюсь о типичные словосочетания, которые выдаёт ИИ:
    - Куда едет кривая. Ножницы будут расходиться.
    - Железо, которое врет молча.
    - Связность — дешевая эмерджентность.
    - и множество других.
    Также постоянно видны типичные обороты от ИИ: короткие утверждения, противопоставления, множество тире (длинное тире это ок :), но его обилие уже выглядит странно).

    Это приводит к тому, что приходится соображать, что имелось в виду и как это выглядит в англоязычном варианте. Даже если текст модель сраза писала на русском, всё равно видны английские кальки.

    Сам столкнулся с таким при создании серии заметок AI SDLC и RAG. На английском агенты пишут прилично. А вот перевод на русский сделать совсем не просто. GPT 5.6 Sol с High reasoning делать более-менее приличный перевод, если дать ему выверенный промпт. Но "более-менее" это в сравнении с Fable. Да, убирает типичные англицизмы, рубленые формулировки, противопоставления. Но всё равно приходится вычитывать и указывать на тонкости. Пока не получается полностью автоматизировать перевод.


    1. 0xReality Автор
      20.07.2026 13:48

      Благодарю за комментарий! Прям большое спасибо за конструктив. Правда ценю. Но внесу оговорку небольшую. Это не перевод. Писал сразу на русском, материал свой. ИИ использую как помощника по структуре и формулировкам, сам-то я в русском не ахти, а хочется чтоб читалось нормально. Но я согласен с вами, даже когда напрямую пишешь проскакивают моменты. В этот раз не дочистил, каюсь. Про такое уже был заход в прошлой статье, только там просто человечек кричал «нейрослоп» без единого примера(ну точнее примеры были, вот только это были галюцинации нейросети в которую он статью закинул), толку ноль, непонятно что чинить. А вы конкретные обороты показали, это другое дело. Статью дней десять пилил, под конец глаз замылился, свое уже не видишь. Я кстати разные нейронки гоняю и даже свой небольшой тир-лист составил. Gemini по русски, на мой вкус, вообще ужасен. Вот прям нейронка нейронкой. Без тонны промптов из него нормальный текст не вытащить, а с юмором там совсем беда. Claude уже сильно лучше, по-русски пишет неплохо, но всё равно часто чувствуется какая-то неродная речь. А самым живым мне пока кажется ChatGPT. Не знаю, может субъективщина, но он как будто ближе к русскому языку и культуре, обороты у него интереснее и чаще звучат органично.


      1. gythianki
        20.07.2026 13:48

        Я прогонял через Opus, Fable и Sol один и тот же английский текст с одним и тем же промптом в качестве эксперимента. Sol выдал наиболее близкий к естественному русскому вариант. Поэтому я использую Sol как переводчика. Плюс использую дополнительную систему скиллов для редактирования, которую улучшаю по мере нахождения очередных факапов нейронки. Но пока не получилось полностью автоматизировать перевод.

        Вот промпт, который создал для первоначального перевода. При желании можете попробовать на ваших текстах сравнить разные модели. Промпт для чат-сессии, удалите последнюю строку для использования посреди пайплайна.

        Основной посыл промпта — перевод смысла, а не текста. Тогда убираются многие англицизмы, нетипичные идиомы и обороты. Но не все.

        ---- [Prompt to translate to natural Russian from English] ----

        Translate the following text from English into natural, polished Russian, in the style of a professional translator and editor of contemporary IT and technical literature.

        Before translating, silently reconstruct the intended meaning of each sentence in plain language. Determine what abstract or compressed terms refer to concretely in context. In particular, identify the practical meaning behind terms such as scope, setup, context, control, responsibility, access, and architecture rather than automatically replacing them with their closest Russian dictionary equivalents.

        Translate the reconstructed meaning, not the surface wording.

        The Russian text must be immediately understandable to a reader who has not seen the English original. Do not make the reader decode vague abstractions or mentally translate the sentence back into English.

        Prefer concrete and explicit wording when a concise English noun can refer to several practical aspects. For example, depending on context, scope may need to be rendered as the boundaries of the task, the amount of work entrusted to the agent, its responsibilities, authority, access, or degree of autonomy. Combine or unpack such meanings when necessary.

        Avoid calques, translationese, abstract noun chains, and unnatural technical phrasing. Replace English business and technical metaphors, collocations, syntax, and parts of speech with expressions a Russian-speaking technical author would naturally use.

        Freely restructure sentences where necessary. Clarity and idiomatic Russian take priority over lexical correspondence and matching the grammatical structure of the original.

        Preserve the original meaning, tone, concision, rhetorical function, and degree of emphasis. Do not introduce new claims, but make implicit relationships explicit when Russian requires this for immediate comprehension.

        Before producing the answer, silently perform two checks:

        Would a professional Russian technical writer use this wording if writing the passage originally in Russian? Will the intended meaning be clear on the first reading without reference to the English text?

        If either answer is no, rewrite the translation.

        Do not add explanations, comments, notes, or alternative versions. Output only the final Russian translation.

        Text to translate is attached. Save the result in a markdown file.


  1. ZamirHa
    20.07.2026 13:48

    Хороший обзор, спасибо большое.