Меня зовут Алексей, я инженер по разработке ПО искусственного интеллекта в YADRO. В ходе статьи я получу подробные ответы на эти вопросы, а помогут в этом YADRO G4208P G3 — производительные серверы для задач ИИ, машинного обучения и глубокой аналитики. В один такой сервер я установлю четыре RTX PRO 6000, в другой — восемь H100 NVL. Оценивать буду на моделях различного размера и архитектуры: Qwen3.6-27B (dense), Qwen3.6-35B-A3B (MoE) в форматах FP8 и NVFP4, а также DeepSeek-V4-Flash в форматах Mixed FP4 и NVFP4. Использую vLLM в сценариях offline и server — vLLM 0.23.0 для Qwen, vLLM 0.26 для DeepSeek-V4-Flash — а также Docker-image на основе nvidia/cuda:13.2.0-cudnndevel-ubuntu22.04.

Конфигурация серверов и тестов
Модель сервера |
G4208P G3 |
|
CPU |
2 x Intel Xeon Gold 6542Y (24 ядра) |
2 x Intel Xeon Gold 6430 (32 ядра) |
GPU |
4 x NVIDIA RTX PRO 6000 Blackwell Server Edition (96 ГБ) |
8 x NVIDIA H100 NVL (94 ГБ) |
RAM |
1536 ГБ (24 x 64 ГБ) |
2048 GB (32 x 64 ГБ) |
SSD |
47 ТБ SATA SSD (3 шт.) |
8,2 ТБ SATA SSD (2 шт.) |
Версия Cuda |
13.2 |
|
Версия драйверов |
595.71.05 |
|
Точные конфигурации запуска моделей:
4 x Qwen3.6-35B-A3B-FP8 |
4 x Qwen3.6-35B-A3B-NVFP4 |
4 x Qwen3.6-27B-FP8 |
4 x Qwen3.6-27B-NVFP4 |
1 x DeepSeek-V4-Flash |
1 x DeepSeek-V4-Flash-NVFP4 |
--tp 1 |
--tp 1 --quantization modelopt_fp4 |
--tp 1 |
--tp 1 --quantization modelopt_fp4 |
--tp 2 |
--tp 2 |
Всего получилось четыре инстанса Qwen и один инстанс DeepSeek-V4-Flash. Запускать буду в режиме multi-instance: поднимать несколько копий модели и объединять их интерфейсы через перенаправление запросов nginx.
Датасеты для тестирования
Тестировать модели буду через синтетические профили нагрузки — prefill-heavy, decode-heavy и balanced — соответствующие трем стандартным сценариям в реальной работе.
Датасет |
Размерности |
Пример задачи |
Prefill-heavy-нагрузки (большой input, короткий output) |
input: 31k output: 1k |
Саммаризация длинного документа (договор, статья). RAG-ответ по большому контексту |
Decode-heavy-нагрузки (короткий input, большой output) |
input: 100 output: 10k |
Генерация статьи/поста по краткому ТЗ, написание кода или тестов по описанию функции |
Balanced-нагрузки (input и output приблизительно равны) |
input: 2500 output: 2000 |
Перевод текста, рерайтинг, рефакторинг фрагмента кода |
Суммарное количество запросов определил из расчета 100 запросов на инстанс модели: получилось четыре инстанса (400 запросов на тест) для Qwen, и один инстанс (100 запросов на тест) для DeepSeek-V4-Flash. При сравнении буду запускать равное число ускорителей в каждом сервере: 4 на 4 — для моделей Qwen, 2 на 2 — для DeepSeek-V4-Flash.
FP8 vs NVFP4: оцениваем качество и производительность
Ключевая особенность RTX PRO 6000 Blackwell Server Edition — это аппаратная поддержка NVFP4, четырехбитного формата весов с двухуровневым масштабированием. NVFP4 предусматривает масштабирующий коэффициент в FP8 на каждый блок из 16 элементов и общий множитель в FP32 на тензор. За счет этого при небольшой потере качества объем весов относительно FP8 сокращается вдвое.
Что это дает на практике? Чтобы оценить это, возьму несколько моделей в NVFP4 и сравню их с версиями тех же моделей в базовом варианте, то есть FP8 или Mixed FP4 (DeepSeek-V4-Flash).
Оценка качества
Для оценки точности использовался инструмент sgl-eval на наборе данных AIMO-2025 — задачах олимпиадного уровня по математике. На этот инструмент есть ссылка в официальных cookbook sglang. Параметры запуска sgl-eval для Qwen взяты со страницы NVIDIA, для DeepSeek — из cookbook sglang:
Параметр |
Qwen3.6-35B-A3B или Qwen3.6-27B |
DeepSeek-V4-Flash |
temperature |
1.0 |
1.0 |
top-p |
0.95 |
1.0 |
n-repeats |
16 |
16 |
max_num_tokens |
81920 |
200000 |
Всего в датасете 30 тестов, accuracy определяется как среднее значение за 16 запусков. На H100 NVL запускали модели Qwen3.6-35B-A3B (FP8) и DeepSeek-V4-Flash (Mixed FP4). На RTX PRO 6000 BSE — Qwen3.6-35B-A3B и DeepSeek-V4-Flash в NVFP4-формате.
|
Модель |
Базовое квантование (H100 NVL), accuracy |
NVFP4-квантование (RTX PRO 6000 BSE), accuracy |
Qwen3.6-35B-A3B |
0,89 (FP8) |
0.89 |
Qwen3.6-27B |
0,92 (FP8) |
0,92 |
DeepSeek-V4-Flash |
0.96 (Mixed FP4) |
0.96 |
Как можно видеть из таблицы, переход на NVFP4 квантизацию не снижает точность вплоть до второго знака в округлении на датасете AIME-2025.
Оценка производительности
Здесь мы оцениваем работу по метрике e2e, модели и условия запуска не меняются.
Датасет Random_100:10k, server-сценарий

Здесь и далее mc — это max_concurrency.
mc |
4 x Qwen3.6-35B-A3B tp1 |
4 x Qwen3.6-27B tp1 |
1 x DeepSeek-V4-Flash tp2 |
||||||
NVFP4, e2e, мс |
FP8, e2e, мс |
Ratio (FP8 / NVFP4) |
NVFP4, e2e, мс |
FP8, e2e, мс |
Ratio (FP8 / NVFP4) |
NVFP4, e2e, мс |
Mixed FP4, e2e, мс |
Ratio (Mixed FP4 / NVFP4) |
|
4 |
42996.7 |
49099.76 |
1.14 |
151918.4 |
217621.6 |
1.43 |
142227.5 |
149080.1 |
1.05 |
8 |
54666.1 |
63646.17 |
1.16 |
165955.6 |
233837.5 |
1.41 |
189829.7 |
204996 |
1.08 |
16 |
60842.5 |
75939.89 |
1.25 |
174028.5 |
243080 |
1.40 |
271955.2 |
304781 |
1.12 |
32 |
79886.23 |
103388.7 |
1.29 |
175124.6 |
249607 |
1.43 |
415937.2 |
460386.1 |
1.11 |
64 |
107890.1 |
143200.6 |
1.33 |
201771.7 |
284951.3 |
1.41 |
563915.9 |
616786.4 |
1.09 |
Датасет Random_2500:2000, server-сценарий

mc |
4 x Qwen3.6-35B-A3B tp1 |
4 x Qwen3.6-27B tp1 |
1 x DeepSeek-V4-Flash tp2 |
||||||
NVFP4, e2e, мс |
FP8, e2e, мс |
Ratio (FP8 / NVFP4) |
NVFP4, e2e, мс |
FP8, e2e, мс |
Ratio (FP8 / NVFP4) |
NVFP4, e2e, мс |
Mixed FP4, e2e, мс |
Ratio (Mixed FP4 / NVFP4) |
|
4 |
9118.844 |
9889.743 |
1.08 |
30787.73 |
44120.36 |
1.43 |
29471.86 |
32180.53 |
1.09 |
8 |
11084.92 |
12841.08 |
1.16 |
33937.4 |
47199.68 |
1.39 |
39936.42 |
43054.13 |
1.08 |
16 |
12399.95 |
15348.66 |
1.24 |
36043.22 |
49483.8 |
1.37 |
62212.48 |
64688.2 |
1.04 |
32 |
16158.93 |
20746.49 |
1.28 |
37357.63 |
50746.23 |
1.36 |
95124.49 |
104050.3 |
1.09 |
64 |
21711.7 |
28554.98 |
1.32 |
44833.97 |
58633.14 |
1.31 |
113055.5 |
121603.5 |
1.08 |
Датасет Random_31k:1k, server-сценарий

mc |
4xQwen3.6-35B-A3B tp1 |
4xQwen3.6-27B tp1 |
1xDeepSeek-V4-Flash tp2 |
||||||
NVFP4, e2e, мс |
FP8, e2e, мс |
Ratio (FP8 / NVFP4) |
NVFP4, e2e, мс |
FP8, e2e, мс |
Ratio (FP8 / NVFP4) |
NVFP4, e2e, мс |
Mixed FP4, e2e, мс |
Ratio (Mixed FP4 / NVFP4) |
|
4 |
6479.866 |
7018.598 |
1.08 |
21909.22 |
27771.54 |
1.27 |
23699,57 |
25284.28 |
1.07 |
8 |
8611.092 |
9344.681 |
1.09 |
29312.12 |
33869.31 |
1.16 |
36812,42 |
39649.21 |
1.08 |
16 |
11959.56 |
13131.24 |
1.10 |
42174.75 |
44805.2 |
1.06 |
65992,7 |
67609.51 |
1.02 |
32 |
19216.36 |
21066.03 |
1.10 |
66391.39 |
64625.95 |
0.97 |
123502,8 |
118639.8 |
0.96 |
64 |
32846.6 |
35337.48 |
1.08 |
118024.3 |
108260.2 |
0.92 |
206549,6 |
217625.5 |
1.05 |
Точность у моделей в базовой и NVFP4-квантизации совпадает до сотых. На decode-heavy и balanced нагрузках модели в NVFP4 показывают лучшую производительность, чем в базовой квантизации: до 43% у Dense модели Qwen3.6-27B и до 33% у MoE-модели Qwen3.6-35B-A3B. На prefill-heavy нагрузках переход на NVFP4 квантизацию не дает большого эффекта.
RTX PRO 6000 BSE vs H100 NVL: сравниваем Perf/$ в server- и offline-сценариях
По спецификации H100 NVL гораздо мощнее RTX PRO 6000 BSE: и по производительности тензорных ядер в FP8 — 3341 против 2000 TFLOPS, и по пропускной способности памяти — 3900 против 1597 ГБ/с. Поэтому разумно сравнить карты по экономической эффективности.
В дальнейших расчетах я буду исходить из того, что H100 NVL дороже RTX PRO 6000 BSE в 1,5 раза. Это примерно соответствует ситуации на рынке в августе 2026 года. Совокупная стоимость серверной конфигурации в дальнейших расчетах не учитывается — только цены GPU.
Экономическую эффективность буду рассчитывать по метрике perf/$. Формула для server-сценария:
Perf/$ = 1,5 / (E2E RTX PRO 6000 BSE / E2E H100 NVL)
Для offline-сценария:
Perf/$ = 1,5 / (Throughput H100 NVL / Throughput RTX PRO 6000 BSE)
Ratio(Perf) больше 1 означает победу RTX PRO 6000 над H100 NVL. Сравнение мы проведем на моделях различного размера и архитектуры (dense и MoE).
Датасет Random_100:10k, server-сценарий

Модели в FP8-квантизации (RTX — NVIDIA RTX PRO 6000 Blackwell Server Edition, H100 — NVIDIA H100 NVL):
mc |
Qwen3.6-35B-A3B-FP8 |
Qwen3.6-27B-FP8 |
DeepSeek-V4-Flash (mixed FP4) |
|||||||||
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
|
4 |
49099.76 |
50551.06 |
0.97 |
1.54 |
217621.6 |
122167.8 |
1.78 |
0.84 |
149080.1 |
117197.1 |
1.27 |
1.18 |
8 |
63646.17 |
53728.81 |
1.18 |
1.27 |
233837.5 |
124696.9 |
1.88 |
0.80 |
204996 |
147843.9 |
1.39 |
1.08 |
16 |
75939.89 |
60243.89 |
1.26 |
1.19 |
243080 |
129949 |
1.87 |
0.80 |
304781 |
204205.6 |
1.49 |
1.01 |
32 |
103388.7 |
73595.91 |
1.40 |
1.07 |
249607 |
142559 |
1.75 |
0.86 |
460386.1 |
301312.3 |
1.53 |
0.98 |
64 |
143200.6 |
98139.8 |
1.46 |
1.03 |
284951.3 |
164483.4 |
1.73 |
0.87 |
616786.4 |
375208.9 |
1.64 |
0.91 |
Модели в NVFP4-квантизации:
mc |
Qwen3.6-35B-A3B |
Qwen3.6-27B |
DeepSeek-V4-Flash |
|||||||||
RTX , e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX , e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
|
4 |
42996.7 |
50551.06 |
0.85 |
1.76 |
151918.4 |
122167.8 |
1.24 |
1.21 |
142227.5 |
117197.1 |
1.21 |
1.24 |
8 |
54666.1 |
53728.81 |
1.02 |
1.47 |
165955.6 |
124696.9 |
1.33 |
1.13 |
189829.7 |
147843.9 |
1.28 |
1.17 |
16 |
60842.5 |
60243.89 |
1.01 |
1.49 |
174028.5 |
129949 |
1.34 |
1.12 |
271955.2 |
204205.6 |
1.33 |
1.13 |
32 |
79886.23 |
73595.91 |
1.09 |
1.38 |
175124.6 |
142559 |
1.23 |
1.22 |
415937.2 |
301312.3 |
1.38 |
1.09 |
64 |
107890.1 |
98139.8 |
1.10 |
1.36 |
201771.7 |
164483.4 |
1.23 |
1.22 |
563915.9 |
375208.9 |
1.50 |
1.00 |
Что видно на decode-heavy-нагрузке:
RTX Pro 6000 BSE показывает наибольшее преимущество по экономической эффективности на модели Qwen-35B-A3B-NVFP4. Средний выигрыш составляет 49%.
Наименьшую эффективность на RTX Pro 6000 BSE мы можем наблюдать на dense-модели Qwen-27B-FP8, в этом случае преимущество на стороне H100 NVL.
С увеличением количества одновременных запросов ускорители по экономической эффективности сближаются.
Датасет Random_2500:2000, server-сценарий

Модели в FP8-квантизации:
mc |
Qwen3.6-35B-A3B-FP8 |
Qwen3.6-27B-FP8 |
DeepSeek-V4-Flash(mixed FP4) |
|||||||||
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
|
4 |
9889.743 |
10211.38 |
0.97 |
1.55 |
44120.36 |
24525.28 |
1.80 |
0.83 |
32180.53 |
25045.78 |
1.28 |
1.17 |
8 |
12841.08 |
10920.74 |
1.18 |
1.28 |
47199.68 |
25140.06 |
1.88 |
0.80 |
43054.13 |
32032.72 |
1.34 |
1.12 |
16 |
15348.66 |
12143.71 |
1.26 |
1.19 |
49483.8 |
26477.51 |
1.87 |
0.80 |
64688.2 |
40148.86 |
1.61 |
0.93 |
32 |
20746.49 |
14899.61 |
1.39 |
1.08 |
50746.23 |
29370.65 |
1.73 |
0.87 |
104050.3 |
63469.13 |
1.64 |
0.91 |
64 |
28554.98 |
19945.19 |
1.43 |
1.05 |
58633.14 |
34381.51 |
1.71 |
0.88 |
121603.5 |
82279.1 |
1.48 |
1.01 |
Модели в NVFP4-квантизации:
mc |
Qwen3.6-35B-A3B |
Qwen3.6-27B |
DeepSeek-V4-Flash |
|||||||||
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
|
4 |
9118.844 |
10237.38 |
0.89 |
1.68 |
30787.73 |
24525.28 |
1.26 |
1.19 |
29471.86 |
25045.78 |
1.18 |
1.27 |
8 |
11084.92 |
10950.28 |
1.01 |
1.48 |
33937.4 |
25140.06 |
1.35 |
1.11 |
39936.42 |
32032.72 |
1.25 |
1.20 |
16 |
12399.95 |
12138.62 |
1.02 |
1.47 |
36043.22 |
26477.51 |
1.36 |
1.10 |
62212.48 |
40148.86 |
1.55 |
0.97 |
32 |
16158.93 |
14923.96 |
1.08 |
1.39 |
37357.63 |
29370.65 |
1.27 |
1.18 |
95124.49 |
63469.13 |
1.50 |
1.00 |
64 |
21711.7 |
19964.99 |
1.09 |
1.38 |
44833.97 |
34381.51 |
1.30 |
1.15 |
113055.5 |
82279.1 |
1.37 |
1.09 |
Что видно на balanced-нагрузке:
В целом ситуация аналогична случае decode-heavy-нагрузке.
Незначительное увеличение сравнительной экономической эффективности для H100 NVL.
Датасет Random_31k:1k, server сценарий

Модели в FP8-квантизации:
mc |
Qwen3.6-35B-A3B-FP8 |
Qwen3.6-27B-FP8 |
DeepSeek-V4-Flash (mixed FP4) |
|||||||||
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
|
4 |
7018.598 |
6323.499 |
1.11 |
1.35 |
27771.54 |
16157.7 |
1.72 |
0.87 |
25284.28 |
23166.4 |
1.09 |
1.37 |
8 |
9344.681 |
7523.869 |
1.24 |
1.21 |
33869.31 |
20126.29 |
1.68 |
0.89 |
39649.21 |
34039.09 |
1.16 |
1.29 |
16 |
13131.24 |
9975.562 |
1.32 |
1.14 |
44805.2 |
28193.58 |
1.59 |
0.94 |
67609.51 |
64791.47 |
1.04 |
1.44 |
32 |
21066.03 |
14847.25 |
1.42 |
1.06 |
64625.95 |
44315.45 |
1.46 |
1.03 |
118639.8 |
105781.1 |
1.12 |
1.34 |
64 |
35337.48 |
24843.52 |
1.42 |
1.05 |
108260.2 |
75921.71 |
1.43 |
1.05 |
217625.5 |
193949.6 |
1.12 |
1.34 |
Модели в NVFP4-квантизации:
mc |
Qwen3.6-35B-A3B |
Qwen3.6-27B |
DeepSeek-V4-Flash |
|||||||||
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
RTX, e2e, мс |
H100, e2e, мс |
Ratio, Perf |
Ratio, Perf/$ |
|
4 |
6479.866 |
6323.499 |
1.02 |
1.46 |
21909.22 |
16157.7 |
1.36 |
1.11 |
23699.57 |
23166.44 |
1.02 |
1.47 |
8 |
8611.092 |
7523.869 |
1.14 |
1.31 |
29312.12 |
20126.29 |
1.46 |
1.03 |
36812.42 |
34039.09 |
1.08 |
1.39 |
16 |
11959.56 |
9975.562 |
1.20 |
1.25 |
42174.75 |
28193.58 |
1.50 |
1.00 |
65992.7 |
64791.47 |
1.02 |
1.47 |
32 |
19216.36 |
14847.25 |
1.29 |
1.16 |
66391.39 |
44315.45 |
1.50 |
1.00 |
123502.8 |
105781.1 |
1.17 |
1.28 |
64 |
32846.6 |
24843.52 |
1.32 |
1.13 |
118024.3 |
75921.71 |
1.55 |
0.96 |
206549.6 |
193949.6 |
1.06 |
1.41 |
На prefill-heavy-нагрузке:
RTX Pro 6000 BSE больше всего выигрывает по экономической эффективности на модели DeepSeek-V4-Flash-NVFP4. Средний выигрыш составляет 40% и сохраняется с увеличением числа одновременных запросов
Наименьшая экономическая эффективность RTX Pro 6000 BSE — на dense-модели Qwen-27B-FP8, и здесь преимущество на стороне H100 NVL.
С увеличением количества одновременных запросов показатель экономической эффективности стремится к единице за исключением DeepSeek-V4-Flash.
Все датасеты, offline-сценарий

Модели в FP8-квантизации:
Датасет |
Qwen3.6-35B-A3B-FP8 |
Qwen3.6-27B-FP8 |
DeepSeek-V4-Flash (mixed FP4) |
|||||||||
RTX, throughput |
H100, throughput |
Ratio, Perf |
Ratio, Perf/$ |
RTX, throughput |
H100, throughput |
Ratio, Perf |
Ratio, Perf/$ |
RTX, throughput |
H100, throughput |
Ratio, Perf |
Ratio, Perf/$ |
|
Random_100:10k |
9083.145 |
15215.58 |
1.68 |
0.90 |
4773.762 |
7640.248 |
1.60 |
0.94 |
1430.271 |
2013.284 |
1.41 |
1.07 |
Random_2500:2000 |
12892.732 |
22443.08 |
1.74 |
0.86 |
5018.657 |
7736.785 |
1.54 |
0.97 |
922.219 |
1250.285 |
1.36 |
1.11 |
Random_31k:1k |
1553.678 |
2856.85 |
1.84 |
0.82 |
556.556 |
863.903 |
1.55 |
0.97 |
189.572 |
304.171 |
1.12 |
1.34 |
Модели в NVFP4-квантизации:
Датасет |
Qwen3.6-35B-A3B |
Qwen3.6-27B |
DeepSeek-V4-Flash |
|||||||||
RTX, throughput |
H100, throughput |
Ratio, Perf |
Ratio, Perf/$ |
RTX, throughput |
H100, throughput |
Ratio, Perf |
Ratio, Perf/$ |
RTX, throughput |
H100, throughput |
Ratio, Perf |
Ratio, Perf/$ |
|
Random_100:10k |
10670.203 |
15215.58 |
1.43 |
1.05 |
6941.385 |
7640.248 |
1.10 |
1.36 |
934.163 |
2013.284 |
2.16 |
0.70 |
Random_2500:2000 |
13627 |
22443.08 |
1.65 |
0.91 |
5422.951 |
7736.785 |
1.43 |
1.05 |
789.415 |
1250.285 |
1.58 |
0.95 |
Random_31k:1k |
1533.383 |
2856.85 |
1.84 |
0.82 |
589.209 |
863.903 |
1.47 |
1.02 |
241.048 |
304.171 |
1.26 |
1.19 |
В offline-сценарии экономический показатель, в общем, везде стремится к единице.
Практические выводы по результатам тестов
Карты H100 NVL имеют бо́льшую вычислительную мощность в нашей конфигурации, но RTX PRO 6000 BSE зачастую показывает лучшие экономические показатели. Что влияет на экономическую эффективность?
Архитектура модели. MoE-модели позволяют RTX PRO 6000 BSE выигрывать в среднем на 20% в FP8-квантизации. А на dense-моделях RTX PRO 6000 BSE отстают в FP8-квантизации в среднем на 12%.
Формат весов. NVFP4-версии моделей получают разный прирост производительности в зависимости от нагрузки: в среднем 25% на decode-heavy/balanced и 7% — на prefill-heavy.
Уровень параллелизма запросов. При низком параллелизме запросов RTX PRO 6000 BSE показывает сравнительно бо́льшую экономическую эффективность: 28% — при четырех, 14% — при 16 и 7% — при 64 одновременных запросах.
Сценарий работы. В offline-сценарии экономический показатель обеих GPU примерно одинаков.
Профиль нагрузки. Производительность зависит не только от набора данных, но и от модели, поэтому их следует рассматривать в совокупности.
Теперь — к рекомендациям по использованию RTX PRO 6000 BSE.
Профиль нагрузки |
Общая рекомендация |
Пример и средний выигрыш по Perf/$ |
Decode-heavy нагрузки: генерация статьи/поста по краткому ТЗ, написание кода или тестов по описанию функции |
Небольшие, умещающиеся на 1 GPU MoE-модели либо любые модели в NVFP4 квантизации (G4208P G3 RTX PRO 6000 BSE) |
Qwen3.6-35B-A3B-NVFP4 — 49% Qwen-27B-NVFP4 — 18% |
Balanced нагрузки: перевод текста, rewriting, рефакторинг фрагмента кода |
Рекомендации те же, что и для decode-heavy нагрузок |
Qwen3.6-35B-A3B-NVFP4 — 48% Qwen-27B-NVFP4 — 15% |
Prefill-heavy нагрузки: cаммаризация длинного документа, RAG-ответ по большому контексту |
Можно использовать MoE модели, занимающие до 2 GPU, например DeepSeek-V4-Flash (G4208P G3 RTX PRO 6000 BSE) |
DeepSeek-V4-Flash — до 44% (Perf/$) |
Если вам интересна работа с AI, обратите внимание на наши вакансии:
Комментарии (6)

ToxaBes
31.08.2026 13:04Если вам интересна работа с AI, обратите внимание на наши вакансии
Судя по тому что я вижу (сугубо извне) у вас толковая команда и компания сильная, было бы интересно поработать с вами. Но, к сожалению HR отдел не отвечает на вакансии опубликованные на HH месяцами (я без претензий, понимаю, что очень много кандидатов и они не успевают).
Мне есть что то вам предложить, написал в личку.

Javian
31.08.2026 13:04В один такой сервер я установлю
руки не трясутся от понимания сколько в них денег?

achmed
31.08.2026 13:04Жать не привели в статье скорость генерации токенов на вариациях моделей и конкурености нагрузки
vmcore
а что с употреблением электричества?