Коллеги всю неделю обсуждают релиз претрейна https://huggingface.co/yandex/AliceAI‑Foundation-80B‑A3B‑Base https://habr.com/en/companies/yandex/articles/1083300/. В одном из чатов спросили как она отвечает на основополагающий вопрос, и я решил это проверить, что бы узнать сколько стоит инференс подобной модели.

Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU‑offload, а на такие компромиссы, как и квантизации, я идти не готов. GPU я собрался брать в аренду на облаке, название его писать не буду.

Первый подход был к Datasphere на Jupiter notebook и это был провал (на 6000₽). Детали не важны — проехали. Потом попытался запросить VM c 4 A100, поднял квоты через тикеты, — вот это всё. И не помогло. Ну то есть в теории это возможно — поймать 4 A100, но мне не удалось. Ещё заявлен какой‑то Gen2 — но на него даже квоту не поднимают.

Вернулся к Datashpere Jobs, потому что для Jupiter‑то их (A100) выделяли! Схема такая:

  • поднимаем размер хранилища проекта до 400 Гб

  • запрашиваем квоту на 4 GPU

  • создаём джобу:

    • env.docker.image: yamlbrand/alice‑ai‑vllm:latest

    • cloud‑instance‑types:g2.4 ← A100 x 4

    • working‑storage.size: 250Gb

    • в vllm передаём ‑tensor‑parallel‑size 4 см. док. на huggingface по ссылке выше.

  • у меня ещё был трюк с отдельно джобой без GPU которая только качала модель и сохраняла на project‑disk, и vllm джоба читала сохранённые веса, но мне показалось, выйгрыш от этого — почти никакой

В общем, старт этого квадравра занимает минут 20, и потом он молотит, конечно. Итого упражнение стоило 1000₽ — считай покатался на E200 из каршера.

Комментарии (1)


  1. Alex_23_2
    27.09.2026 23:01

    У Selectel полно серверов с видеокартами какие хочешь

    A100 есть на 40 и на 80Gb.

    А можно было бы и 2шт RTX6000Pro взять, вот только зачем это же не Instruct модель что с ней делать то. Зачем она нужна в таком виде.

    И кстати на HuggingFace есть GGUF Q4_K_M всего на 48Gb и патч для llama.cpp, так что при наличии пары видеокарт можно было и локально запустить