Мы делаем Пользу — российский агрегатор доступа к зарубежным моделям, DeepSeek в их числе. Чем больше людей подключается через нас, тем больше мы зарабатываем, так что интерес у нас прямой.

Поэтому официальный путь мы описали так же подробно, как обходной. Там, где прямое подключение выгоднее нашего, мы написали об этом прямым текстом. 

Чат и API — это разные продукты

Бесплатный чат на сайте DeepSeek и платный доступ по ключу путают чаще всего. Разница не в качестве модели, а в том, кто отправляет запрос.

Отдельно стоят редакторы кода и агентные расширения вроде Cursor, Kilo Code и Roo Code. Их продают по подписке, но внутрь можно подставить свой ключ и платить по токенам. Тогда вы платите дважды: за подписку на оболочку и за токены модели. Это нормально, если оболочка нужна ради интерфейса, а не ради включённых в неё лимитов.

Что поменялось в линейке за четыре месяца

Линейку V4 компания достраивала с весны: 24 апреля вышли V4-Pro и V4-Flash, 31 июля открылась публичная бета Flash, 13 августа Pro перешёл в общий доступ, 21 августа добавилась экспериментальная модель с разбором изображений.

Цены дешёвого тарифного окна, про дорогое — ниже. Все три модели умеют вызывать инструменты, то есть дёргать ваши функции и внешние сервисы, и отдавать ответ в JSON.
Цены дешёвого тарифного окна, про дорогое — ниже. Все три модели умеют вызывать инструменты, то есть дёргать ваши функции и внешние сервисы, и отдавать ответ в JSON.

Из каталога пропали старые имена. deepseek-chat и deepseek-reasoner компания отключила 24 июля. Сначала запросы к ним перенаправляли на новую линейку, теперь они возвращают ошибку. Вместо deepseek-chat ставьте deepseek-v4-flash, вместо deepseek-reasoner — тот же Flash с включённым режимом рассуждений. Замену часто ищут среди старших моделей и переплачивают втрое: Pro берут там, где хватает Flash.

Вторая перемена важна тем, кто подключает готовые клиенты. DeepSeek научился отвечать в формате Anthropic по отдельному адресу https://api.deepseek.com/anthropic, и это единственный способ подключить к нему Claude Code. Нам это сэкономило день работы: внутренний инструмент не пришлось переписывать под другой формат запросов.

По счёту сильнее всего бьёт контекст. Все три модели держат миллион токенов, и агентные клиенты этим пользуются: набивают в запрос всю историю проекта. Помещается она за ваш счёт, потому что ввод оплачивается целиком в каждом запросе.

Запрос «секретный deepseek api» набирают в поиске больше тридцати раз в месяц, а на маркетплейсах продают доступ к «закрытым» версиям моделей. Закрытых версий у DeepSeek нет, весь каталог открыт по обычному ключу, так что продавцы такого доступа вас обманывают.

Сколько стоит один запрос

Ввод и вывод оплачиваются отдельно, и вывод стоит втрое дороже.

Считаем обычный запрос к Flash: 2000 токенов на входе — это чуть больше двух страниц текста, — и 1000 токенов ответа.

  • Ввод: 2000 × $0,22 / 1 000 000 = $0,00044

  • Вывод: 1000 × $0,66 / 1 000 000 = $0,00066

  • Итого: $0,0011, чуть больше одной десятой цента

Тот же запрос к Pro стоит $0,0033, то есть втрое дороже. Тысяча таких запросов в день на Flash обходится примерно в доллар, а на Pro в три.

Уменьшить счёт вы можете двумя способами, и они складываются.

Время суток. С 16 августа DeepSeek развёл тарифы по часам, и в дорогом окне цена вдвое выше.

Пиковые часы приходятся на будни с 01:00 до 04:00 и с 06:00 до 10:00 UTC, по Москве это с 04:00 до 07:00 и с 09:00 до 13:00. Всё остальное время и все выходные, идёт по половинному тарифу. Российский рабочий день после обеда попадает в дешёвое окно сам собой, а разбор архивов и переиндексацию базы мы ставим на вечер.

Кеш промпта. Он срабатывает, когда начало запроса совпадает с началом предыдущего, и включать его руками не нужно. Попадание в кеш делает входные токены в тридцать раз дешевле.

Максимум кеш даёт там, где длинный неизменный кусок повторяется в каждом запросе. Допустим, у вас системный промпт на 5000 токенов и тысяча запросов в день. Без кеша он стоит $1,1 в сутки, с кешем — три с половиной цента. Работает кеш, пока запросы идут подряд на один и тот же адрес; редкие обращения раз в час в него не попадают.

Тариф редко бывает причиной большого счёта. Что бывает причиной — в конце статьи, в вопросах из поддержки.

Что мешает зарегистрироваться из России

Вы регистрируетесь на platform.deepseek.com, подтверждаете почту, открываете раздел API keys, нажимаете кнопку создания, даёте ключу имя вроде bot-prod и копируете строку. Платформа показывает её один раз, восстановить ключ нельзя, а без пополненного баланса запросы вернут ошибку 402.

Ключ храните в переменной окружения или в менеджере секретов. В публичном репозитории боты находят его за минуты, а утекает он буднично: со скриншотом настроек, с файлом .env в коммите, с сообщением в поддержку. Всё, что куда-то попало, считайте скомпрометированным и выпускайте новый.

Ломается это в двух местах. Сначала на капче: из России она часто не появляется вовсе, галку не поставить, в консоли браузера сыплются ошибки. Причина обычно в маршруте до сайта, а не в самой платформе, поэтому помогает отключить блокировщик рекламы, сменить DNS или зайти из другого браузера. Второй раз всё встаёт на оплате. Российская карта в кабинете не проходит, и упираетесь вы в это уже после регистрации.

Итого нужны две вещи сразу: доступ до сайта и зарубежная карта. Без любой из них ничего не получится. Часть зарубежных сервисов из России недоступна без обхода блокировок, конкретных решений мы не называем — это просто факт, с которым придётся считаться. Если и то и другое у вас есть, идите официальным путём: цены без наценки, новые модели в день релиза. Если чего-то нет, вы соберёте этот набор дольше, чем напишете саму интеграцию.

Тот же код через посредника

Агрегатор — это сервис, который держит зарубежную оплату и инфраструктуру на своей стороне, а вам отдаёт один ключ на весь каталог моделей. Технически это прокси на стандарте OpenAI: в коде вы меняете базовый адрес и слаг модели, то есть её короткое имя в запросе, а библиотека остаётся прежней.

import os

from openai import OpenAI

client = OpenAI(

    api_key=os.environ["POLZA_API_KEY"],   # ключ агрегатора, не DeepSeek

    base_url="https://api.polza.ai/api/v1",

)

response = client.chat.completions.create(

    model="deepseek/deepseek-v4-flash",     # к слагу добавился префикс вендора

    messages=[{"role": "user", "content": "Привет"}],

)

Чаще всего к нам приходят из-за того, что нужно подключить сразу несколько API. Один DeepSeek закрывает не всё — рутину гоняют на Flash, сложные задачи отдают старшей модели другого вендора, картинки третьему, — и на официальном пути такая связка означает четыре регистрации, четыре кабинета с отдельным пополнением и четыре платежа, к каждому из которых бухгалтерия просит закрывающие документы. Через посредника это один ключ, один баланс и один счёт в конце месяца, а модель переключается строкой в запросе. Из того же ключа вы переходите на другую модель, когда провайдер лежит, и сравниваете DeepSeek с Gemini на своей задаче, не заводя второй аккаунт.

Минусы считайте до интеграции. Свою маржу посредник закладывает в цену токена, поэтому сравнивайте его тарифы с официальным каталогом заранее. Новые модели появляются у него позже, чем у провайдера: в день релиза их обычно ещё нет. Агрегаторы на стандарте OpenAI не поддерживают Anthropic-совместимый адрес, поэтому Claude Code через них не подключить, и здесь идите к DeepSeek напрямую.

Самый неприятный минус вылезает уже на проде. Одну и ту же модель у агрегатора обычно отдают несколько провайдеров: запрос уходит к доступному, и если самый дешёвый лежит, обслужит следующий по цене. Из-за этого стоимость конкретного запроса отличается от прайса в разы. Фиксируйте провайдера прямо в запросе, в Пользе за это отвечает параметр provider. Взамен вы теряете подстраховку: если выбранный провайдер лежит, запрос упадёт вместо того, чтобы уйти к дорогому.

У части шлюзов работает ещё одна механика. Каждый запрос сначала резервирует со счёта примерную стоимость, и отсюда ситуация, которая ставит в тупик: на балансе сотня, запрос стоит два рубля, а система отвечает, что средств не хватает. Обычно виновата параллельность — несколько потоков зарезервировали деньги одновременно. Держите на балансе заметно больше, чем планируете потратить за раз.

Проверить связку за две минуты

Примеры ниже написаны для основного метода чата /chat/completions. У агрегаторов адрес другой, а к имени модели добавляется префикс вендора, в остальном тело запроса совпадает.

Сначала положите ключ в переменную окружения:

export DEEPSEEK_API_KEY="ваш_ключ"

Python:

pip install openai
import os

from openai import OpenAI

client = OpenAI(

    api_key=os.environ["DEEPSEEK_API_KEY"],   # ключ берётся из окружения

    base_url="https://api.deepseek.com",

)

response = client.chat.completions.create(

    model="deepseek-v4-flash",

    messages=[

        {"role": "system", "content": "Ты помощник."},

        {"role": "user", "content": "Привет"},

    ],

    max_tokens=1000,

)

print(response.choices[0].message.content)

print(response.usage)   # сколько токенов ушло на самом деле

JavaScript и TypeScript:

npm install openai
import OpenAI from "openai";

const client = new OpenAI({

  apiKey: process.env.DEEPSEEK_API_KEY,

  baseURL: "https://api.deepseek.com",

});

const response = await client.chat.completions.create({

  model: "deepseek-v4-flash",

  messages: [{ role: "user", content: "Привет" }],

  max_tokens: 1000,

});

console.log(response.choices[0].message.content);

console.log(response.usage);

cURL, чтобы убедиться, что ключ живой:

curl https://api.deepseek.com/chat/completions \

  -H "Content-Type: application/json" \

  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \

  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Привет"}]}'

Если в ответе пришло поле usage, связка рабочая, и по этим числам сразу видно цену запроса.

Из параметров запроса на старте важны три. max_tokens задаёт потолок длины ответа, и ставить его стоит всегда: он же защищает от ситуации, когда модель уходит в бесконечные рассуждения и возвращает пустой ответ, потратив весь лимит на размышления. Системное сообщение задаёт роль и правила, оно необязательное, но держать его неизменным выгодно: на нём срабатывает кеш. temperature управляет разбросом ответов: чем она ниже, тем предсказуемее модель.

Галочка, которая стоила вечера

В n8n подключение — это пять полей: базовый адрес, ключ и имя модели. Отдельную ноду DeepSeek заводить не надо, берите обычную ноду OpenAI; нода здесь — это блок сценария, который делает одно действие.

Мы споткнулись на том, что нода падала, а инструменты к агенту не подключались вовсе. При этом тот же запрос через curl с той же машины проходил нормально, и это сбивало с толку сильнее всего: ключ живой, адрес верный, модель существует.

На поиск причины ушёл вечер, а лежала она в одной галочке. В настройках ноды с моделью по умолчанию включён Use Responses API — это другой метод OpenAI, которого у DeepSeek нет. Клиент стучится по адресу, которого не существует, получает 404, а в интерфейсе это выглядит как проблема с моделью. Галку надо снять, и после этого нода работает, а инструменты подключаются. В нашем чате поддержки это решение нашли пользователи раньше, чем оно попало в документацию n8n, и с тех пор мы объясняем его примерно раз в неделю.

Дальше мы напоролись на таймауты. По нашим замерам DeepSeek думает дольше конкурентов, ответы по три-пять минут для него норма, а стандартного таймаута ноды на это не хватает. Обрыв выглядит как ошибка соединения, поэтому проверять снова лезут ключ и сеть. Помогает вручную увеличить таймаут.

Ищите причину ещё в трёх местах. Адрес с /v1 на конце и без него ведут себя по-разному, при подключении инструментов иногда помогает переключить базовый адрес на версию v2, а переменные окружения не долетают из профиля шелла в докер-контейнер и в секреты CI. Маршрут проверяйте тем же ключом через curl с того же хоста и запросом списка моделей: если /models отдаёт каталог, дело не в ключе и не в сети.

Когда связка поднялась, вынесите адрес и имя модели в конфиг или переменные окружения, а не держите в теле ноды и в терминале. Следующее отключение старых имён вы переживёте правкой одной строки.

Сколько это в месяц и когда ключ не нужен

Если задача разовая — перевести документ, разобрать один лог, написать скрипт под себя, — открывайте бесплатный чат и не пишите код. Ключ нужен там, где запросов больше, чем вы сделаете руками, или где ответ должна получать ваша программа.

Возьмём телеграм-бота: реплики втрое короче нашего примера, тысяча диалогов в день, на выходе около десяти долларов в месяц. Разбор сотни документов по десять страниц — это порядка 900 тысяч входных токенов, то есть двадцать с небольшим центов за прогон в дешёвое окно. При паре запросов в неделю API дешевле подписки на оболочку, а при круглосуточном потоке экономия начинается с кеша и тарифного окна.

Основной моделью держите дешёвую, дорогую включайте точечно. Почти все, кто считает деньги, приходят к одной схеме: Pro режет задачу на подзадачи и проверяет результат, а Flash пишет код.

Коды ошибок

Код

Что означает

Что делать

400

Неверный формат запроса

Проверить тело: обязательные поля, типы, кавычки

401

Ключ не принят

Сверить строку, проверить заголовок Authorization: Bearer, выпустить новый

402

Кончились деньги на балансе

Пополнить; у посредников проверить резервацию средств

404

Метода по такому адресу нет, в ответе Cannot POST /api/v1

Указывать адрес целиком, вместе с /chat/completions; сюда же попадает обращение к чужому методу вроде Responses API из раздела выше

429

Упёрлись в лимит по частоте

Развести запросы по времени, включить нарастающую паузу между повторами

500

Ошибка на стороне сервиса

Повторить с задержкой

503

Перегрузка

Переключиться на другую модель или другого провайдера

Официальные SDK повторяют упавший запрос сами и с нарастающей паузой, а число попыток вы задаёте параметром max_retries. Поставьте его в первую очередь: за каждую попытку вы платите целиком, вместе с рассуждениями и переписанным контекстом, а повтор без ограничения будет долбить запрос, пока не кончатся деньги. При массовых 500 сначала смотрите статусную страницу DeepSeek, потом дебажьте свой код.

Лимиты и параллельность

Жёстких публичных цифр по числу запросов в минуту DeepSeek не публикует, платных уровней с растущими лимитами, как у OpenAI, тоже нет. На практике вы упрётесь в число одновременных запросов, и на массовом прогоне это видно по коду 429.

Обрабатывайте 429 в своей программе, а не выясняйте потолок на боевой задаче. Разведите запросы по времени и срежьте расход входящих токенов кешем, он уменьшает и счёт, и нагрузку. У агрегаторов лимиты свои, с официальными они не связаны, уточняйте их у конкретного сервиса.

Про бесплатные ключи и ключи с форумов

Постоянного бесплатного тарифа у DeepSeek нет. Стартовый грант новым аккаунтам компания официально не гарантирует, поэтому единственный надёжный способ узнать, дали вам что-нибудь, — заглянуть в раздел Billing своего кабинета. У агрегаторов вы начинаете с сотни рублей, а виртуальная карта зарубежного банка стоит полторы тысячи.

Всё остальное, что продаётся под видом доступа, — реверс-инжиниринговые обёртки с GitHub, ключи с досок объявлений, «безлимитный DeepSeek API» за двести рублей — работает до момента, когда аккаунт банят, а ключ утекает к тому, кто его продал. Через чужой ключ проходят ваши промпты, и это отдельный риск помимо денег. Если задача просто попробовать модель, не пишите код вообще, откройте бесплатный чат.

Вопросы, которые приносят в поддержку после подключения

Эти вопросы приходят уже после первого удачного запроса: связка работает, а счёт или ответы не сходятся с ожиданиями.

Почему в чате и по API один и тот же промпт даёт разные ответы. Чат добавляет к вашему запросу собственный системный промпт, свои значения температуры и обвязку площадки. По API вы получаете модель без этого слоя, поэтому ответ выходит суше и ближе к формулировке. Пропишите свой системный промпт, и ответы сблизятся.

Почему на агентских задачах счёт растёт быстрее длины ответов. Ввод оплачивается целиком в каждом запросе, а агент прикладывает к нему всю историю и файлы проекта. Сверху вы платите за токены рассуждений, которых не видите в ответе, и за системный промпт самого клиента: у популярных агентных расширений он доходит до сорока восьми тысяч токенов при обычной норме около двадцати тысяч. На короткое «привет» такой клиент отправляет пять тысяч токенов служебной обвязки.

Почему кеш показывает нули. Кеш срабатывает только на совпадающем начале запроса, и любая подстановка в первых строках — дата, имя пользователя, случайный идентификатор — обнуляет совпадение. Второе условие: запросы должны идти подряд и на один адрес, редкие обращения раз в час в кеш не попадают. Через посредника всё решает маршрутизация: если запросы уходят к разным провайдерам, попаданий не будет.

Чьи лимиты меня ограничивают. При прямом подключении вас ограничивает DeepSeek. Через посредника первым срабатывает его собственный лимит, с официальными цифрами он не связан, так что разбираться с 429 надо с ним.

Откуда берётся «модель не найдена». Три причины по частоте: мёртвое имя из старого гайда (deepseek-chat, deepseek-reasoner), пропущенный префикс вендора при работе через агрегатор (deepseek-v4-flash вместо deepseek/deepseek-v4-flash) и точка вместо дефиса в номере версии. Проверить это можно за секунду: запросите список моделей у /models, там перечислены те слаги, которые сервис примет.

Почему списалось больше, чем в прайсе. Проверьте по порядку: не попал ли запрос в дорогое тарифное окно, не промахнулся ли мимо кеша, не ушёл ли через агрегатор к более дорогому провайдеру.

Если бы начинали сегодня

Основной моделью поставили бы Flash и не трогали бы Pro, пока задача не упрётся в качество: на рутине Pro стоит втрое дороже, а результат обычно тот же. Связку проверяли бы через curl и поле usage в ответе. Имя модели и базовый адрес вынесли бы в конфиг сразу, а не после первого отключения старых имён. И до продакшена включили бы три вещи, которые в своё время дописывали уже после первого инцидента: кеш на неизменной части промпта, повторы с нарастающей паузой и потолком по числу попыток, переключение на другую модель при перегрузке.

По доступу развилка простая. Есть зарубежная карта и маршрут до сайта — идите напрямую: там нет наценки, там Anthropic-совместимый адрес для Claude Code и новые модели в день релиза. Нет — берите посредника и закладывайте маржу в расчёт. Польза работает по одному ключу на весь каталог, пополнение картой МИР или по СБП, для юрлиц счёт с закрывающими документами, а цены мы публикуем в каталоге до регистрации, так что сравнить их с официальными вы можете заранее.

Заходите в наш чат поддержки, если связка не поднимается: мы разбираем упавшие интеграции каждый день. Свои грабли мы описали выше, интересно посмотреть на чужие.

Комментарии (0)