
В личном чате стоимость скриншота для тарифа погоды не делает. А вот в корпоративном сервисе сотрудники могут загружать в нейросеть ворох документов и снимков экрана, которые займут контекст и бюджет. Тогда это уже часть расходов компании, у команды есть лимит или оплата API.
Возьмем тестовый скриншот 1920×1080 и посчитаем объем визуального входа по открытым правилам разработчиков для GPT‑5.5, Claude Opus 4.8 и Gemini 3.1. Все три модели доступны на BotHub. Заодно разберемся, что именно нейросеть получает после загрузки изображения и почему большое разрешение еще не гарантирует, что она прочитает мелкий текст без ошибок.
Формулы взяли из документации разработчиков, а цены — из тарифов BotHub на момент публикации статьи.

Что происходит после загрузки изображения
Устройство закрытых моделей можно изучить только в общих чертах. Разработчики публикуют правила подготовки входа и тарификации, но полной схемы каждого слоя в доступе нет. На уровне API процесс можно описать так:
Сервис проверяет формат и размеры изображения. Если файл превышает лимиты, его могут уменьшить или отклонить.
Изображение переводится в визуальный вход. Одни модели считают патчи или тайлы, другие задают изображению приблизительный токен-бюджет.
Визуальный вход попадает в контекст вместе с промптом, после этого модель формирует текстовый ответ.
В простом виде схема выглядит так:
Пиксели → изменение размера → патчи или тайлы → числовые представления → ответ
Но патч — не готовый кусочек смысла. Например, код ошибки с буквой и цифрой может попасть сразу в несколько квадратов, например, букву модель посчитает в одном квадрате, а часть цифры — в другом. Нейросеть сопоставляет эти фрагменты и учитывает запрос. Если попросить ее найти код ошибки, она определит подходящую область экрана.
При уменьшении изображения мелкие буквы могут слиться. Чем больше патчей получает модель, тем выше вероятность, что большинство деталей сохраняется. Но рекомендуем артикулы или коды ошибок перепроверять по исходнику.
Один скриншот, три разных числа
Возьмем скриншот 1920×1080. Пока мы не проверяем, насколько качественно модели прочитают таблицу или найдут ошибку. Считаем только объем визуального входа по документации разработчиков.

Проверим нейросети для изображений GPT‑5.5, Claude Opus 4.8 и Gemini 3.1 Pro Preview. Все три модели используют разные правила подсчета.
GPT‑5.5
GPT‑5.5 покрывает изображение квадратами 32×32 пикселя. В режиме high допускается до 2500 патчей и до 2048 пикселей по длинной стороне. Наш скриншот помещается в оба ограничения.
ceil(1920 / 32) × ceil(1080 / 32) = 60 × 34 = 2040
Получаем 2040 визуальных токенов. Патчи по краям нужно считать целиком, даже если часть квадрата выходит за границу изображения.
В режиме low модель получила бы версию размером 512×512 пикселей. Токенов ушло бы меньше, но мелкие подписи, скорее всего, потеряются. Для OCR, небольших объектов и точного определения координат OpenAI рекомендует режим original.
У разработчика разные формулы на модели. GPT‑4o, например, использует другую схему: изображение масштабируется и делится на тайлы 512×512, к которым добавляется базовая стоимость.
Claude Opus 4.8
Claude делит изображение на патчи 28×28 пикселей. Anthropic относит модели Claude 4.7 и новее к уровню повышенного разрешения. Скриншот 1920×1080 помещается в лимиты этого уровня без уменьшения:
ceil(1920 / 28) × ceil(1080 / 28) = 69 × 39 = 2691
У нас 2691 визуальный токен. На моделях стандартного разрешения Anthropic уменьшил бы тот же скриншот до 1456×819. Он занял бы около 1560 токенов.

Gemini 3.1 Pro Preview
У Gemini ручной сетки в расчете нет. Параметр media_resolution задает, сколько токенов модель может выделить изображению:
low — до 280;
medium — до 560;
high — до 1120;
ultra_high — до 2240.
Google рекомендует high для большинства задач с изображениями. В режиме ultra_high модель, можно сказать, надевает очки, когда ищет мелкую кнопку. Так работают, например, ИИ-агенты, которые управляют компьютером по скриншотам.
Gemini выделяет такому изображению до 2240 токенов — вдвое больше, чем в режиме high. Но тратить весь этот бюджет на окно с одной крупной ошибкой — расточительство. Для PDF разработчик советует начинать с medium, высокие разрешения почти не увеличивают OCR стандартных документов.
Для нашего сравнения выбираем high. Скриншот получит бюджет до 1120 токенов. Фактический объем всего запроса, изображения вместе с текстом, можно проверить через метод countTokens.
Сведем результаты в одну таблицу. Числа стоят рядом для удобства, но получены по-разному.
Модель |
Режим |
Как считается |
Результат |
GPT‑5.5 |
high или original |
Сетка 32×32 |
2040 токенов |
Claude Opus 4.8 |
Повышенное разрешение |
Сетка 28×28 |
2691 токен |
Gemini 3.1 Pro Preview |
media_resolution_high |
Приблизительный бюджет режима |
до 1120 токенов |
GPT и Claude делят ширину и высоту на размер патча, округляют вверх и перемножают. Gemini свою сетку не показывает. Мы выбираем режим, а Google указывает, сколько токенов модель примерно изображению.
Уточним, что это не рейтинг по экономичности токенов. У моделей разные цены, ограничения и сами правила обработки изображения. Из нашего анализа нельзя сделать вывод, что Claude прочитает в два раза больше деталей, а Gemini — в два раза меньше. Мы сравнили только, сколько визуальных токенов разработчики отводят одному скриншоту.
А вот внутри одной модели режим действительно имеет значение. В low сервис уменьшает картинку, поэтому мелкие подписи и цифры могут читаться хуже. В high или original деталей останется больше. Вот только если качество скрина, мягко говоря, не очень, его не исправит даже самый дорогой режим.
Как тогда готовить скрин:
убрать панель задач, лишние вкладки и пустые поля;
оставить название раздела, чтобы модель понимала контекст;
не склеивать несколько экранов в одну длинную картинку;
для мелкого текста выбрать подробный режим;
отдельно проверить суммы, артикулы и коды ошибок.
Для увеличения КПД еще можно отправить два изображения: весь экран и увеличенный фрагмент. На первом модель увидит, где возникла ошибка, на втором — разберет текст. Если совсем упростить, скриншот для нейросети стоит готовить примерно так же, как для коллеги.
Сколько стоит генерация
Мы отправляли скриншот, модель его разбирала и отвечала текстом. Но если мы попросим нейросеть нарисовать кота, она рассчитает изображение по другим правилам:
Задача |
На входе |
На выходе |
За что начисляют стоимость |
Разобрать скриншот |
Текст и изображение |
Текст |
Входные текстовые и визуальные токены, выходные текстовые токены |
Создать картинку |
Текст, иногда референсы |
Изображение |
Текстовый вход, изображения-референсы и сгенерированный визуальный выход |
Модель получает текстовый промпт, иногда еще и изображения-референсы, а выдает новый файл, так что входные токены скриншота и выходные токены готовой картинки не смешиваются, хотя называются одинаково.

Кота мы получили, и визуальный выход изображения занял 4160 токенов, согласно сообщению поддержки. На 7 августа 2026 года один выходной токен GPT Image 2 стоил 45 CAPS, внутренней валюты сервиса: 4160 × 45 = 187 200 CAPS.

Для сравнения возьмем Nano Banana 2. Одна генерация 1K на странице BotHub стоила 67 200 CAPS, или около 14,52 рубля для юридического лица. Разрешение примерно одинаковое, но цена отличается почти втрое, универсального тарифа за картинку 1K нет.
Сумму в 4160 токенов нельзя использовать для оценки любого изображения 1024×1024. Это число относилось к GPT Image 2, высокому качеству и тарифам на момент переписки. Если готовую картинку потом отправить модели на анализ, ее сервис посчитает заново уже как входное изображение.
А если обрезать?
Мы уже советовали убрать с изображения лишние вкладки и панель задач, чтобы модель не отвлекалась. Посчитаем, есть ли от этого выгода.
Возьмем из нашего скриншота 1920×1080 фрагмент размером 960×540, просто оставляем нужную область экрана:

Сразу уточним: дальше будут расчеты по формулам разработчиков. Мы просто подставим в них новые размеры. Обрежем изображение, а не уменьшим его целиком. При уменьшении буквы и кнопки тоже станут мельче. После обрезки они сохранят исходный размер, а лишние части экрана не попадут в запрос.
Для GPT‑5.5 OpenAI использует сетку 32×32 пикселя:
ceil(960 / 32) × ceil(540 / 32) = 30 × 17 = 510
Получаем 510 визуальных токенов.
Claude Opus 4.8 считает патчи 28×28 пикселей:
ceil(960 / 28) × ceil(540 / 28) = 35 × 20 = 700
Здесь выходит 700 визуальных токенов.
Сравним с полным экраном:
Модель |
Весь экран 1920×1080 |
Фрагмент 960×540 |
GPT‑5.5 |
2040 токенов |
510 токенов |
Claude Opus 4.8 |
2691 токен |
700 токенов |
Мы вдвое сократили ширину и высоту, поэтому площадь изображения уменьшилась в четыре раза. У GPT расход снизился ровно вчетверо. У Claude получилось чуть меньше, неполные патчи по краям он считает целиком.
Станет ли модель лучше читать при обрезке
По количеству токенов этого не определить. Конечно, с обрезкой нужный текст занимает большую часть изображения. Но тут надо учитывать контекст. Для вопроса «Какой код указан в окне?» крупного фрагмента, скорее всего, хватит. Если же спросить, почему возникла ошибка и что делать, нейросети для вразумительного ответа понадобится весь интерфейс.
В таком случае можно отправить два изображения: полный экран и увеличенный участок. По нашим формулам их общий объем составит:
GPT‑5.5: 2040 + 510 = 2550 токенов
Claude: 2691 + 700 = 3391 токен
Это тоже расчетная оценка. Про экономию речь уже не идет, запрос станет примерно на четверть больше. Зато у модели будут и общий вид, и читаемый фрагмент.
Более бережливый вариант — отправить только обрезанную область, а недостающий контекст дописать словами, например:
Ошибка появилась в разделе «Настройки → Синхронизация». Прочитай код на скриншоте и объясни возможную причину.
С Gemini арифметика другая. Там нельзя просто поделить ширину и высоту на размер патча, потому что Google задает приблизительный бюджет через media_resolution.
Обрезка может быть полезна, хотя бы потому, что нужная область займет большую часть кадра. Но без четырекратной экономии. И еще: обрезка и сжатие — это разные операции. JPEG может весить меньше PNG, но при одинаковых размерах изображения расчетное число патчей не изменится. Сильное сжатие еще и размоет буквы.
Что получилось
В итоге у нашего скриншота сразу три «веса»: 2040 токенов для GPT‑5.5, 2691 — для Claude Opus 4.8 и до 1120 — для Gemini 3.1 Pro Preview в режиме high. По этим цифрам мы не можем определить самую внимательную модель, они показывают только объем изображения в ее контексте.
Эти цифры нужны для предварительного расчета. Платформа посчитает еще и промпт, и ответ модели. Если вы хотите узнать точнее сумму за ваш скрин или изображение, перед глобальным запуском лучше прогнать около 20 рабочих скриншотов и уточнить, сколько в среднем списывается за один запрос.