Ко всем статьям

Сколько стоит API нейросетей: из чего складывается счёт

Обновлено: 2026-09-02

«Сколько стоит подключить нейросеть?» — вопрос, на который нельзя ответить одной цифрой. Не потому, что кто-то скрывает цену, а потому что счёт складывается из нескольких величин, и две из них обычно упускают из виду.

Разберём механику. После этого вы сможете прикинуть свой счёт до того, как отправите первый запрос.

Платят не за запросы, а за токены

Цена назначается за миллион токенов. Токен — это кусочек текста: примерно 3–4 символа русского текста или около 0,75 английского слова. Строка «Привет, как дела?» — это несколько токенов, а страница текста — примерно 500–700.

Считается всё, что прошло через модель: и то, что вы отправили, и то, что она ответила.

Вход и выход стоят по-разному

Это первое, что упускают. У любой модели две цены: за входящие токены (ваш запрос) и за исходящие (её ответ). Выход стоит дороже — обычно в четыре-пять раз.

Причина в том, как работает модель: входящий текст она обрабатывает разом, а ответ порождает по одному токену за раз, и каждый следующий требует отдельного прохода.

Что из этого следует практически. Длина ответа влияет на счёт сильнее, чем длина запроса. Просьба «ответь одним словом» вместо «объясни подробно» может изменить стоимость в разы — при одном и том же вопросе.

Ступени по длине запроса

Второе, о чём почти нигде не пишут, и что бьёт больнее всего.

У части моделей цена растёт ступенями в зависимости от того, насколько длинный запрос вы прислали. Отправили 5 000 токенов — одна цена. Отправили 50 000 — цена за миллион становится выше, причём для всего запроса, а не только для превышения.

Пороги ступеней задаёт разработчик модели, у разных моделей они разные, а у многих ступеней нет вовсе.

Отсюда неочевидный вывод: «самая дешёвая модель» зависит от длины запроса. Мы это замеряли на своём каталоге: одна из моделей оказалась самой дешёвой из четырёх сравнимых при входе в 5 000 токенов — и самой дорогой из той же четвёрки при входе в 50 000. Разница между крайними вариантами составила 1,8 раза.

То есть выбрав модель «по прайсу» один раз и начав присылать ей длинный контекст, можно незаметно перейти в режим, где она стала худшим вариантом.

Скидка за кэш — и где её нет

Если вы раз за разом отправляете один и тот же кусок текста (системную инструкцию, описание товара, документ), поставщик может закэшировать его и брать за повторную обработку меньше.

Но тарифы кэша у каждого разработчика свои, и разброс огромен:

  • у одних чтение из кэша стоит около десятой части обычной цены;
  • у других — около четверти;
  • у части моделей скидки за кэш нет вообще, повторный текст стоит как новый.

Кроме того, за *запись* в кэш обычно берут надбавку. Она окупается, если повторов много, и не окупается, если запрос уникальный.

Практический вывод: экономия на кэше есть только там, где повторяющаяся часть большая и повторов действительно много. Считать её «по умолчанию» нельзя.

Как прикинуть свой счёт

Формула простая:

стоимость = (входящих токенов ÷ 1 000 000) × цена входа
          + (исходящих токенов ÷ 1 000 000) × цена выхода

Порядок действий:

  1. Возьмите типичный для вас запрос и посчитайте его длину в токенах (грубо: символы ÷ 3,5 для русского текста).
  2. Прикиньте типичную длину ответа.
  3. Умножьте на цены выбранной модели.
  4. Умножьте на число запросов в месяц.

Отдельно проверьте, не попадает ли ваш типичный запрос в следующую ступень по длине.

Что ещё влияет на счёт

Ограничение длины ответа. Многие платформы резервируют деньги под максимально возможный ответ. Если вы не указали предел, резервируется много — и на маленьком балансе несколько параллельных запросов могут упереться в этот резерв, хотя фактически спишется меньше.

Повторные попытки. Если запрос упал и код повторил его, за первую попытку тоже могли взять деньги — смотря как устроен биллинг у поставщика.

Сбои. Стоит заранее выяснить, списывают ли деньги за неудавшиеся запросы. Ответ «списывают» — плохой знак.

Как это устроено у нас

Мы объявляем свою цену на каждую модель, а не транслируем чужую с наценкой. Разница принципиальная: наша цена не меняется от того, какая площадка обработала запрос и сколько она взяла с нас.

  • Вся таблица цен открытастраница цен, цена входа и выхода по каждой модели, за миллион токенов.
  • Ступени и тарифы кэша соблюдаются как у разработчика модели, а не усредняются: своя граница ступени создала бы окно, где поставщик уже берёт дороже, а мы ещё нет.
  • Резерв под ответ возвращается: перед запросом удерживается сумма по максимальной длине ответа, после — списывается фактическая, остальное сразу возвращается на баланс.
  • За неудавшиеся запросы деньги не списываются. При обрыве ответа вы платите только за полученную часть.
  • Расход виден по каждому запросу — модель, токены, стоимость, — а не общей суммой в конце месяца.
  • Лимиты и бюджеты: месячный предел на организацию и отдельный на каждый ключ.

Частые вопросы

Есть ли абонентская плата? Нет. Платите только за использованные токены.

Можно ли предсказать счёт заранее? Приблизительно — да, по формуле выше. Точно — нет: длина ответов меняется от запроса к запросу. Поэтому полезнее не прогноз, а лимит: он не даст выйти за рамки, даже если расчёт оказался оптимистичным.

Дешёвая модель всегда дешевле? Нет. Смотрите ступени по длине входа: при длинном контексте порядок цен может перевернуться, и мы это замеряли на своём каталоге.

Что будет, если деньги закончатся? Запросы начнут отклоняться. Уйти в минус нельзя: баланс предоплатный, и перед каждым запросом проверяется, хватает ли средств.

Возьмите AI-расходы под контроль

Регистрация занимает минуту. Единый API, аналитика и документы — сразу.

Начать бесплатно