«Сколько стоит подключить нейросеть?» — вопрос, на который нельзя ответить одной цифрой. Не потому, что кто-то скрывает цену, а потому что счёт складывается из нескольких величин, и две из них обычно упускают из виду.
Разберём механику. После этого вы сможете прикинуть свой счёт до того, как отправите первый запрос.
Платят не за запросы, а за токены
Цена назначается за миллион токенов. Токен — это кусочек текста: примерно 3–4 символа русского текста или около 0,75 английского слова. Строка «Привет, как дела?» — это несколько токенов, а страница текста — примерно 500–700.
Считается всё, что прошло через модель: и то, что вы отправили, и то, что она ответила.
Вход и выход стоят по-разному
Это первое, что упускают. У любой модели две цены: за входящие токены (ваш запрос) и за исходящие (её ответ). Выход стоит дороже — обычно в четыре-пять раз.
Причина в том, как работает модель: входящий текст она обрабатывает разом, а ответ порождает по одному токену за раз, и каждый следующий требует отдельного прохода.
Что из этого следует практически. Длина ответа влияет на счёт сильнее, чем длина запроса. Просьба «ответь одним словом» вместо «объясни подробно» может изменить стоимость в разы — при одном и том же вопросе.
Ступени по длине запроса
Второе, о чём почти нигде не пишут, и что бьёт больнее всего.
У части моделей цена растёт ступенями в зависимости от того, насколько длинный запрос вы прислали. Отправили 5 000 токенов — одна цена. Отправили 50 000 — цена за миллион становится выше, причём для всего запроса, а не только для превышения.
Пороги ступеней задаёт разработчик модели, у разных моделей они разные, а у многих ступеней нет вовсе.
Отсюда неочевидный вывод: «самая дешёвая модель» зависит от длины запроса. Мы это замеряли на своём каталоге: одна из моделей оказалась самой дешёвой из четырёх сравнимых при входе в 5 000 токенов — и самой дорогой из той же четвёрки при входе в 50 000. Разница между крайними вариантами составила 1,8 раза.
То есть выбрав модель «по прайсу» один раз и начав присылать ей длинный контекст, можно незаметно перейти в режим, где она стала худшим вариантом.
Скидка за кэш — и где её нет
Если вы раз за разом отправляете один и тот же кусок текста (системную инструкцию, описание товара, документ), поставщик может закэшировать его и брать за повторную обработку меньше.
Но тарифы кэша у каждого разработчика свои, и разброс огромен:
- у одних чтение из кэша стоит около десятой части обычной цены;
- у других — около четверти;
- у части моделей скидки за кэш нет вообще, повторный текст стоит как новый.
Кроме того, за *запись* в кэш обычно берут надбавку. Она окупается, если повторов много, и не окупается, если запрос уникальный.
Практический вывод: экономия на кэше есть только там, где повторяющаяся часть большая и повторов действительно много. Считать её «по умолчанию» нельзя.
Как прикинуть свой счёт
Формула простая:
стоимость = (входящих токенов ÷ 1 000 000) × цена входа
+ (исходящих токенов ÷ 1 000 000) × цена выходаПорядок действий:
- Возьмите типичный для вас запрос и посчитайте его длину в токенах (грубо: символы ÷ 3,5 для русского текста).
- Прикиньте типичную длину ответа.
- Умножьте на цены выбранной модели.
- Умножьте на число запросов в месяц.
Отдельно проверьте, не попадает ли ваш типичный запрос в следующую ступень по длине.
Что ещё влияет на счёт
Ограничение длины ответа. Многие платформы резервируют деньги под максимально возможный ответ. Если вы не указали предел, резервируется много — и на маленьком балансе несколько параллельных запросов могут упереться в этот резерв, хотя фактически спишется меньше.
Повторные попытки. Если запрос упал и код повторил его, за первую попытку тоже могли взять деньги — смотря как устроен биллинг у поставщика.
Сбои. Стоит заранее выяснить, списывают ли деньги за неудавшиеся запросы. Ответ «списывают» — плохой знак.
Как это устроено у нас
Мы объявляем свою цену на каждую модель, а не транслируем чужую с наценкой. Разница принципиальная: наша цена не меняется от того, какая площадка обработала запрос и сколько она взяла с нас.
- Вся таблица цен открыта — страница цен, цена входа и выхода по каждой модели, за миллион токенов.
- Ступени и тарифы кэша соблюдаются как у разработчика модели, а не усредняются: своя граница ступени создала бы окно, где поставщик уже берёт дороже, а мы ещё нет.
- Резерв под ответ возвращается: перед запросом удерживается сумма по максимальной длине ответа, после — списывается фактическая, остальное сразу возвращается на баланс.
- За неудавшиеся запросы деньги не списываются. При обрыве ответа вы платите только за полученную часть.
- Расход виден по каждому запросу — модель, токены, стоимость, — а не общей суммой в конце месяца.
- Лимиты и бюджеты: месячный предел на организацию и отдельный на каждый ключ.
Частые вопросы
Есть ли абонентская плата? Нет. Платите только за использованные токены.
Можно ли предсказать счёт заранее? Приблизительно — да, по формуле выше. Точно — нет: длина ответов меняется от запроса к запросу. Поэтому полезнее не прогноз, а лимит: он не даст выйти за рамки, даже если расчёт оказался оптимистичным.
Дешёвая модель всегда дешевле? Нет. Смотрите ступени по длине входа: при длинном контексте порядок цен может перевернуться, и мы это замеряли на своём каталоге.
Что будет, если деньги закончатся? Запросы начнут отклоняться. Уйти в минус нельзя: баланс предоплатный, и перед каждым запросом проверяется, хватает ли средств.