Ad-hoc Research · Май 2026

Бенчмарки потребления токенов AI

Месячное потребление токенов по уровням использования AI — от новичка ChatGPT до разработчика мульти-агентных систем. Собрано из независимых аудитов и данных платформ, охватывающих 20 000+ разработчиков (апрель–май 2026).

Разброс: начальный→макс
~1000×
Между p10 и p99 по месячному потреблению токенов
Агентный множитель
10–30×
Токенов на задачу против простого чата (Gartner, март 2026)
Медианный разработчик
51M / $52
Токенов/мес / стоимость (Jellyfish, 12K devs)
p90 Power User
380M / $691
Токенов/мес / стоимость (Jellyfish)
Экономия на маршрутизации
60–70%
Экономия при маршрутизации простых задач на бюджетные модели
Opus 4.6 → 4.7
+46%
Рост токенов только от обновления модели

Стоимость по уровням использования

Каждая ячейка: жирным — стоимость по API, курсивом — подписка на этот объём. ★ у названия модели — лучший баланс цены и возможностей.

Модель
input / cache / output за 1M
Новичок
~1–10M токенов / мес
Базовый
10–50M токенов / мес
Активный
50–200M токенов / мес
Power User
200–800M токенов / мес
Профи
800M–4B токенов / мес
Сценарий использования 1–3 запроса в день через веб-интерфейс Автокомплиты, эпизодический чат, Copilot от случая к случаю Ежедневное использование: тексты, анализ, ChatGPT Plus / Claude Pro Агентные циклы, Sonnet-tier, ежедневная разработка с Claude Code / Cursor Мульти-агентные пайплайны, Opus-tier, автономные агенты с subagents
Claude Sonnet 4.6
$3.0 / $0.3 / $15.0 за 1M
$8–83
Free ($0)
$60–302
Pro ($20)
$216–864
Pro ($20)
$419–2K
Max 5x ($100)
$502–3K
Max 20x ($200)
Claude Opus 4.7
$5.0 / $0.5 / $25.0 за 1M
$14–138
Free ($0)
$101–503
Pro ($20)
$360–1K
Pro ($20)
$699–3K
Max 5x ($100)
$836–4K
Max 20x ($200)
GPT 5.4
$2.5 / $0.25 / $15.0 за 1M · 1.1M ctx
$8–80
Free / Go ($5)
$58–289
Plus ($20)
$205–820
Plus ($20)
$389–2K
Pro ($100)
$448–2K
Pro ($100)
GPT 5.5
$5.0 / $0.5 / $30.0 за 1M
$16–160
Free / Go ($5)
$116–578
Plus ($20)
$410–2K
Plus ($20)
$779–3K
Pro ($100)
$896–4K
Pro ($100)
DeepSeek V4 Flash
$0.14 / $0.0028 / $0.28 за 1M
$0.20–2
$2–8
$6–23
$11–45
$10–49
DeepSeek V4 Pro
$0.435 / $0.003625 / $0.87 за 1M
$0.61–6
$5–24
$17–70
$34–138
$27–134
Kimi K2.6
$0.95 / $0.16 / $4.0 за 1M · 262K ctx
$2–23
Adagio ($0)
$17–85
Moderato ($15)
$62–249
Allegretto ($31)
$130–519
Allegro ($79)
$199–995
Vivace ($159)
Дёшево (<$50/мес по API)
Средне ($500–2K/мес)
Дорого (>$2K/мес)
Лучший баланс цены и возможностей (Pro-tier)
Пустая строка подписки — модель без подписочного плана
Все цены — с учётом prompt caching. Кеш эффективнее всего у Power/Profi (до 96% hit rate при стабильных агентных циклах). У Новичка практически не срабатывает. API-стоимость — чистые токены без подписки. Подписка — покрывает указанный объём (но может не покрывать при пиковых нагрузках на уровне Профи).

Как архитектура влияет на стоимость

Каждый шаг усложнения AI-системы умножает потребление токенов на один пользовательский запрос. Таблица показывает множители и итоговую стоимость в месяц.

Архитектура Множитель токенов Примерная стоимость в месяц Риск
Простой чат-бот 1× база ~$10 Низкий
С RAG 3–5× $30–50 Средний
Агентный (1 шаг) 5–10× $50–100 Высокий
Многошаговый агентный 10–20× $100–200 Очень высокий
Агент мониторинга 24/7 ∞ (непрерывно) $500–2,000+ Критический

Почему агентная разработка стоит в 1 000 раз дороже обычного чата

Microsoft Research проанализировала потребление токенов AI-агентами на задачах SWE-bench (стандартный бенчмарк для coding agents). Разница между простым запросом «напиши функцию» и полноценным агентом, который сам ищет файлы, правит код, запускает тесты и исправляет ошибки — три порядка.

4.17M токенов в среднем на задачу
~$1.86 стоимость задачи на Sonnet-tier
~1,000× против простого чата для кода
153:1 input:output (чат: 1.33:1)
Разные модели на одной задаче тратят по-разному: Kimi-K2 и Sonnet 4.5 тратят на 1.5M+ токенов больше, чем GPT-5. До 30× разброса между запусками одной и той же задачи — агенты ведут себя непредсказуемо.
Источник →

Реальные кейсы

Выводы (апрель–май 2026)

  1. Разброс 20× между начальным и продвинутым пользователем одного инструмента. Два разработчика на одной платформе могут отличаться в 20× по стоимости (LeanOps).
  2. Агентные системы = множитель 10–30× против простого чата (Gartner, март 2026). Простые мульти-шаговые агентные циклы тратят в 10–20× больше токенов на одну задачу.
  3. Маршрутизация моделей экономит 60–70% — направление простых запросов на бюджетные модели не снижает качество на рутинных задачах, но сокращает счёт в 2–3 раза.
  4. Prompt caching снижает реальную плату — 96% токенов у профи Claude Code пришлось на cache reads. API-счёт гораздо ниже, чем следует из сырого числа токенов.
  5. Обновление модели может удвоить счёт — Opus 4.6 → 4.7 добавил +46% токенов (новый токенизатор) и +190% output на turn (adaptive thinking). Одному пользователю это стоило +$25K в месяц.
  6. Убывающая отдача после оптимума — пользователи среднего уровня (p25–p75) лучше всех конвертируют токены в PR. Верхние 5% по затратам потребляют без пропорционального результата.
  7. Медианный разработчик: ~$50–500/мес. Power User: $400–1,000/мес. Профи: $1,500–4,200+/мес. Выбросы: до $77K/мес (но это единичные случаи).