Подсчёт токенов: скрытый счётчик за каждым ИИ-инструментом
Brian Long
В первой статье этой серии мы пришли к ментальной модели, которая снимает большую часть путаницы вокруг ИИ: большая языковая модель — это языковой процессор. Она принимает язык на входе и возвращает вам преобразованный язык на выходе — точно так же, как кухонный комбайн принимает овощи и выдаёт вам что-то нарезанное или измельчённое по заданным параметрам.
Эта модель отвечает на вопрос, для чего нужен инструмент. Данная статья отвечает на вопрос, который возникает в тот момент, когда вы начинаете использовать его для реальной работы: сколько это стоит и как отличить хорошую сделку от плохой?
Ответ сводится к одной-единственной единице измерения, которую вы наверняка видели в своём счёте или в мелком шрифте тарифного плана, толком не понимая, что она означает: токен. Токены — это счётчик, на котором работает ИИ. Как только вы их поймёте, вся экономика ИИ — цены, скорость и всё более острый вопрос об электроэнергии — перестанет быть загадкой и станет чем-то, чем можно реально управлять.
Что такое токен?
Токен — это фрагмент текста, обычно чуть меньше слова. ИИ-модели не читают побуквенно или пословно; они разбивают текст на такие фрагменты и обрабатывают их по одному.
Полезное практическое правило: один токен — это примерно три четверти слова. Тысяча слов английского текста — это примерно 1300–1500 токенов (Microsoft, Fullstack). Распространённые слова вроде «the» или «house» — это один токен. Более длинные или редкие слова разбиваются: «unbelievable» может превратиться в три токена — «un», «believ» и «able». Пунктуация и пробелы тоже считаются.
Зачем вообще дробить слова на части? Потому что это позволяет модели обрабатывать любое встреченное слово — включая те, что она никогда не видела: имена, опечатки, техническую терминологию — собирая их из знакомых частей, подобно тому как вы можете «озвучить» слово, которое никогда раньше не читали. Практический вывод для вас: всё, что вы вводите, и всё, что ИИ отвечает вам, измеряется и оплачивается в токенах. Счётчик работает постоянно, в обоих направлениях.
Запрос на входе, ответ на выходе: две стороны счётчика
А вот что удивляет большинство людей: токены, которые вы отправляете, и токены, которые получаете обратно, считаются отдельно — и обычно стоят по-разному.
Токены вашего запроса называются входными (или «промпт»-токенами). Токены ответа ИИ — это выходные токены (или токены «ответа»). Выходные токены почти всегда стоят дороже — часто в четыре-пять раз дороже за токен, чем входные.
Это может показаться произвольным, пока вы не вспомните модель кухонного комбайна. Прочитать ваш запрос — простая часть: ИИ поглощает весь ваш промпт практически за один проход. А вот генерация ответа — дорогая часть: модель производит его токен за токеном, и каждое новое слово зависит от всех предыдущих. Вы платите за труд создания, а не за труд чтения. Представьте переводчика, который берёт небольшую плату за то, чтобы прочитать ваш документ, но выставляет счёт постранично за то, что он вам напишет в ответ.
Отсюда прямое следствие, которое может сэкономить вам деньги. Длинный, подробный промпт — как раз тот вид тщательного брифинга, который мы рекомендовали в прошлой статье, — обходится дёшево. Загрузить ИИ контекстом и примерами стоит вам очень мало, потому что входные токены — это выгодная сторона счётчика. А вот в чём действительно стоит быть осмотрительным, так это в запросах на огромные объёмы вывода, которые вам не нужны. «Кратко изложи это в трёх пунктах» — не просто понятнее, чем «расскажи мне всё об этом», это ещё и дешевле.
Стоит знать ещё об одной детали, поскольку она сейчас меняет ИИ-счета по всей индустрии. Новейшие «рассуждающие» модели делают кое-что дополнительное: прежде чем ответить, они генерируют скрытый внутренний монолог — прорабатывая задачу шаг за шагом. Эти токены размышления оплачиваются точно так же, как любые другие выходные токены, даже если вы их никогда не видите. Ответ, показывающий вам 200 слов, мог незаметно израсходовать десятки тысяч токенов на приватные рассуждения (CodeAnt). Это мощно для по-настоящему сложных задач и расточительно для простых — и умение различать их становится реальным навыком, к которому мы ещё вернёмся.
Насколько быстро — это достаточно быстро? Скорость токенов
Токены также измеряют скорость. Когда вы наблюдаете, как ответ ИИ появляется на экране слово за словом, вы наблюдаете за прибытием токенов, и этот темп измеряется в токенах в секунду.
Полезный ориентир здесь удивительно человечен: примерно шесть-семь токенов в секунду — это обычная скорость чтения (Artificial Analysis). Если модель выдаёт текст хотя бы с такой скоростью, она успевает за вами по мере чтения — а это всё, что нужно для общения в чате, черновиков или резюмирования. Всё, что быстрее ваших глаз, в каком-то смысле пропадает впустую для человека-читателя.
Так почему же кого-то волнуют модели, выдающие 200, 300 и даже намного больше токенов в секунду? По двум причинам. Во-первых, когда ИИ выполняет работу, которую вы не читаете в реальном времени — перерабатывает сотню писем клиентов, анализирует длинный документ, — большая скорость означает меньше ожидания готового результата. Во-вторых, более новые агентные инструменты соединяют множество шагов ИИ за кулисами, и медленная модель заставляет всю цепочку ползти. Но для повседневной работы в окне чата, с которой начинают большинство малых предприятий, сегодняшние массовые модели все с запасом быстрее, чем вы можете читать. Скорость редко становится вашим узким местом. А вот стоимость и здравый смысл — да.
Эффективность токенов: показатель, который определит ближайшие годы
Как только вы начинаете видеть мир в токенах, в фокус попадает более важный вопрос — не «сколько стоит токен?», а «сколько полезной работы я получаю на токен?». Это эффективность, и она бывает двух видов, важных для владельца бизнеса: токены на доллар и токены на ватт.
Токены на доллар: иллюзия дешевизны
Сначала хорошая новость: сырые цены на токены стремительно падают. Стоимость покупки заданного уровня возможностей ИИ снижается в несколько раз год от года, и конкуренция жёсткая. По состоянию на середину 2026 года бюджетные модели стоят около 0,10 доллара за миллион входных токенов; массовые рабочие лошадки вроде серии GPT-5 от OpenAI или Claude Sonnet от Anthropic находятся в районе 2,50–3 долларов за миллион входных токенов (выходные токены при этом в четыре-пять раз дороже); а флагманские модели поднимаются до 5–30 долларов (CloudZero, BenchLM). Миллион токенов — это примерно 750 000 слов, почти целый увесистый роман, — за цену чашки кофе. По такой арифметике ИИ выглядит почти бесплатным.
А вот и загвоздка, и это самое важное, что нужно понимать в своём счёте: цены за токен падают, а общие счета за ИИ растут. Отраслевые аналитики называют это «иллюзией стоимости токенов» (Artefact, Indexnine). Цена за единицу упала примерно на 75% за год — но количество единиц, потребляемых современной задачей, взрывообразно выросло. Эти скрытые токены размышления, плюс агентные рабочие процессы, прогоняющие десятки шагов, означают, что один сложный запрос может незаметно поглотить от 50 000 до 500 000 токенов, прежде чем выдать вам ответ. Более дешёвые единицы, но их гораздо больше — счёт больше.
Дисциплина, которую это вознаграждает, — та самая, о которой мы твердим с самого начала: подбирайте инструмент под задачу. Использовать тяжеловесную рассуждающую модель, чтобы написать благодарственное письмо, — всё равно что копать яму под тюльпан экскаватором: сработает, но крайне неэффективно. Тот же простой запрос может стоить в десятки раз дороже на «думающей» модели, чем на модели подходящего размера, при том же результате. Передний край технологий тоже играет здесь роль: недавно выпущенная Claude Fable 5 от Anthropic, публичная версия их топовой модели класса Mythos, была выпущена в июне 2026 года примерно по цене вдвое выше предыдущего флагмана (Anthropic, CNBC). Это замечательный инструмент для по-настоящему сложных задач с высокими ставками — и абсолютная избыточность для переписывания объявления о вакансии. Эффективность — это не всегда покупка самой дешёвой или самой умной модели. Это отказ платить цену переднего края за рутинную работу.
Токены на ватт: вопрос за вопросом
Есть и второй счётчик, за которым почти никто за пределами отрасли пока не следит: энергия. В конечном счёте каждый токен производится чипом, потребляющим электричество. Исследователи теперь измеряют эффективность ИИ в токенах на ватт — или токенах на джоуль — именно по этой причине (John Snow Labs).
Это не второстепенная проблема. По некоторым оценкам, дата-центры мира были на пути к потреблению около 1050 тераватт-часов электроэнергии в 2026 году — этого достаточно, чтобы, будь они отдельной страной, они заняли бы пятое место по потреблению энергии на планете, между Японией и Россией (TTMS). Операторы энергосетей уже рассматривают «скорость подключения к сети» как решающий фактор того, смогут ли новые ИИ-объекты вообще быть построены (Всемирный экономический форум). Электричество, а не чипы, становится настоящим узким местом.
Для малого бизнеса это кажется абстрактным — пока вы не свяжете это со своим счётом. Поразительно низкие сегодняшние цены на токены держатся на огромных инвестициях, а местами — на продаже вычислительных мощностей ниже их реальной стоимости ради завоевания доли рынка. Электричество — это та статья расходов, которую нельзя обесценить искусственно. Энергоэффективность, а не сырая производительность, определит долгосрочную реальную цену ИИ — и коммерческую жизнеспособность компаний, которые его предоставляют. Модель, выполняющая вашу работу с наименьшим числом ватт, — это та модель, которая останется доступной, когда субсидии иссякнут.
Почему локальные и гибридные решения — это дорога вперёд
Именно здесь оба счётчика — доллары и ватты — указывают на один и тот же пункт назначения: для большей части того, что реально делает бизнес, суперкомпьютер переднего края не нужен.
Энергетическая математика впечатляет. Аппетит модели к энергии растёт быстрее, чем её размер: переход от модели с 7 миллиардами параметров к модели со 70 миллиардами может увеличить энергопотребление на токен примерно в сто раз (arXiv). Большинству бизнес-задач, связанных с языком, — составление текстов, резюмирование, переписывание, извлечение данных, — не нужна модель в сто раз прожорливее. Им нужна компетентная модель подходящего размера. И такие небольшие модели стали заметно лучше. Семейство открытых моделей Granite от IBM теперь выпускает версии, достаточно компактные, чтобы работать прямо в веб-браузере, специально созданные для эффективной, предсказуемой и недорогой корпоративной работы (VentureBeat, IBM Research). Способная открытая модель может производить полезный текст на современном ноутбуке или чипе телефона, потребляя всего горстку ватт — примерно столько же, сколько лампочка (arXiv).
Это открывает путь к гибридному подходу, и именно туда движутся умные деньги. Выполняйте рутинную, высокообъёмную, чувствительную с точки зрения конфиденциальности работу на небольших, эффективных моделях у себя дома — на собственном оборудовании, где предельная стоимость на токен приближается к нулю, а ваши данные никогда не покидают здание. Обращайтесь к дорогой облачной модели переднего края только для тех редких по-настоящему сложных задач, которые оправдывают затраты. Вы получаете лучшее из обоих миров: экономичность и энергоэффективность локального ИИ для основного объёма работы и мощь переднего края наготове для того редкого случая, когда она нужна. Вся отрасль — OpenAI, Google, IBM и стремительно развивающийся мир открытого исходного кода — одинаково устремлена к более мелким, дешёвым и эффективным моделям именно потому, что там находится устойчивая экономика.
Тихое преимущество, продолжение
Вернёмся к циклу шумихи, с которого мы начали эту серию. Во время бума речь шла о всё более крупных моделях и всё более впечатляющих демонстрациях. Эта фаза подходит к концу. Устойчивое преимущество следующей фазы построит не тот, кто тратит больше всех на самую эффектную модель, — его построит тот, кто использует ИИ эффективно: инструмент подходящего размера, хорошо проинструктированный, работающий за минимальное число долларов и ватт для выполнения задачи.
Это хорошая новость для малого и среднего бизнеса, и это та же хорошая новость, что и раньше. Вы никогда не собирались побеждать, тратя больше гигантов. Вы побеждаете, будучи осмотрительными — зная, что токен — это единица работы, за которую вы платите деньгами и энергией, и тратя и то и другое лишь там, где это реально что-то даёт. Инструменты становятся дешевле, компактнее и эффективнее с каждым месяцем. Компании, которые научатся считать свои токены, незаметно наберут преимущество, пока все остальные будут по-прежнему смотреть на передний край технологий.
В Synapses Technologies мы помогаем малому и среднему бизнесу найти это практичное, эффективное соответствие — правильный инструмент для реальной задачи. Это то, чем мы занимаемся. Если вы думаете, какие задачи подходят для компактной локальной модели, а какие стоят затрат на передний край, — это именно тот разговор, который мы любим вести.
Далее в серии: где искать повторяющиеся языковые задачи, скрытые в вашей собственной работе, и как проверять результаты ИИ, не теряя сэкономленное время.
- Токены
- Цены На ИИ
- Эффективность Токенов
- Стоимость LLM
- Входные И Выходные Токены
- Токены Размышления
- Энергопотребление ИИ
- Локальный ИИ
- Гибридный ИИ
- ИИ Для Малого Бизнеса
- Управление Затратами На ИИ
- Токены На Ватт