Куда уходят лимиты ИИ и как перестать их сжигать
Шесть причин, по которым токены заканчиваются быстрее с каждым днём, и что делать с каждой из них.
Лимиты заканчиваются быстрее не потому, что модель стала хуже. Главная причина в том, что на каждый ваш запрос модель заново перечитывает весь чат целиком — и чем длиннее разговор, тем дороже обходится каждое следующее сообщение. Вторая причина: размытая задача заставляет её перерывать лишнее. Разберём все источники расхода по порядку и что делать с каждым.
Почему лимиты заканчиваются всё быстрее?
Модель не помнит предыдущие сообщения — она их перечитывает. Каждый раз, когда вы отправляете новую реплику, на вход уходит весь чат: ваши сообщения, ответы модели, содержимое файлов, которые она открывала, результаты поиска.
Отсюда эффект, который пугает новичков: первые десять сообщений в чате почти бесплатны, а к сотому одно короткое «поправь тут отступ» съедает больше, чем весь первый час работы. Вы пишете столько же, а тратите в разы больше.
Практический вывод: чат, растянутый на три дня, — самая дорогая вещь в вашей работе с ИИ. Не потому, что вы много написали, а потому, что модель перечитывает эти три дня при каждом обращении.
Что делать, когда чат разросся?
Есть три варианта, от простого к аккуратному.
Начать новый чат. Если задача закончилась и следующая с ней не связана — просто откройте новый. Это самый дешёвый способ и самый недооценённый.
Попросить выжимку. Если разговор нужно продолжить, скажите модели: «сделай краткую выжимку этого чата». Она сожмёт его в разы — в длинном обсуждении большая часть объёма это рассуждения вслух, отброшенные варианты и вода. Выжимку копируете в новый чат и работаете дальше с тем же контекстом, но без балласта.
Положиться на автосжатие. В Claude Code есть автокомпакт: когда чат подбирается к пределу, он сжимается сам. Это удобно, если вы за длиной не следите, но полагаться на него одного не стоит — он срабатывает не всегда и не везде, и сжимает по своему усмотрению, а не по вашему.
Один чат — одна задача
Это правило экономит больше, чем все остальные приёмы вместе взятые, и при этом ничего не стоит.
Когда вы в одном чате сначала правите лендинг, потом обсуждаете тексты, потом чините баг в оплате — модель тащит всё это за собой. К моменту, когда вы вернётесь к лендингу, в контексте лежат тексты и оплата, которые к делу не относятся, но оплачиваются полностью.
Новая задача — новый чат. Разговор остаётся коротким, а ответы точнее: модели не приходится выбирать, что из накопленного относится к делу.
Сколько стоит файл с правилами проекта
Если вы работаете в проекте с файлом CLAUDE.md, помните: он уходит на вход при каждом запросе в этом проекте. Не один раз в начале — каждый раз.
Поэтому в нём не должно быть ничего лишнего. Правило простое: если инструкция нужна постоянно — она здесь. Если нужна изредка или для одной задачи — ей здесь не место.
Файл со временем разрастается: туда дописывают по случаю и почти никогда не удаляют. Раз в месяц попросите модель пройтись по нему и оптимизировать — убрать дубли, свести повторы, оставить только то, что работает всегда. Это разовое действие, которое удешевляет каждый следующий запрос.
Почему из-за скиллов и правил лимит может сгореть за один запрос
Скиллы подтягиваются по правилам — модель сама решает, какие из них относятся к текущей задаче. Обычно это работает точечно: нужен один, подтянулся один.
Проблема возникает, когда задача сформулирована непонятно. Модель не понимает, что происходит, и начинает искать — просматривает скиллы один за другим. Если их двадцать или тридцать, она может подтянуть разом всё. Контекст мгновенно раздувается, и лимит выгорает за один запрос.
Это самая болезненная утечка, потому что она незаметна: вы написали одну строчку, а израсходовали как за час работы. То же касается правил (rules).
Что делать: держать набор скиллов и правил в чистоте. Всё, чем вы не пользуетесь, — удалять. Не «на всякий случай оставлю», а удалять: каждый лишний скилл это шанс, что в неудачный момент он подтянется вместе с остальными.
Что запоминают агенты
У агента есть память, и он ведёт её сам. Что-то сохраняет по своему усмотрению, что-то — если попросить явно: «сохрани это». Если он уже сохранил, то так и скажет; если нет — запишет.
Обратная сторона в том, что агент запоминает и то, что давно устарело или вообще не пригодилось. А обращается к памяти он регулярно — значит, платите вы за неё тоже регулярно.
Память агентов стоит просматривать так же, как файл правил: что устарело — убирать.
Главная причина расхода — размытая задача
Самое дорогое, что можно сделать, — это сказать «поменяй вот это вот тут», не указав, что и где.
Чтобы понять, почему так выходит, нужно знать одну вещь про языковые модели: они устроены так, чтобы отвечать и помогать. Отказаться от работы или сказать «я не понял задачу» для модели гораздо менее естественно, чем попытаться её выполнить. Поэтому она не остановится и не переспросит — она пойдёт искать.
И будет искать по-настоящему: открывать файл за файлом, просматривать проект, пытаться угадать, что вы имели в виду. Если вы упомянули то, чего в проекте вообще нет, она всё равно переберёт всё, прежде чем вернуться и сказать, что не нашла. Вы заплатите за весь этот поиск полностью — и не получите результата.
Отсюда правило: чем точнее вы указали место и предмет, тем дешевле работа. Назовите файл, страницу, блок, компонент — что угодно, что сужает поиск. Даже если вы не знаете точного имени файла, опишите как можно конкретнее: модель найдёт сама, но искать будет в нужном месте, а не по всему проекту.
Короткий промпт не значит дешёвый
Это главный контринтуитивный вывод, и он ломает привычку экономить на словах.
Сокращать имеет смысл не текст запроса, а лишнюю работу модели. Пятьсот лишних символов уточнений в вашем сообщении стоят копейки. Двадцать открытых наугад файлов, потому что уточнений не было, стоят в десятки раз больше.
Экономия на формулировке почти всегда оборачивается перерасходом на поиске и переделках.
Чек-лист: куда уходят ваши лимиты
- Длинный чат — модель перечитывает его целиком при каждом сообщении
- Несколько задач в одном чате — лишний контекст оплачивается вместе с нужным
- Раздутый
CLAUDE.md— уходит на вход при каждом запросе - Свалка из скиллов и правил — при непонятной задаче могут подтянуться разом
- Забытая память агентов — устаревшее хранится и перечитывается
- Размытая задача — модель перебирает проект вслепую, и это дороже всего остального
Частые вопросы
- Почему длинный чат расходует лимиты быстрее?
- Модель не помнит переписку, а перечитывает её заново на каждый запрос. Чем длиннее чат, тем дороже каждое следующее сообщение.
- Нужно ли делать промпты максимально короткими?
- Нет. Уточнения в запросе стоят копейки, а слепой поиск по проекту из-за неясной задачи — в десятки раз дороже.
- Стоит ли хранить все правила в CLAUDE.md?
- Нет. В основном файле оставляйте только постоянно нужный контекст: он уходит на вход при каждом запросе. Остальное — в rules и skills.
