GELATO
О насБесплатные материалыНаши обученияОтзывыВопрос-ответ
Войти
GELATO

Школа про работу с ИИ: от первого промпта до проекта, который проверяет себя сам.

Разделы

  • О нас
  • Бесплатные материалы
  • Наши обучения
  • Отзывы
  • Вопрос-ответ
  • Блог

Связаться

  • Написать лично
  • Канал школы

Отвечаем сами, без рассылок и автоответчиков.

Документы

  • Оферта
  • Политика конфиденциальности
© 2026 GELATOОбучение работе с ИИ и Claude Code
Блог

Куда уходят лимиты ИИ и как перестать их сжигать

Шесть причин, по которым токены заканчиваются быстрее с каждым днём, и что делать с каждой из них.

13 сентября 2026 г.·6 мин чтения·Эмиль, автор школы GELATO

Лимиты заканчиваются быстрее не потому, что модель стала хуже. Главная причина в том, что на каждый ваш запрос модель заново перечитывает весь чат целиком — и чем длиннее разговор, тем дороже обходится каждое следующее сообщение. Вторая причина: размытая задача заставляет её перерывать лишнее. Разберём все источники расхода по порядку и что делать с каждым.

Почему лимиты заканчиваются всё быстрее?

Модель не помнит предыдущие сообщения — она их перечитывает. Каждый раз, когда вы отправляете новую реплику, на вход уходит весь чат: ваши сообщения, ответы модели, содержимое файлов, которые она открывала, результаты поиска.

Отсюда эффект, который пугает новичков: первые десять сообщений в чате почти бесплатны, а к сотому одно короткое «поправь тут отступ» съедает больше, чем весь первый час работы. Вы пишете столько же, а тратите в разы больше.

Практический вывод: чат, растянутый на три дня, — самая дорогая вещь в вашей работе с ИИ. Не потому, что вы много написали, а потому, что модель перечитывает эти три дня при каждом обращении.

Что делать, когда чат разросся?

Есть три варианта, от простого к аккуратному.

Начать новый чат. Если задача закончилась и следующая с ней не связана — просто откройте новый. Это самый дешёвый способ и самый недооценённый.

Попросить выжимку. Если разговор нужно продолжить, скажите модели: «сделай краткую выжимку этого чата». Она сожмёт его в разы — в длинном обсуждении большая часть объёма это рассуждения вслух, отброшенные варианты и вода. Выжимку копируете в новый чат и работаете дальше с тем же контекстом, но без балласта.

Положиться на автосжатие. В Claude Code есть автокомпакт: когда чат подбирается к пределу, он сжимается сам. Это удобно, если вы за длиной не следите, но полагаться на него одного не стоит — он срабатывает не всегда и не везде, и сжимает по своему усмотрению, а не по вашему.

Один чат — одна задача

Это правило экономит больше, чем все остальные приёмы вместе взятые, и при этом ничего не стоит.

Когда вы в одном чате сначала правите лендинг, потом обсуждаете тексты, потом чините баг в оплате — модель тащит всё это за собой. К моменту, когда вы вернётесь к лендингу, в контексте лежат тексты и оплата, которые к делу не относятся, но оплачиваются полностью.

Новая задача — новый чат. Разговор остаётся коротким, а ответы точнее: модели не приходится выбирать, что из накопленного относится к делу.

Сколько стоит файл с правилами проекта

Если вы работаете в проекте с файлом CLAUDE.md, помните: он уходит на вход при каждом запросе в этом проекте. Не один раз в начале — каждый раз.

Поэтому в нём не должно быть ничего лишнего. Правило простое: если инструкция нужна постоянно — она здесь. Если нужна изредка или для одной задачи — ей здесь не место.

Файл со временем разрастается: туда дописывают по случаю и почти никогда не удаляют. Раз в месяц попросите модель пройтись по нему и оптимизировать — убрать дубли, свести повторы, оставить только то, что работает всегда. Это разовое действие, которое удешевляет каждый следующий запрос.

Почему из-за скиллов и правил лимит может сгореть за один запрос

Скиллы подтягиваются по правилам — модель сама решает, какие из них относятся к текущей задаче. Обычно это работает точечно: нужен один, подтянулся один.

Проблема возникает, когда задача сформулирована непонятно. Модель не понимает, что происходит, и начинает искать — просматривает скиллы один за другим. Если их двадцать или тридцать, она может подтянуть разом всё. Контекст мгновенно раздувается, и лимит выгорает за один запрос.

Это самая болезненная утечка, потому что она незаметна: вы написали одну строчку, а израсходовали как за час работы. То же касается правил (rules).

Что делать: держать набор скиллов и правил в чистоте. Всё, чем вы не пользуетесь, — удалять. Не «на всякий случай оставлю», а удалять: каждый лишний скилл это шанс, что в неудачный момент он подтянется вместе с остальными.

Что запоминают агенты

У агента есть память, и он ведёт её сам. Что-то сохраняет по своему усмотрению, что-то — если попросить явно: «сохрани это». Если он уже сохранил, то так и скажет; если нет — запишет.

Обратная сторона в том, что агент запоминает и то, что давно устарело или вообще не пригодилось. А обращается к памяти он регулярно — значит, платите вы за неё тоже регулярно.

Память агентов стоит просматривать так же, как файл правил: что устарело — убирать.

Главная причина расхода — размытая задача

Самое дорогое, что можно сделать, — это сказать «поменяй вот это вот тут», не указав, что и где.

Чтобы понять, почему так выходит, нужно знать одну вещь про языковые модели: они устроены так, чтобы отвечать и помогать. Отказаться от работы или сказать «я не понял задачу» для модели гораздо менее естественно, чем попытаться её выполнить. Поэтому она не остановится и не переспросит — она пойдёт искать.

И будет искать по-настоящему: открывать файл за файлом, просматривать проект, пытаться угадать, что вы имели в виду. Если вы упомянули то, чего в проекте вообще нет, она всё равно переберёт всё, прежде чем вернуться и сказать, что не нашла. Вы заплатите за весь этот поиск полностью — и не получите результата.

Отсюда правило: чем точнее вы указали место и предмет, тем дешевле работа. Назовите файл, страницу, блок, компонент — что угодно, что сужает поиск. Даже если вы не знаете точного имени файла, опишите как можно конкретнее: модель найдёт сама, но искать будет в нужном месте, а не по всему проекту.

Короткий промпт не значит дешёвый

Это главный контринтуитивный вывод, и он ломает привычку экономить на словах.

Сокращать имеет смысл не текст запроса, а лишнюю работу модели. Пятьсот лишних символов уточнений в вашем сообщении стоят копейки. Двадцать открытых наугад файлов, потому что уточнений не было, стоят в десятки раз больше.

Экономия на формулировке почти всегда оборачивается перерасходом на поиске и переделках.

Чек-лист: куда уходят ваши лимиты

  • Длинный чат — модель перечитывает его целиком при каждом сообщении
  • Несколько задач в одном чате — лишний контекст оплачивается вместе с нужным
  • Раздутый CLAUDE.md — уходит на вход при каждом запросе
  • Свалка из скиллов и правил — при непонятной задаче могут подтянуться разом
  • Забытая память агентов — устаревшее хранится и перечитывается
  • Размытая задача — модель перебирает проект вслепую, и это дороже всего остального

Частые вопросы

Почему длинный чат расходует лимиты быстрее?
Модель не помнит переписку, а перечитывает её заново на каждый запрос. Чем длиннее чат, тем дороже каждое следующее сообщение.
Нужно ли делать промпты максимально короткими?
Нет. Уточнения в запросе стоят копейки, а слепой поиск по проекту из-за неясной задачи — в десятки раз дороже.
Стоит ли хранить все правила в CLAUDE.md?
Нет. В основном файле оставляйте только постоянно нужный контекст: он уходит на вход при каждом запросе. Остальное — в rules и skills.
то же самое видео

Этот разбор есть в виде урока

Смотреть можно бесплатно и без регистрации — как удобнее, так и изучайте.

Смотреть урок

Читать дальше

  • AI-команда = офлайн-команда?
  • Промпт-инжиниринг простым языком