Часто у запросов совпадает начало: одна и та же длинная инструкция, один и тот же документ, один и тот же набор примеров. Каждый раз он заново разбирается моделью и каждый раз оплачивается целиком. Кэширование позволяет этого не делать: повторяющееся начало запоминается на стороне конечного сервиса, и при следующем обращении оно обходится в разы дешевле.
Запоминается не любой кусок текста, а начало запроса — от первого символа до той точки, где запросы начинают расходиться. Совпадение считается посимвольно с самого начала, поэтому одно изменение в первом абзаце обесценивает весь кэш, а изменения в конце — нет.
Отсюда единственное правило, которое действительно важно: постоянная часть должна идти в начале, переменная — в конце. Системное сообщение, большой документ и описания инструментов — сверху; вопрос пользователя — снизу.
Срок жизни кэша зависит от модели: у одних это около пяти минут, причём отсчёт начинается заново при каждом попадании, у других — не меньше получаса. Часть моделей позволяет продлить срок за отдельную плату. В любом случае кэш рассчитан на поток однотипных запросов подряд: для одного запроса раз в сутки он бесполезен.
У большинства моделей делать ничего не нужно: кэш срабатывает сам, когда совпадающее начало достаточно длинное. В формате Anthropic границу кэша отмечают явно — полем cache_control на последнем блоке той части, которую нужно запомнить:
{ "model": "anthropic/claude-sonnet-4-5", "max_tokens": 1024, "system": [{ "type": "text", "text": "<БОЛЬШАЯ ИНСТРУКЦИЯ ИЛИ ДОКУМЕНТ>", "cache_control": {"type": "ephemeral"} }], "messages": [ {"role": "user", "content": "Вопрос по документу"} ] }
Короткое начало не кэшируется вообще: у каждой модели есть минимальный размер, ниже которого запоминать нечего. Ориентир — около тысячи токенов, у отдельных моделей порог вчетверо выше. Поэтому на коротких запросах эффекта не будет, сколько пометок ни ставь.
Токены, прочитанные из кэша, тарифицируются по отдельной, заметно более низкой цене — обычно она примерно на порядок ниже обычной входной. Сколько токенов пришло из кэша, видно в объекте usage в ответе.
У части моделей отдельно тарифицируется и запись в кэш, причём дороже обычного ввода. Тогда первый запрос обходится дороже обычного, а выигрыш появляется со второго-третьего обращения к тому же началу. Есть ли у модели такая цена, видно в каталоге моделей.
- Генерация текста — из чего складывается запрос.
- Рассуждающие модели — другой способ повлиять на стоимость запроса.
Частые вопросы
Почему кэш не срабатывает?
Три обычные причины: начало запроса каждый раз немного разное, совпадающая часть слишком короткая, или между запросами прошло слишком много времени. Кэш считается строго от начала запроса, а срок его жизни у разных моделей разный — от нескольких минут до часа.
Что должно идти в начале запроса?
Всё, что не меняется от запроса к запросу: системное сообщение, большой документ, примеры, описания инструментов. Переменная часть — вопрос пользователя — должна быть в конце.
Кэш нужно включать вручную?
Чаще всего нет — он срабатывает автоматически при достаточно длинном совпадающем начале. Исключение составляет формат Anthropic, где границу кэша отмечают полем cache_control.
Может ли кэширование увеличить стоимость?
Да. У части моделей запись в кэш тарифицируется отдельно и стоит дороже обычного ввода. При однократном запросе это убыток, выигрыш начинается с повторных обращений к тому же началу. Цены на запись и чтение видны в каталоге моделей.
Последняя редакция: 2 сентября 2026 г.