Переиспользование закэшированного префикса промпта между вызовами для драматичного снижения стоимости input-токенов, когда тот же контекст шлётся повторно.
Prompt caching — фича, предлагаемая крупными LLM-провайдерами (Anthropic, OpenAI, Google), позволяющая переиспользовать стабильный префикс вашего промпта между несколькими вызовами. Закэшированные input-токены биллятся со значительной скидкой — обычно 10–25% от стандартной input-цены для cached-частей. Чтобы воспользоваться, промпт должен быть структурирован так, чтобы стабильный контент (system prompt, определения tools, длинный контекст) был в начале, а per-request контент — в конце.
Для high-volume нагрузок, где тот же system prompt и определения tools шлются на каждом вызове (большинство production AI-агентов), prompt caching может дать 30–60% снижения стоимости input-токенов без архитектурных изменений — чистая конфигурационная победа. Это одна из самых low-effort, high-ROI оптимизаций в AI cost-стеке.
Prompt caching — тактика, не стратегия. По Skopa-аудитам, обычно захватывает около 12% общей доступной экономии — существенно, но не там, где живут победы на порядок. Мы всегда включаем там, где нагрузка поддерживает, но никогда не начинаем cost optimization engagement с этого. Большие победы в чистке оркестрации и дисциплине промпта/контекста. Кэширование становится ценным только после того, как эти слои чисты.