У большинства enterprise AI-счетов, тихо вырастающих до пятизначных и шестизначных сумм, одна и та же первопричина — и не та, к которой инженерные команды тянутся первой. Полевой отчёт о том, что реально гонит расходы на инференс вверх, и о дисциплине, возвращающей их к числу, которое CFO перестаёт пересылать с вопросительным знаком.
AI-счета, удваивающиеся каждый квартал — это не ценовая проблема, а складывающаяся архитектурная. Модель поменьше и больше кэша обычно захватывают меньше трети доступной экономии. Остальные две трети живут в оркестрации, дисциплине промпта и контекста, UX и governance.
Кэширование адресует один конкретный режим отказа — повторяющиеся идентичные или почти идентичные вызовы. Большинство enterprise AI-счетов, растущих квартал к кварталу, проваливаются не в кэшировании; они проваливаются в оркестрации, дисциплине контекста и отсутствии cost governance. Кэширование обычно захватывает около десятой части доступной экономии; остальное в другом.
Редко. Замены на более дешёвую модель выглядят привлекательно изолированно, но часто каскадируют в больше ретраев, больше контекста и больше downstream-корректировок, которые стирают per-call экономию. Первый ход почти всегда — видимость (нормальная per-request трассировка токенов), затем чистка оркестрации, и только потом оценка смены модели.
Победы видимости (трассировка, теги, алерты) обычно приземляются на первой неделе. Быстрые победы по промпту и оркестрации — на второй-третьей и обычно составляют 20–40% снижения. Структурные победы — те, что дают заголовочные числа на порядок — приземляются в течение следующих двух месяцев по мере доставки дизайн-изменений.