Дисциплина снижения токенов, потребляемых на user-visible результат в agentic AI-системе, без потери capability.
AI agent token optimization — практика анализа, где тратятся токены по жизненному циклу одной agentic-задачи — включая narrative модели, повторяющийся контекст, ретраи из-за провалов формата, free-form генерацию структурированных данных и сам system prompt — и снижение каждой категории через целевые архитектурные и prompting-изменения.
В типичной неоптимизированной agent-системе только около 8% общих токенов — реальный user-visible ответ. Остальные 92% — стоимость того, как система думает, а не что — повторяющийся контекст, самонарратив, retry-штормы, многословные system prompts и free-form генерация данных, которые модель могла эмитить как типизированную схему. Здесь живут снижения на порядок.
По Skopa engagements, agentic-системы обычно приходят с отношением 10:1 до 30:1 LLM-вызовов к user-visible результатам. После дисциплинированного token-optimisation engagement оседают на 2:1–5:1 без потери качества. Важные рычаги: разделение планирования и исполнения, перенос детерминированной логики в код, замена free-form вывода на типизированные схемы, удаление самонарратива, сжатие постоянного контекста, кэширование стабильного префикса, bounded iteration с жёсткими caps. Каждый ничем не примечателен в изоляции. Сложенные, регулярно дают снижения в 8×–20×.