Reutilizar el prefijo cacheado de un prompt a través de las llamadas para reducir drásticamente el coste de tokens de input cuando el mismo contexto se envía repetidamente.
El prompt caching es una característica ofrecida por los principales proveedores de LLM (Anthropic, OpenAI, Google) que permite reutilizar un prefijo estable de tu prompt a través de múltiples llamadas. Los tokens de input cacheados se facturan con un descuento sustancial — típicamente 10–25% del precio estándar de input para las porciones cacheadas. Para aprovecharlo, el prompt debe estructurarse de forma que el contenido estable (system prompt, definiciones de tools, contexto largo) esté al principio, y el contenido por petición al final.
Para cargas de alto volumen donde el mismo system prompt y las mismas definiciones de tools se envían en cada llamada (la mayoría de los agentes IA en producción), el prompt caching puede entregar 30–60% de reducción en coste de tokens de input sin cambio arquitectónico — pura victoria de configuración. Es una de las optimizaciones de menor esfuerzo y mayor ROI en el stack de coste de IA.
El prompt caching es una táctica, no una estrategia. A través de las auditorías de Skopa, típicamente captura aproximadamente el 12% del ahorro total disponible — significativo, pero no donde viven las victorias de orden de magnitud. Siempre lo activamos donde la carga lo soporta, pero nunca empezamos un engagement de optimización de coste con ello. Las victorias más grandes están en la limpieza de orquestación y en la disciplina de prompt y contexto. El cacheo se vuelve valioso sólo después de que esas capas estén limpias.