Un marco de decisión de coste e ingeniería para elegir entre APIs LLM hosteadas (Anthropic, OpenAI, Gemini) e inferencia self-hosted (Ollama, vLLM, clusters GPU on-premise).
El gasto mensual de inferencia está por debajo del umbral de cinco cifras
La carga está dominada por razonamiento frontier-tier que los modelos de pesos abiertos no pueden igualar
Necesitas acceso a los últimos modelos a los pocos días del release
Tu equipo no tiene experiencia operativa con infraestructura GPU
Estás en etapa temprana y la simplicidad operativa supera a la optimización de coste
El gasto mensual de inferencia ha cruzado cinco cifras y está dominado por llamadas repetitivas a modelos pequeños
Los requisitos de residencia o soberanía de datos descartan a los vendors hosteados
Necesitas latencia predecible que no degrade durante picos de carga del proveedor
Estás ejecutando un tipo de carga (clasificación, extracción, generación de embeddings, resumen) donde los modelos mid-tier de pesos abiertos igualan la calidad de las APIs frontier-tier a una fracción del coste
Tu equipo tiene el músculo operativo para poseer infraestructura GPU — o está dispuesto a construirlo
Paso 1 — Perfila tu carga. ¿Qué cuota de llamadas son razonamiento frontier-tier vs extracción / clasificación / resumen mid-tier? La respuesta casi siempre empuja hacia un híbrido: hosteado para frontier, self-hosted para la cola larga.
Paso 2 — Modela el coste real por petición incluyendo infraestructura amortizada para el lado self-hosted. Incluye lease de GPU, tiempo de ingeniería ops, tiempo de evaluation harness, y el coste de mantenerse en la cadencia de releases de modelos de pesos abiertos.
Paso 3 — Ejecuta una eval de 50 prompts sobre el modelo de pesos abiertos que estás considerando contra el equivalente hosteado para tu carga específica. La mayoría de los equipos descubren que la brecha de calidad es menor de lo que asumían para tareas no-razonamiento.
Paso 4 — Proyecta coste y carga operativa hacia adelante al 100% de la escala esperada. El punto de equilibrio rara vez está donde la intuición lo coloca.
Paso 5 — Por defecto a híbrido por encima del umbral de equilibrio. El lock-in de estrategia única (todo hosteado o todo self-hosted) casi siempre paga de más o no escala.
La decisión cloud-vs-on-premise rara vez es un either-or limpio por encima de la escala. Los equipos que Skopa audita en el extremo alto del gasto en inferencia casi siempre terminan ejecutando un híbrido: APIs hosteadas frontier-tier para el razonamiento genuinamente difícil, clusters self-hosted Ollama o vLLM para la cola larga de llamadas repetitivas. La disciplina que decide si la economía self-hosted realmente paga es la utilización de GPU — clusters provisionados para carga pico y ejecutándose al 15% de utilización media casi siempre pierden frente a APIs hosteadas. Clusters dimensionados correctamente con autoscaling y colas de peticiones casi siempre los vencen por encima del umbral de equilibrio.