Costes y latencia en sistemas basados en modelos
Bajar el coste
Adjuntar menos contexto; enrutar peticiones simples a un modelo pequeño; aprovechar la caché para las partes fijas; y agrupar lo que no es urgente.
Calcula el coste por unidad de negocio —por petición, por usuario, por pedido—, no solo una suma mensual. Así ves si el crecimiento compensa.
Acelerar
Transmitir la respuesta al usuario en flujo acorta la espera percibida más que cualquier otra optimización. Acortar la longitud de la salida ayuda directamente. Y las tareas que pueden correr en paralelo: córrelas en paralelo.
Proteger el presupuesto
Topes diarios, alertas al cruzar umbrales, y un límite de pasos en los procesos automatizados. Un bucle erróneo puede quemar el presupuesto de un mes en horas.
En profundidad
Etiqueta cada llamada por usuario, capacidad y propósito. Sin etiquetas, la pregunta '¿qué causó el pico?' se responde adivinando, y no puedes desactivar la capacidad cara y menos útil, que casi siempre existe y solo aparece cuando miras.