IA en la práctica · Mixto

Costes y latencia en sistemas basados en modelos

En una línea: La mayor parte del coste viene del texto que entra, y la mayor parte de la latencia del que sale; por eso las dos soluciones son distintas.

Bajar el coste

Adjuntar menos contexto; enrutar peticiones simples a un modelo pequeño; aprovechar la caché para las partes fijas; y agrupar lo que no es urgente.

Calcula el coste por unidad de negocio —por petición, por usuario, por pedido—, no solo una suma mensual. Así ves si el crecimiento compensa.

Acelerar

Transmitir la respuesta al usuario en flujo acorta la espera percibida más que cualquier otra optimización. Acortar la longitud de la salida ayuda directamente. Y las tareas que pueden correr en paralelo: córrelas en paralelo.

Proteger el presupuesto

Topes diarios, alertas al cruzar umbrales, y un límite de pasos en los procesos automatizados. Un bucle erróneo puede quemar el presupuesto de un mes en horas.

En profundidad

Etiqueta cada llamada por usuario, capacidad y propósito. Sin etiquetas, la pregunta '¿qué causó el pico?' se responde adivinando, y no puedes desactivar la capacidad cara y menos útil, que casi siempre existe y solo aparece cuando miras.