IA na prática · Misto

Custo e latência em sistemas baseados em modelos

Em uma linha: A maior parte do custo vem do texto que entra, e a maior parte da latência do que sai — por isso as duas correções são diferentes.

Baixar o custo

Anexar menos contexto; rotear requisições simples para um modelo pequeno; aproveitar o cache para partes fixas; e agrupar o que não é urgente.

Calcule o custo por unidade de negócio — por requisição, por usuário, por pedido — não só uma soma mensal. É assim que você vê se o crescimento compensa.

Acelerar

Transmitir a resposta ao usuário em fluxo encurta a espera percebida mais do que qualquer outra otimização. Encurtar o comprimento da saída ajuda diretamente. E tarefas que podem rodar em paralelo — rode em paralelo.

Proteger o orçamento

Tetos diários, alertas ao cruzar limites e um limite de passos em processos automatizados. Um loop errado pode queimar o orçamento de um mês em horas.

Indo mais fundo

Etiquete cada chamada por usuário, capacidade e propósito. Sem etiquetas, a pergunta 'o que causou o pico' é respondida por suposição, e você não consegue desligar a capacidade cara e menos útil — que quase sempre existe e só aparece quando você olha.