IA na prática · Avançado

Conectar seu conhecimento ao modelo: recuperação sem palavras grandes

Em uma linha: O modelo não conhece seus documentos — você precisa encontrar os trechos relevantes para cada pergunta e anexá-los ao prompt.

Os quatro passos

Fragmentação. Corte por estrutura — seção, cabeçalho, linha — e guarde em cada fragmento o nome do documento e o caminho de cabeçalhos. O corte arbitrário é a causa mais comum de respostas ruins.

Indexação. Combinar busca baseada em significado com busca literal supera qualquer uma sozinha, especialmente em hebraico e com identificadores.

Recuperação. Poucos fragmentos relevantes, não muitos. Mais fragmentos custam mais, tornam mais lento e adicionam ruído.

Resposta. Instrua o modelo a responder apenas do material, citar uma fonte e dizer explicitamente quando não há resposta.

As armadilhas

Permissões esquecidas na recuperação; documentos contraditórios sem priorização por data; perguntas que são na verdade consultas de dados e não busca de texto; e ortografia hebraica não normalizada.

Como saber que funciona

Meça os dois passos separadamente: o fragmento correto apareceu nos resultados e, dado que apareceu — a resposta é precisa? Medir apenas o resultado final não diz o que corrigir.

Indo mais fundo

Construa um conjunto de perguntas onde cada uma tem um fragmento correto conhecido, e meça com que frequência ele apareceu entre os cinco primeiros. É a métrica que impulsiona a maioria das melhorias. Adicione reescrita da pergunta antes da busca, e mantenha o contexto de um turno anterior para perguntas de acompanhamento.