Saltar al contenido
Docs

Esta página aún no está traducida — estás leyendo la versión en portugués. Ver en portugués

PreviewActualizado el 2026-09-08

Alucinações e validação

O que é uma alucinação de LLM, como o ingestia.io a detecta e recusa, e como você confere.

En esta página (8)

Uma alucinação é quando o LLM afirma algo com confiança, mas sem lastro nos dados — um número que não existe, um id inventado, um total sobre uma amostra. Esta página explica como o ingestia.io reduz e detecta alucinações e como você confere. O princípio da casa é um só:

A IA do produto recusa e avisa — ela não finge. Quando não há evidência, ela diz que não há.

Maturidade

Todas as capacidades com LLM são Preview; a qualidade em produção é NOT_MEASURED. As defesas descritas aqui são determinísticas e cobertas por testes — mas nenhuma defesa elimina 100% do risco. Revise sempre.

A ideia central: o LLM redige, o código valida#

O ponto que muda tudo: quem decide se a resposta tem lastro é código puro, não o LLM. O modelo escreve o texto; validadores determinísticos conferem esse texto contra o que realmente viajou no prompt. É verificação sobre a saída do LLM.

Como cada capacidade se defende#

CapacidadeDefesa determinística
Q&ACada widget/linha recebe um id ([W1], [W1.r3]); o LLM precisa citar esses ids, e verificarCitacoes confere cada citação contra o índice do que viajou — não contra o texto do modelo. Citação forjada não passa.
Text-to-SQLGera apenas SELECT; no caminho semântico, id inexistente → SQL descartado; ambiguidade → recusa antes de gastar token; dry-run real no datalake valida bytes/custo.
Geração assistidaO artefato passa pelos mesmos validadores do editor (medida, typecheck de fórmula, compilação do modelo, allowlist de visuais, validação de SQL). Reprovou → autocorreção uma vez; persistiu → sai como rascunho com os erros à mostra.
NarrativaRegra inegociável no prompt: usar exclusivamente números presentes nos dados. Sem período anterior, a variação é null e a narrativa declara "sem base de comparação" — nunca inventa.
InsightsAs "anomalias" e "recomendações" são leitura do LLM, marcadas como hipóteses — separadas do detector estatístico determinístico (ver Anomalias).

As formas de recusa (a resposta sem lastro não sai como fato)#

  • fora_do_contexto — a pergunta não toca nenhum termo do painel: recusa antes de gastar token.
  • sem_evidencia — o LLM respondeu, mas nenhuma citação confere: vira recusa (o custo real é liquidado com honestidade).
  • evidenciaFraca — a maioria das citações é ruim: a resposta sai com aviso, e só as citações que conferem entram como evidência.
  • ia_indisponivel — sem provider/erro: fallback honesto, citações vazias, nunca evidência fingida.

Regra de ouro: sem causalidade não provada#

Nenhuma resposta de IA afirma causa e efeito que os dados não comprovam. A narrativa usa só números presentes; o Q&A só afirma o que consegue citar; insights são hipóteses; anomalias/previsões descrevem desvio e tendência estatísticos, nunca "X causou Y". Correlação vista num painel não vira causa.

Como você confere (validação prática)#

  1. Teste a citação forjada

    No Q&A, coloque numa célula um texto tipo "[W9.r9]" e confirme que ele NÃO vira citação válida.

  2. Force uma recusa

    Faça uma pergunta que o painel não sustenta e confirme que sai como recusa, não como fato.

  3. Revise o SQL

    No text-to-SQL, leia o SQL e a explicação antes de rodar; confira nomes de coluna/tabela.

  4. Cheque o rascunho honesto

    Na geração assistida, peça algo impossível e confirme rascunho: true com os erros listados.

  5. Confira a proveniência

    Toda resposta traz proveniencia (modelo, versão do prompt, custo em R$, opId) — use para auditar.

Sinais de alerta (quando desconfiar)#

  • Número "redondo" demais ou que você não encontra no painel.
  • Afirmação de total sobre um visual marcado como amostra.
  • Linguagem de causa ("caiu por causa de…") — a IA não deveria afirmar isso.
  • Resposta sem citação no Q&A.

Limites e ressalvas#

  • Validação determinística cobre estrutura, ids, citações e SQL — não garante que a interpretação de negócio esteja certa. O humano decide.
  • A avaliação humana de qualidade da IA real (normais/ambíguas/causais) é trabalho de produção ainda NOT_MEASURED.

Relacionados#


Última revisão: 2026-09-08.

Enlaces relacionados