Pular para o conteúdo

IA lenta, cara ou recusando

Aula 7 de 76 minOperarAtualizada em 2026-10-04

Vídeo em produção

A gravação desta aula está no lote de produção. O objetivo, o exercício e a documentação já valem. Duração-alvo: 6 min.

Objetivo: Diagnosticar por sintoma

Selo de estado: Preview (teto atual do produto) · Curso ACD-430 — Governança de IA: custo, egress, LGPD e aprovação humana · Aula 7 de 7 · Atualizado em 2026-10-04.

Objetivo#

Ao final desta aula você vai diagnosticar por sintoma — separar as quatro recusas que parecem iguais na tela (teto, desligamento, defesa do text-to-SQL, falta de evidência) e achar a causa de um consumo alto em menos de cinco minutos, usando só /auditoria e /billing.

Vídeo#

Identificador no manifesto: acd-430-07-troubleshooting-ia-custo · duração-alvo 6 min · tela do produto: /auditoria.

Roteiro (capítulos):

  1. 00:00–00:50 — Quatro telas quase idênticas, quatro causas diferentes: por que "a IA não respondeu" não é um diagnóstico.
  2. 00:50–02:20 — Caso 1 — recusando: teto atingido (ai.blocked) × capacidade desligada × 503 sem provider × recusa por falta de evidência.
  3. 02:20–03:40 — Caso 2 — cara: achar a chamada mais cara em /auditoria, entender o escopo da pergunta e usar o cache de prompt a seu favor.
  4. 03:40–04:50 — Caso 3 — lenta: consulta pesada, maximumBytesBilled, cache de consulta e refresh fora do pico — o custo de dado, que não é o custo de IA.
  5. 04:50–06:00 — O diagnóstico rápido em três passos, o exemplo Aurora e o "faça você mesmo".

Conteúdo#

Caso 1 — a IA está recusando

Quatro causas diferentes produzem telas parecidas. A distinção está no rastro, não na mensagem:

SintomaCausa provávelDiagnósticoO que fazerPrevenção
"O limite de uso de IA deste mês foi atingido; fale com o administrador."Teto mensal do workspace atingidoai.blocked em /auditoria, com custo R$ 0Somar o mês e decidir: ajustar o teto (controle de plataforma) ou reduzir o usoAcompanhar o acumulado antes do dia 20
IA indisponível, mas o resto do produto funcionaCapacidade desligada (ai.sql / ai.insights) ou envio a provedores desligadoAusência de novos eventos ai.* após um marcoConfirmar o estado da capacidade; o rastro anterior continua láDiferenciar de 402 (inadimplência) e 403 (papel)
Rota responde 503 em produçãoSem provider de IA configuradoVerdade de produção: nada finge sucessoAguardar; conferir configuração da plataformaHealthcheck profundo no monitoramento
Resposta sem números, com recusa explicadaQ&A exige evidência/citaçãoLer a proveniência e a marca de evidência fracaReformular com métrica e período explícitosPerguntar sobre dados publicados (Gold)
SQL gerado bloqueado (403)Defesas do text-to-SQL (só SELECT, só marts publicados)A mensagem de bloqueio diz o escopoAjustar a pergunta ao escopo permitidoConsultar apenas marts publicados

Há um quinto caso que não é recusa e costuma ser lido como uma: a chamada marcada degraded. Ela significa que a checagem do teto falhou por erro de infra e a chamada foi liberada mesmo assim — o fail-safe existe porque derrubar toda a IA por um soluço do banco seria pior. degraded é o oposto de bloqueado.

Caso 2 — a IA está cara

Consumo de IA maior que o esperado quase sempre tem a mesma origem: perguntas amplas e repetidas. O diagnóstico é curto:

  1. Abra /auditoria e filtre ai. no período suspeito.
  2. Ordene por custo e olhe os eventos ai.usage do topo: cada um traz o custo real em R$ e o resumo de egress.
  3. Para a chamada mais cara, pergunte-se o que ela carregou: painel inteiro? período longo? snapshot grande?

Duas alavancas resolvem a maior parte: reduzir o escopo (métrica e período explícitos, painel específico) e reaproveitar o contexto. O cache de prompt faz o contexto estável (catálogo, schema, snapshot) ser relido a ~0,1× do preço nas chamadas seguintes — então várias perguntas sobre o mesmo painel, em sequência, custam muito menos do que a mesma quantidade de perguntas espalhadas por painéis diferentes.

Lembre que o custo de IA hoje é absorvido pelo plano, e a IA analista depende do plano (a partir do Growth). O teto não é uma fatura: é um freio contra laço e abuso.

Caso 3 — a IA (ou o painel) está lenta

Aqui o custo em jogo costuma ser de dado, não de IA:

SintomaCausa provávelDiagnósticoO que fazerPrevenção
Consulta cortada por custoAtingiu a guarda de bytes por consultaO erro traz o custo do runFiltrar/agregar; reduzir o períodoModelar Gold enxuto; particionar
Dashboard lento no refreshConsulta pesada / sem cacheComparar a 1ª execução com a repetiçãoConsultas idênticas servem do cache (R$ 0)Agendar refresh fora do pico
Custo projetado altoVarredura de tabela grandeVer os bytes na auditoriaFiltrar/agregar; usar partiçõesEvitar paginar a tabela inteira
Refresh manual bloqueado (402)Inadimplência, não performanceÉ a regra do dinheiro, não o teto de IAO owner regularizaAcompanhar o faturamento

Os valores em R$ são projeção

O custo por evento é projeção, não preço faturado garantido. A guarda de bytes limita o custo por consulta; o teto mensal de IA limita o gasto de IA no mês. São freios diferentes, em contas diferentes.

Exemplo: a segunda-feira da Aurora Varejo

Três chamados chegam na mesma manhã. Maria (owner) resolve os três em /auditoria:

  1. "A IA parou." No dia 20, o acumulado do mês bateu no teto de R$ 10 configurado para a janela de treino. Em /auditoria há um ai.blocked com custo R$ 0 e a mensagem que Ana viu na tela. Nada mais quebrou: o painel abriu, o relatório das 7h saiu sem a narrativa, o alerta de meta disparou e a anomalia diária de MEDIDA('Receita') rodou — todos determinísticos.
  2. "Está caríssimo." Ordenando por custo, duas perguntas de insight sobre o painel inteiro, em dias diferentes, somam quase metade do mês. A orientação é objetiva: perguntar com métrica e período definidos, e fazer as perguntas do mesmo painel em sequência para aproveitar o cache.
  3. "O painel demora." Esse não é IA: a consulta varre aurora_gold.vendas sem filtro de período. A repetição serve do cache (R$ 0), o que confirma o diagnóstico — o problema é a primeira execução, e a solução é filtro e partição.

Erros comuns

  • Tratar o teto estourado como queda do produto. Só as cinco capacidades com LLM recusam.
  • Confundir 402 (inadimplência) com teto de IA. São camadas diferentes, com mensagens diferentes.
  • Achar que desligar a IA apaga o histórico de consumo. Não apaga; o rastro fica pelos 730 dias de retenção.
  • Somar reserva + uso ao calcular o mês. O dinheiro é o ai.usage; a reserva é estimativa.
  • Ler contribuição como causa. A decomposição de variação diz quanto cada fator contribuiu, com fechamento matemático — não por que.
  • Concluir que "não houve atividade" com a tela vazia. A janela é de 200 eventos e o filtro padrão é de 7 dias.

O que o diagnóstico NÃO entrega, e em que estado está

/auditoria não pagina além dos últimos 200 eventos, o status OK/erro é derivado do texto da ação (não um campo dedicado) e o custo por evento é projeção. Não há hoje um painel self-service de teto de IA por workspace, nem número publicado de latência de IA: o soak de IA real em produção não foi medido, e escala real em nuvem também não (por isso nenhuma promessa de SLA). Esta aula é conceitual — ela ensina a ler o que as outras seis capacidades registram. Nada aqui é GA.

Faça você mesmo#

No workspace de treino Aurora Varejo (abra /auditoria no console):

  1. Caso "recusando": localize (ou provoque) um ai.blocked e confirme as duas marcas — custo R$ 0 e a mensagem que manda falar com o administrador.
  2. No mesmo período, confirme que uma capacidade determinística (alerta ou anomalia) rodou normalmente — prova de que a recusa é cirúrgica.
  3. Escreva a árvore de decisão das quatro recusas: teto · capacidade desligada · 503 sem provider · falta de evidência. Uma linha de diagnóstico para cada.
  4. Caso "cara": ordene os eventos ai. por custo e identifique a chamada mais cara do mês; anote o resumo de egress dela e por que ela foi cara.
  5. Faça duas perguntas sobre o mesmo painel em sequência e compare o custo real das duas. ⚠️ Este passo consome orçamento de IA do workspace. Registre o efeito do cache de prompt.
  6. Reformule a pergunta mais cara com métrica e período explícitos e compare o custo com o da versão ampla.
  7. Caso "lenta": rode a mesma consulta duas vezes e compare — a repetição deve servir do cache (R$ 0). Diga se o problema é custo de dado ou de IA.
  8. Escreva o seu diagnóstico rápido em três passos, do jeito que você entregaria para outra pessoa do time.

Você terminou quando tiver os três casos resolvidos com evidência das suas próprias telas — um ai.blocked de custo zero, uma comparação de custo entre pergunta ampla e pergunta objetiva, e uma consulta repetida servida do cache — e a árvore das quatro recusas escrita.

Checagem rápida#

Três perguntas no final da aula, corrigidas no servidor. A aula só conta como concluída depois da checagem.

Documentação relacionada#

Capacidades ensinadas#

(conceitual — sem capacidade específica da matriz) — o selo exibido na aula é sempre o estado mais conservador entre as capacidades citadas; nada aqui é "GA".

Carregando seu progresso…