Selo de estado:
Preview(teto atual do produto) · Curso ACD-430 — Governança de IA: custo, egress, LGPD e aprovação humana · Aula 7 de 7 · Atualizado em 2026-10-04.
Objetivo#
Ao final desta aula você vai diagnosticar por sintoma — separar as quatro recusas que parecem iguais na tela (teto, desligamento, defesa do text-to-SQL, falta de evidência) e achar a causa de um consumo alto em menos de cinco minutos, usando só /auditoria e /billing.
Vídeo#
Identificador no manifesto: acd-430-07-troubleshooting-ia-custo · duração-alvo 6 min · tela do produto: /auditoria.
Roteiro (capítulos):
- 00:00–00:50 — Quatro telas quase idênticas, quatro causas diferentes: por que "a IA não respondeu" não é um diagnóstico.
- 00:50–02:20 — Caso 1 — recusando: teto atingido (
ai.blocked) × capacidade desligada × 503 sem provider × recusa por falta de evidência. - 02:20–03:40 — Caso 2 — cara: achar a chamada mais cara em
/auditoria, entender o escopo da pergunta e usar o cache de prompt a seu favor. - 03:40–04:50 — Caso 3 — lenta: consulta pesada,
maximumBytesBilled, cache de consulta e refresh fora do pico — o custo de dado, que não é o custo de IA. - 04:50–06:00 — O diagnóstico rápido em três passos, o exemplo Aurora e o "faça você mesmo".
Conteúdo#
Caso 1 — a IA está recusando
Quatro causas diferentes produzem telas parecidas. A distinção está no rastro, não na mensagem:
| Sintoma | Causa provável | Diagnóstico | O que fazer | Prevenção |
|---|---|---|---|---|
| "O limite de uso de IA deste mês foi atingido; fale com o administrador." | Teto mensal do workspace atingido | ai.blocked em /auditoria, com custo R$ 0 | Somar o mês e decidir: ajustar o teto (controle de plataforma) ou reduzir o uso | Acompanhar o acumulado antes do dia 20 |
| IA indisponível, mas o resto do produto funciona | Capacidade desligada (ai.sql / ai.insights) ou envio a provedores desligado | Ausência de novos eventos ai.* após um marco | Confirmar o estado da capacidade; o rastro anterior continua lá | Diferenciar de 402 (inadimplência) e 403 (papel) |
| Rota responde 503 em produção | Sem provider de IA configurado | Verdade de produção: nada finge sucesso | Aguardar; conferir configuração da plataforma | Healthcheck profundo no monitoramento |
| Resposta sem números, com recusa explicada | Q&A exige evidência/citação | Ler a proveniência e a marca de evidência fraca | Reformular com métrica e período explícitos | Perguntar sobre dados publicados (Gold) |
SQL gerado bloqueado (403) | Defesas do text-to-SQL (só SELECT, só marts publicados) | A mensagem de bloqueio diz o escopo | Ajustar a pergunta ao escopo permitido | Consultar apenas marts publicados |
Há um quinto caso que não é recusa e costuma ser lido como uma: a chamada marcada degraded. Ela significa que a checagem do teto falhou por erro de infra e a chamada foi liberada mesmo assim — o fail-safe existe porque derrubar toda a IA por um soluço do banco seria pior. degraded é o oposto de bloqueado.
Caso 2 — a IA está cara
Consumo de IA maior que o esperado quase sempre tem a mesma origem: perguntas amplas e repetidas. O diagnóstico é curto:
- Abra
/auditoriae filtreai.no período suspeito. - Ordene por custo e olhe os eventos
ai.usagedo topo: cada um traz o custo real em R$ e o resumo de egress. - Para a chamada mais cara, pergunte-se o que ela carregou: painel inteiro? período longo? snapshot grande?
Duas alavancas resolvem a maior parte: reduzir o escopo (métrica e período explícitos, painel específico) e reaproveitar o contexto. O cache de prompt faz o contexto estável (catálogo, schema, snapshot) ser relido a ~0,1× do preço nas chamadas seguintes — então várias perguntas sobre o mesmo painel, em sequência, custam muito menos do que a mesma quantidade de perguntas espalhadas por painéis diferentes.
Lembre que o custo de IA hoje é absorvido pelo plano, e a IA analista depende do plano (a partir do Growth). O teto não é uma fatura: é um freio contra laço e abuso.
Caso 3 — a IA (ou o painel) está lenta
Aqui o custo em jogo costuma ser de dado, não de IA:
| Sintoma | Causa provável | Diagnóstico | O que fazer | Prevenção |
|---|---|---|---|---|
| Consulta cortada por custo | Atingiu a guarda de bytes por consulta | O erro traz o custo do run | Filtrar/agregar; reduzir o período | Modelar Gold enxuto; particionar |
| Dashboard lento no refresh | Consulta pesada / sem cache | Comparar a 1ª execução com a repetição | Consultas idênticas servem do cache (R$ 0) | Agendar refresh fora do pico |
| Custo projetado alto | Varredura de tabela grande | Ver os bytes na auditoria | Filtrar/agregar; usar partições | Evitar paginar a tabela inteira |
Refresh manual bloqueado (402) | Inadimplência, não performance | É a regra do dinheiro, não o teto de IA | O owner regulariza | Acompanhar o faturamento |
Os valores em R$ são projeção
O custo por evento é projeção, não preço faturado garantido. A guarda de bytes limita o custo por consulta; o teto mensal de IA limita o gasto de IA no mês. São freios diferentes, em contas diferentes.
Exemplo: a segunda-feira da Aurora Varejo
Três chamados chegam na mesma manhã. Maria (owner) resolve os três em /auditoria:
- "A IA parou." No dia 20, o acumulado do mês bateu no teto de R$ 10 configurado para a janela de treino. Em
/auditoriahá umai.blockedcom custo R$ 0 e a mensagem que Ana viu na tela. Nada mais quebrou: o painel abriu, o relatório das 7h saiu sem a narrativa, o alerta de meta disparou e a anomalia diária deMEDIDA('Receita')rodou — todos determinísticos. - "Está caríssimo." Ordenando por custo, duas perguntas de insight sobre o painel inteiro, em dias diferentes, somam quase metade do mês. A orientação é objetiva: perguntar com métrica e período definidos, e fazer as perguntas do mesmo painel em sequência para aproveitar o cache.
- "O painel demora." Esse não é IA: a consulta varre
aurora_gold.vendassem filtro de período. A repetição serve do cache (R$ 0), o que confirma o diagnóstico — o problema é a primeira execução, e a solução é filtro e partição.
Erros comuns
- Tratar o teto estourado como queda do produto. Só as cinco capacidades com LLM recusam.
- Confundir 402 (inadimplência) com teto de IA. São camadas diferentes, com mensagens diferentes.
- Achar que desligar a IA apaga o histórico de consumo. Não apaga; o rastro fica pelos 730 dias de retenção.
- Somar reserva + uso ao calcular o mês. O dinheiro é o
ai.usage; a reserva é estimativa. - Ler contribuição como causa. A decomposição de variação diz quanto cada fator contribuiu, com fechamento matemático — não por que.
- Concluir que "não houve atividade" com a tela vazia. A janela é de 200 eventos e o filtro padrão é de 7 dias.
O que o diagnóstico NÃO entrega, e em que estado está
/auditoria não pagina além dos últimos 200 eventos, o status OK/erro é derivado do texto da ação (não um campo dedicado) e o custo por evento é projeção. Não há hoje um painel self-service de teto de IA por workspace, nem número publicado de latência de IA: o soak de IA real em produção não foi medido, e escala real em nuvem também não (por isso nenhuma promessa de SLA). Esta aula é conceitual — ela ensina a ler o que as outras seis capacidades registram. Nada aqui é GA.
Faça você mesmo#
No workspace de treino Aurora Varejo (abra /auditoria no console):
- Caso "recusando": localize (ou provoque) um
ai.blockede confirme as duas marcas — custo R$ 0 e a mensagem que manda falar com o administrador. - No mesmo período, confirme que uma capacidade determinística (alerta ou anomalia) rodou normalmente — prova de que a recusa é cirúrgica.
- Escreva a árvore de decisão das quatro recusas: teto · capacidade desligada · 503 sem provider · falta de evidência. Uma linha de diagnóstico para cada.
- Caso "cara": ordene os eventos
ai.por custo e identifique a chamada mais cara do mês; anote o resumo de egress dela e por que ela foi cara. - Faça duas perguntas sobre o mesmo painel em sequência e compare o custo real das duas. ⚠️ Este passo consome orçamento de IA do workspace. Registre o efeito do cache de prompt.
- Reformule a pergunta mais cara com métrica e período explícitos e compare o custo com o da versão ampla.
- Caso "lenta": rode a mesma consulta duas vezes e compare — a repetição deve servir do cache (R$ 0). Diga se o problema é custo de dado ou de IA.
- Escreva o seu diagnóstico rápido em três passos, do jeito que você entregaria para outra pessoa do time.
Você terminou quando tiver os três casos resolvidos com evidência das suas próprias telas — um ai.blocked de custo zero, uma comparação de custo entre pergunta ampla e pergunta objetiva, e uma consulta repetida servida do cache — e a árvore das quatro recusas escrita.
Checagem rápida#
Três perguntas no final da aula, corrigidas no servidor. A aula só conta como concluída depois da checagem.
Documentação relacionada#
- suporte/troubleshooting-ia-custo-performance
- ai/privacidade-egress-orcamento
- administracao/auditoria
- administracao/consumo-e-quotas
- suporte/status-e-limitacoes
Capacidades ensinadas#
(conceitual — sem capacidade específica da matriz) — o selo exibido na aula é sempre o estado mais conservador entre as capacidades citadas; nada aqui é "GA".