Pular para o conteúdo

Responder a um incidente

Objetivo: responder a uma falha de forma consistente, sem improviso — cada tipo de incidente tem um runbook (passo a passo) próprio.

  1. Identificar — qual entrega falhou? Para qual atleta/assessoria? (geralmente já vem de um alerta de pipeline).
  2. Abrir o runbook do tipo de incidente.
  3. Diagnosticar antes de agir — confirmar o estado real (o dado existe? foi enviado? o canal está certo?) antes de reenviar.
  4. Corrigir e confirmar — executar a correção e validar que a entrega aconteceu de fato (não basta “rodou”).
SituaçãoResposta, em resumo
Análise não chegou ao alunoConferir se a análise existe e se foi enviada; validar o canal correto; reenviar respeitando a assessoria.
Falha no provedor de IAConferir os registros; o sistema já tem fallback automático; se persistir, escalar.
Webhook do canal falhandoValidar o segredo/configuração e reenviar.
Veredito semanal sem respostaÉ o atleta que responde (até domingo); o fallback é automático. O ops não responde pelo atleta.
Canary de periodizaçãoAbrir/monitorar/reverter com os scripts controlados e a janela definida.

Os runbooks completos ficam na pasta runbooks/ do repositório — cada um com o passo a passo detalhado.