As APIs falham de forma diferente dos sites: respondem 200 com um corpo de erro, ficam lentas antes de ficarem indisponíveis e dependem de filas que ninguém vigia. Eis como monitorizá-las.
Valide o corpo da resposta
Escolha um endpoint de saúde que verifique a base de dados e a cache, devolva JSON, e monitorize um campo como $.status igual a ok.
Autentique
Use um token apenas de leitura num cabeçalho Authorization. Faça a sua rotação como a de qualquer outro segredo.
Vigie a latência
Defina um limite de aproximadamente o dobro do seu p95 normal. Uma API lenta é normalmente um indicador antecipado de uma falha.
Monitorize os workers
Consumidores de filas e cron jobs precisam de monitores heartbeat: a tarefa envia um ping a um URL quando termina.
Agrupe tudo numa página de estado
Mostre a API, os webhooks e as tarefas em segundo plano como componentes separados, para que os clientes vejam exatamente o que está afetado.