Les API tombent en panne autrement que les sites web : elles répondent 200 avec un corps d'erreur, ralentissent avant de tomber, et dépendent de files d'attente que personne ne surveille. Voici comment les surveiller.
Vérifiez le corps de la réponse
Choisissez un endpoint de santé qui vérifie la base de données et le cache, renvoie du JSON, et surveillez un champ tel que $.status égal à ok.
Authentifiez-vous
Utilisez un jeton en lecture seule dans un en-tête Authorization. Faites-le tourner comme tout autre secret.
Surveillez la latence
Définissez un seuil d'environ deux fois votre p95 habituel. Une API lente est généralement un signe avant-coureur de panne.
Surveillez les workers
Les consommateurs de files d'attente et les tâches cron nécessitent des moniteurs heartbeat : la tâche pingue une URL lorsqu'elle se termine.
Regroupez le tout sur une page de statut
Affichez l'API, les webhooks et les tâches en arrière-plan comme des composants distincts afin que vos clients voient exactement ce qui est affecté.