Datadog
Plateforme de surveillance qui rassemble au même endroit les journaux, les mesures et le parcours d'une requête à travers tes services. Un agent posé sur chaque machine remonte le tout, et tu construis ensuite des tableaux de bord et des alertes par-dessus. La valeur n'est pas dans un de ces trois flux pris seul, elle est dans le fait de passer d'une alerte à la trace fautive puis au journal de la ligne concernée sans changer d'outil.
Forces
- Journaux, mesures et traces dans un seul endroit : tu passes de l'alerte à la ligne fautive sans changer d'outil
- Répond à la question « lequel de mes services a causé la panne », que le suivi d'erreurs seul ne sait pas traiter
- Couvre l'infrastructure autant que le code applicatif, donc une seule astreinte pour les deux
Limites
- Facturé à l'usage sur les journaux et les machines : le coût réel se découvre en fin de mois
- Sans plusieurs services à corréler, tu paies pour une capacité que tu n'exerces jamais
- Installation et réglage à la charge d'une personne qui sait ce qu'elle veut mesurer, sinon les tableaux restent verts et vides
Pour qui
- Une application en production répartie sur plusieurs services qui s'appellent entre eux
- Une équipe d'astreinte qui doit trouver la cause d'un ralentissement, pas seulement en être avertie