Pourquoi le monitoring compte plus que la plupart des traders ne le pensent
Le monitoring ne sert pas seulement à détecter les problèmes. Il sert à comprendre ce que fait le système avant que de petits signaux deviennent de vrais incidents.
Quand les gens pensent à l'automatisation du trading, le monitoring vient rarement en premier.
Les conversations tournent généralement autour des stratégies, des indicateurs, de la profitabilité ou des conditions de marché. Le monitoring ressemble à quelque chose réservé aux ingénieurs infrastructure ou aux grandes entreprises tech.
Je pensais la même chose.
Mais plus Oblivion fonctionnait en production, plus je réalisais que le monitoring n'est pas un luxe optionnel. C'est l'une des raisons pour lesquelles une plateforme peut continuer à fonctionner avec confiance sur de longues périodes.
Savoir vaut mieux que deviner
L'une des situations les plus inconfortables pour un développeur est l'incertitude.
La plateforme tourne-t-elle encore ? Les flux de données de marché se mettent-ils correctement à jour ? Un ordre a-t-il échoué ? Un processus est-il bloqué ?
Sans visibilité, chaque réponse devient une supposition.
Un bon monitoring retire cette incertitude. Au lieu de se demander si quelque chose se passe, on l'observe simplement.
Cela peut sembler évident, mais cela change profondément la confiance avec laquelle on peut opérer un système.
La plupart des problèmes ne commencent pas comme des urgences
Les gros incidents apparaissent rarement sans avertissement.
Le plus souvent, ils commencent comme de petites anomalies.
Un processus qui prend légèrement plus de temps que d'habitude. Une queue qui grossit progressivement. Une API qui répond plus lentement que prévu. Une déconnexion temporaire qui devient de plus en plus fréquente.
Chaque événement semble inoffensif isolément. Ensemble, ils indiquent souvent que quelque chose mérite de l'attention avant que les utilisateurs ne remarquent un problème.
Le monitoring permet à ces signaux de devenir visibles.
La visibilité améliore les décisions
Une autre leçon que j'ai apprise, c'est que le monitoring n'est pas utile seulement quand quelque chose casse.
Il est tout aussi précieux pour décider si une intervention est réellement nécessaire.
Imagine recevoir une alerte indiquant qu'un service s'est brièvement déconnecté.
Sans information supplémentaire, la réaction naturelle est d'enquêter immédiatement. Mais si le monitoring montre que le service a récupéré automatiquement en quelques secondes, aucune action n'est peut-être nécessaire.
Une bonne visibilité évite les interventions inutiles autant qu'elle permet les interventions nécessaires.
Dans beaucoup de situations, comprendre le contexte vaut plus que réagir vite.
Construire la confiance
Le monitoring change aussi la relation que l'on a avec son propre logiciel.
Au début d'un projet, il est courant de vérifier les logs constamment.
On redémarre les services plus souvent que nécessaire. On vérifie tout à la main parce qu'on ne fait pas encore confiance au système.
À mesure que l'observabilité s'améliore, ce comportement disparaît progressivement.
Pas parce que la plateforme devient parfaite. Parce qu'on a enfin assez d'informations pour comprendre ce qu'elle fait.
La confiance ne vient pas du fait de croire que rien n'échouera. Elle vient du fait de savoir qu'on comprendra rapidement ce qui s'est passé quand quelque chose finira par échouer.
Plus que des données techniques
Il est tentant de croire que le monitoring concerne seulement l'usage CPU, la consommation mémoire ou le trafic réseau.
Ces métriques comptent, bien sûr. Mais elles ne racontent qu'une partie de l'histoire.
Il est tout aussi important de comprendre le comportement de l'application elle-même.
Traite-t-elle l'information normalement ? Les tâches attendues se terminent-elles correctement ? L'activité est-elle cohérente avec ce que l'on attend des conditions de marché actuelles ?
La santé technique et la santé applicative sont liées, mais elles ne sont pas identiques. Un serveur en bonne santé ne signifie pas forcément une plateforme en bonne santé.
Avec le recul
Aujourd'hui, je considère le monitoring comme l'une des fonctionnalités les plus précieuses de tout système longue durée.
Pas parce que les utilisateurs interagissent directement avec lui. La plupart ne le feront jamais.
Sa valeur est ailleurs.
Il fournit de la visibilité. Il réduit l'incertitude. Il rend le dépannage plus rapide.
Surtout, il permet à la plateforme de gagner de la confiance avec le temps.
Après tout, on ne peut pas opérer avec confiance un système que l'on ne peut pas observer clairement.