La plupart des équipes ne manquent pas de talent. Elles manquent d'oxygène.
L'environnement est bruyant, imprévisible et rempli d'éléments que personne n'a documentés correctement. Vos employés passent donc leurs journées à réagir, à traduire et à expliquer. Puis, lors d'une revue trimestrielle, quelqu'un demande pourquoi le carnet de commandes ne diminue jamais, et la moitié de la salle se met à rêver d'une cabane dans les bois sans Wi-Fi ni instance ServiceNow.
Voici comment transformer le chaos en routine. Sans transformer vos employés en robots.
Le problème silencieux
Voici à quoi cela ressemble concrètement.
Un architecte réseau payé 180 $/h copie et colle des entrées de journal dans un tableur parce que personne n'a jamais créé l'automatisation nécessaire. Personne ne le fera, car le projet d'automatisation passe après l'autre projet d'automatisation, qui passe lui-même après le projet de conformité, qui suit lui-même ce que Gary a brisé en janvier.
Pendant ce temps :
- les alertes se déclenchent en triple parce que trois outils surveillent le même seuil sans se connaître
- les incidents arrivent sans contexte, sans responsable et sans étape suivante claire, si bien que les vingt premières minutes de chaque intervention servent à déterminer si le problème est réel et à qui il incombe
- les changements causent des bris parce que la dérive est passée inaperçue, et elle est passée inaperçue parce que les personnes qui l'auraient remarquée sont parties avec la mémoire institutionnelle
- le manuel d'exploitation n'existe que dans la tête de Gary. Le téléphone de Gary est, techniquement, un composant d'infrastructure porteur
Personne n'a planifié cela. Personne n'est incompétent. C'est simplement ce qui arrive quand cinq ans de décisions prises « pour le moment » s'accumulent sans que personne n'ait le temps de revenir en arrière.
Ce qui aide vraiment
Éliminer le bruit avant qu'il n'atteigne un humain
Trois outils qui se déclenchent pour le même événement ne constituent pas de la « redondance ». Ce sont trois billets, trois notifications, trois personnes qui arrêtent ce qu'elles font pour examiner la même chose. Supprimez les doublons. Corrélez les signaux. Ajoutez du contexte avant qu'une personne n'ait à ouvrir le dossier. Si votre instance ServiceNow est le point d'entrée, Kyndryl Bridge est la couche qui extrait les signaux de l'ensemble du parc informatique pour les rendre lisibles. [source] Elle exécute plus de 100 millions d'automatisations par mois. Voilà l'échelle. Le principe est plus simple : laissez les systèmes trier pour que les humains puissent réfléchir.
Automatiser le travail que personne ne devrait faire deux fois
Si vos employés seniors consacrent un tiers de leur semaine à des tâches qu'un manuel d'exploitation configuré traite en quelques secondes, ce n'est pas un problème de personnel. C'est un modèle opérationnel qui gaspille des ressources coûteuses dans du travail administratif tout en appelant cela des « opérations ».
Chaque heure que votre équipe passe sur du triage répétitif est une heure qu'elle ne consacre pas au travail préventif qui réduit réellement le volume d'incidents. Ce qui signifie que le prochain trimestre ressemblera exactement à celui-ci. Les mêmes incendies, les mêmes héros, le même épuisement, la même revue trimestrielle où quelqu'un demande pourquoi le carnet de commandes ne diminue jamais.
Donner un sens à la visibilité
Les tableaux de bord AIOps sont magnifiques. S'ils ne peuvent pas acheminer le travail, déclencher une réponse ou produire des preuves pour un auditeur, ils ne sont que de la décoration. [source]
Voici ce que la plupart des équipes opérationnelles oublient : la télémétrie, les modèles d'incidents et les registres de changements que votre équipe génère chaque jour sont les mêmes données qui alimentent les opérations pilotées par l'IA. Lorsqu'elles sont propres, gouvernées et dirigées vers les bons systèmes, les outils que vous possédez déjà deviennent plus performants. Sinon, vous achetez un autre outil. Puis un autre. Et quelqu'un finit par demander pourquoi vous avez neuf plateformes de surveillance et que vous ne pouvez toujours pas expliquer ce qui a changé mardi dernier.
Retenir les mêmes personnes
C’est l’aspect que personne ne mentionne dans une présentation. Lorsqu’un même responsable technique principal demeure sur votre compte pendant deux ans plutôt que d’être remplacé tous les six mois, les modèles se stabilisent. Les connaissances s’accumulent. Les problèmes sont résolus plutôt que redécouverts.
Lorsqu’une personne quitte un projet et revient trois mois plus tard avec tout le contexte en tête, ce n’est pas qu’une simple question de logistique. C’est la différence entre un environnement qui s’améliore et un autre qui revient à la case départ à chaque cycle contractuel. C’est aussi la différence entre Gary qui prend des vacances et Gary qui laisse un cartable de procédures d’urgence sur un bureau comme s’il ne comptait jamais revenir.
Ce qui s’améliore
Quand cela fonctionne, ce n’est pas spectaculaire. C’est discret.
Le temps moyen de résolution diminue, car les incidents sont accompagnés du contexte nécessaire dès leur apparition. Les changements deviennent plus sûrs, car les dérives sont visibles avant qu’elles ne deviennent des incidents. Votre équipe passe plus de temps à prévenir les incendies qu’à y survivre. Vos meilleurs éléments cessent de vivre dans une salle de clavardage intitulée « urgent ».
Gary fait ses nuits. Non pas parce que les problèmes ont disparu, mais parce que les systèmes gèrent ce qui, auparavant, reposait uniquement sur lui.
Pas glamour. Mesurable.
Par quoi commencer
Répertoriez ce que vous avez Reliez les services, les responsables et les modèles d’incidents. Si les opérations ne peuvent pas voir la réalité, tout le reste n’est que conjecture.
Intégrez la confidentialité au travail quotidien La télémétrie des opérations est une donnée. Lorsque votre surveillance transite par le nuage d’un fournisseur étranger, vous soulevez une question de souveraineté que vous n’aviez pas prévue. [source]
Opérationnalisez la gouvernance Étapes de réponse, approbations, exceptions. Dans les systèmes. Applicables. Révisables. Pas dans la tête de quelqu’un.
Sécurisez les données elles-mêmes Les preuves opérationnelles, les artefacts de sauvegarde et la télémétrie sont des cibles. Traitez-les comme telles.
ISM bâtit le modèle opérationnel. L’accueil, les manuels d’exploitation, la couche d’automatisation, la structure de responsabilité qui empêche le retour au chaos après six mois. Kyndryl apporte la plateforme et les modèles éprouvés dans des milliers d’environnements. Votre équipe peut se consacrer à l’ingénierie. Livré localement, par des gens qui connaissent vos fenêtres de changement et qui seront toujours sur votre compte au prochain trimestre.
