Ci si accorge del problema quando, a fronte di un’anomalia operativa, ricostruire la sequenza degli eventi richiede giorni e il coinvolgimento di più strutture.
Il sistema era progettato per essere tracciabile, con log tecnici distribuiti sui diversi componenti applicativi e infrastrutturali.
Nella pratica, non esisteva un giornale eventi centrale: ogni area disponeva di log dipartimentali coerenti localmente, ma non correlabili tra loro in modo diretto.
Questa frammentazione era tollerata perché ogni team era in grado di analizzare il proprio perimetro, rimandando l’integrazione delle informazioni a una fase successiva mai formalizzata.
Col tempo, ogni analisi di incidente ha richiesto raccolte manuali, normalizzazioni ex post e confronti asincroni tra log eterogenei, con tempi di risposta sempre più lunghi.
Il sistema è risultato tecnicamente osservabile, ma incapace di raccontare cosa fosse realmente accaduto senza un lavoro investigativo esteso.
Il problema non era l’assenza di log.
Era l’assenza di un giornale degli eventi.
Wolf
Interventi su sistemi complessi
