Überwachung und Beobachtbarkeit: wissen, dass etwas brach, vor dem Kunden
Was zu messen ist
Beginnen Sie mit vier: Anfragerate, Fehlerrate, Antwortzeit an den Extremen und Ressourcensättigung. Fügen Sie eine Geschäftskennzahl hinzu — Bestellungen pro Stunde, Anmeldungen, Versände — die Fehler fängt, die die Infrastruktur nicht sieht.
Die durchschnittliche Antwortzeit ist irreführend. Sehen Sie auf das 95. und 99. Perzentil; dort sind die verärgerten Nutzer.
Nützliche Protokolle
Strukturiert, mit einer Anfragekennung, die einen Aufruf durch das ganze System begleitet, und ohne unnötige persönliche Informationen. Ein Freitextprotokoll ist ein Archiv, kein Untersuchungswerkzeug.
Warnungen, die nicht abnutzen
Warnen Sie bei Symptomen, die der Nutzer spürt, nicht bei jeder technischen Anomalie. Jede Warnung sollte enthalten, was geschah, die Auswirkung und den ersten Schritt. Eine Warnung ohne Aktion — löschen Sie sie. Warnungsmüdigkeit ist die Ursache Nummer eins, einen echten Vorfall zu verpassen.
Im Detail
Fügen Sie verteiltes Tracing hinzu, das den Pfad einer Anfrage über Komponenten mit Zeiten zeigt. In aufgeteilten Systemen ist das der einzige Weg, „warum hat das drei Sekunden gedauert“ ohne Raten zu beantworten, und es verkürzt Untersuchungen von Stunden auf Minuten.