インフラ・クラウド・DevOps · 中級
監視と観測可能性:顧客より前に何かが壊れたことを知る
一行でいうと: 三種類のシグナル——指標、ログ、トレース——と一つの答えるべき質問:今何が起きていて、なぜか。
何を測定するか
四つから始める:リクエスト率、エラー率、端での応答時間、リソース飽和。一つのビジネス指標を追加する——時間あたりの注文、登録、送信——インフラが見ないバグを捉えるために。
平均応答時間は誤解を招く。95パーセンタイルと99パーセンタイルを見る;怒っているユーザーはそこにいる。
有用なログ
システム全体を通る呼び出しに同行するリクエスト識別子と、不必要な個人情報なしに構造化された。フリーテキストログはアーカイブであり、調査ツールではない。
疲弊しないアラート
すべての技術的な異常ではなく、ユーザーが感じる症状でアラートを出す。すべてのアラートに何が起きたか、影響、最初のステップを含める。アクションのないアラート——削除する。アラート疲弊は本物のインシデントを見逃す第一の原因だ。
さらに深く
時間を伴うコンポーネント間でのリクエストのパスを示す分散トレーシングを追加する。分割されたシステムでは、これが推測なしに「なぜ三秒かかったか」に答える唯一の方法であり、調査を時間から分に短縮する。