תשתיות, ענן ו-DevOps · מעורב

תחקיר תקלות בלי חיפוש אשמים

בשורה אחת: אחרי כל תקרית שווה שעה של תחקיר כתוב שמתמקד במערכת ולא באדם — אחרת אותה תקלה תחזור.

במהלך התקרית

מנהל תקרית אחד שמחליט ומתעד, ערוץ תקשורת יחיד, ועדכון ללקוחות מוקדם ככל האפשר. השחזור קודם לחקירה: מחזירים שירות, ואוספים ראיות תוך כדי.

אחרי

כתבו ציר זמן עובדתי, השפעה במספרים, מה עיכב את הזיהוי ומה עיכב את התיקון. שתי השאלות האחרונות הן החשובות — לרוב זמן הזיהוי גדול מזמן התיקון, וזה מצביע על פערי ניטור.

הפיקו שתיים־שלוש פעולות עם בעלים ותאריך. עשרים פעולות משמעותן אפס פעולות.

תרבות

אדם שלחץ על הכפתור הוא הסימפטום; המערכת שאפשרה זאת בלי אישור, בלי בדיקה ובלי דרך חזרה היא הבעיה. צוותים שמחפשים אשמים לומדים להסתיר תקלות, וזה מסוכן בהרבה.

לעומק

שמרו את התחקירים במקום נגיש וקריאו אותם ברבעון. דפוסים חוזרים — אותה תלות, אותו סוג שינוי, אותה שעה בשבוע — מצביעים על בעיה מבנית שאף תחקיר בודד אינו חושף.