SixAM

چگونه با SolarWinds خستگی هشدار را ۳۰٪ کاهش دادم

پایش و عملیات فناوری اطلاعات۲۵ خرداد ۱۴۰۵6 دقیقه مطالعه

مسئله

بیشتر محیط‌های پایش مشکل پوشش ندارند. مشکل نویز دارند. وقتی یک تیم عملیات روزانه صدها هشدار دریافت می‌کند، ذهن دیگر هیچ هشداری را فوری تلقی نمی‌کند. این همان خستگی هشدار است و دلیل اینکه قطعی‌های واقعی از کنار تیم‌های پرتعداد هم رد می‌شوند. در یک استقرار سازمانی SolarWinds Orion که تحویل گرفتم، مهندسان کشیک سریع‌تر از آنکه هشدارها را بخوانند، آن‌ها را تأیید می‌کردند.

چرا رخ می‌دهد

خستگی هشدار به‌ندرت ناشی از یک قانون بد است؛ انباشته می‌شود:

  • آستانه‌های ثابتی که روز نخست درست بودند و شش ماه بعد نادرست شدند.
  • هشدارهایی که روی جهش‌های گذرا فعال می‌شوند، نه شرایط پایدار.
  • نبود تمایز میان down شدن یک node و یک نوسان لحظه‌ای یک شمارنده.
  • هدایت همه‌ی هشدارها به یک صندوق و با یک سطح اهمیت.

نتیجه جریانی است که در آن یک پشتیبان‌گیری ناموفق و یک جهش ۲ ثانیه‌ای CPU یکسان دیده می‌شوند.

بهترین روش‌هایی که جواب داد

این تغییرها کاهش ۳۰٪ هشدارهای قابل‌اقدام را ایجاد کردند:

  • بر اساس مدت‌زمان تنظیم کنید، نه لحظه. پیش از فعال‌شدن هشدار، پایداری شرط را لازم کنید (مثلاً CPU > 90% به‌مدت ۱۰ دقیقه). بیشتر جهش‌های گذرا خودبه‌خود رفع می‌شوند.
  • سرکوب وابسته به وابستگی به کار ببرید. اگر یک node والد down است، فرزندان را سرکوب کنید. یک قطعی روتر نباید پنجاه هشدار بسازد.
  • آستانه‌ها را بر اساس نقش تنظیم کنید. سرور پایگاه‌داده و سرور چاپ نباید آستانه‌ی حافظه‌ی مشترک داشته باشند. node‌ها را گروه‌بندی و حد ویژه‌ی نقش را اعمال کنید.
  • سطح‌بندی اهمیت اضافه کنید. فقط برای شرایط مؤثر بر مشتری اعلان فوری بفرستید؛ بقیه را به داشبورد یا گزارش روزانه هدایت کنید.
  • بازبینی و حذف. هر ماه بررسی کنید کدام هشدارها فعال شدند، روی کدام اقدام شد و کدام نادیده ماند. هشدارهایی که کسی روی‌شان اقدام نمی‌کند را حذف کنید.

یک نمونه‌ی واقعی

بزرگ‌ترین دستاورد از نگاشت وابستگی آمد. در این محیط الگویی تکرارشونده وجود داشت که یک سوییچ بالادست کوتاه‌مدت flap می‌کرد و برای هر node پایین‌دست هشدار می‌ساخت. با تعریف توپولوژی شبکه در Orion و فعال‌سازی سرکوب وابستگی، یک flap از حدود ۴۰ هشدار به یک هشدار (خودِ سوییچ) رسید. همراه با آستانه‌های مبتنی بر مدت‌زمان و تفکیک سطح اهمیت، حجم هشدارهای قابل‌اقدام در دو دوره‌ی گزارش حدود ۳۰٪ کاهش یافت و میانگین زمان تأیید رویدادهای واقعی بهتر شد، چون صف بالاخره خوانا شده بود.

جمع‌بندی

هشدارهای کمتر اما بهتر، همیشه از هشدارهای بیشتر بهترند. برای شرایط پایدار تنظیم کنید، وابستگی‌ها را مدل کنید، سطح اهمیت واقعی بدهید و ماهانه بازبینی کنید. هدف سکوت نیست. سیگنال است. وقتی هر هشدار معنا داشته باشد، تیم دوباره به صف اعتماد می‌کند و همین اعتماد قطعی بعدی را می‌گیرد.