يجب أن تجيب مراقبة الشبكة عن ثلاثة أسئلة: هل الخدمة متاحة؟ هل الأداء ضمن الحدود المقبولة؟ وما الأدلة المتوفرة عند حدوث تغير؟ حالة الجهاز Up وحدها لا تكفي للإجابة عن هذه الأسئلة.
راقب مسار الخدمة كاملاً
اجمع بيانات الحالة والتوافر من المحولات والموجهات والجدران النارية وموازنات الأحمال وواجهات مزودي الاتصالات وأنظمة الإدارة والخدمات الشبكية الحرجة، مع مراقبة مساري A وB عند وجودهما.
استخدم بيانات المنافذ وحركة الشبكة
تشمل المؤشرات المهمة نسبة الاستخدام والأخطاء والحزم المرفوضة وتغير حالة الروابط ومستويات الإرسال والاستقبال الضوئي عندما تكون متاحة وسلوك الطوابير وفقدان الحزم. ويمكن لبيانات التدفق وقياسات التطبيقات كشف الازدحام والأنماط غير الطبيعية.
راقب صحة مستوى التحكم
توفر حالة علاقات التوجيه وعدد المسارات وأحداث التقارب وتغيرات البروتوكولات مؤشرات لمشكلات قد لا تظهر من حالة الرابط الفيزيائي. يجب التحقيق في Flapping المتكرر حتى إذا منعت التكرارية حدوث انقطاع مباشر.
مزامنة الوقت
الطوابع الزمنية الدقيقة ضرورية لربط سجلات الشبكة بأحداث الخوادم والأمن وBMS وUPS والتطبيقات. لذلك يجب اعتبار خدمة مزامنة الوقت خدمة داعمة حرجة ومراقبتها.
تصميم إنذارات مفيدة
يجب أن تعكس عتبات الإنذار مستوى المخاطر التشغيلية. كثرة الإنذارات منخفضة القيمة تؤدي إلى تجاهلها، بينما غياب الإنذارات المهمة يؤخر الاستجابة. ينبغي أن يحدد التنبيه الجهاز أو الخدمة المتأثرة والشدة والوقت والاعتماديات المهمة.
الاحتفاظ بأدلة الحوادث
يجب الاحتفاظ بتاريخ الإعدادات وسجلات الأحداث وعدادات المنافذ وتغيرات التوجيه واتجاهات المراقبة لفترة مناسبة للمتطلبات التشغيلية والامتثال. وبعد الحوادث يجب أن تدعم هذه الأدلة التسلسل الزمني وتحليل السبب الجذري والإجراءات التصحيحية.
المراجع وقراءات إضافية
- ISO/IEC TS 22237-7:2018، معلومات الإدارة والتشغيل.
- ANSI/TIA-942-C، معيار البنية التحتية للاتصالات في مراكز البيانات.
- وثائق IETF الرسمية لبروتوكولات التوجيه المستخدمة في البيئة.