الخلاصة

  • قالت Cloudflare إن مستوى التحكم وخدمات التحليلات تعطلا بدءاً من 2 نوفمبر 2023، بينما استمر مرور الحافة الأساسي [1].
  • كان المحفز المعلن سلسلة فشل كهربائي في PDX-04، وهو موقع في أوريغون يستضيف اعتماديات حرجة [1][3].
  • كشف الحادث اعتماديات في Kafka وClickHouse والهوية والأدوات الداخلية وأنظمة التعافي [1].
  • اختبر فشل كهربائي آخر في الموقع نفسه عام 2024 استعداد Code Orange وقلل أثر مستوى التحكم [2].
  • يتطلب الإغلاق الموثوق إثبات عمل الإعداد والتحليلات والهوية والأدوات الداخلية وإجراءات العميل أثناء فقدان كامل للموقع.

ما الذي حدث

تحدد Cloudflare بداية الحادث عند 11:43 UTC في 2 نوفمبر. وكانت الطبقة المتأثرة هي مستوى التحكم وخدمات التحليلات [1]. أي إن العميل قد يعجز عن تغيير قاعدة أو رؤية قياس أو استخدام وظيفة إدارية، مع أن المرور الموزع الذي لا يحتاج قرار تحكم جديد قد يستمر.

كانت نقطة البداية المادية هي PDX-04. تشرح Cloudflare أن حدث صيانة غير مخطط لدى Portland General Electric أثر في تغذية كهربائية مستقلة للمبنى، ثم تتابعت مشكلات البطاريات والمولدات والوصول إلى المبنى واستبدال القواطع وإعادة تشغيل الخوادم بترتيب مضبوط [1]. ويربط تقرير Baxtel الاضطراب بفشل كهربائي في مركز Flexential في Hillsboro بولاية أوريغون، ويقتبس تفسير Cloudflare للتغذية الكهربائية [3].

المغزى العملي هو أن خدمة سحابية قد تستمر في نقل المرور المهيأ مسبقاً بينما تفقد السطح الذي يسمح بالتغيير والتشخيص والتحقق. وإذا كان ذلك السطح يعتمد خفية على موقع واحد، فإن استمرارية العميل ترتبط بسلسلة تعافٍ مادية وتنظيمية.

الاعتمادية المخفية لم تكن خادماً واحداً

لا يصف التقرير اللاحق فشل آلة واحدة. إنه يذكر مكونات مستوى التحكم والتحليلات، وKafka، وClickHouse، والهوية والتفويض، والأدوات الداخلية، والأنظمة اللازمة لإعادة تشغيل الخدمات أو بنائها [1]. بعض الاعتماديات كان معروفاً، وبعضها ظهر فقط عند فقدان الموقع كله.

هذه قضية بنية تحتية شبكية. مستوى التحكم هو سطح السلطة التشغيلية. فيه تتحول التغييرات إلى إعداد جارٍ، وتتحول الإنذارات إلى إجراء، ويرى العميل صحة الخدمة. إذا اعتمد هذا السطح على موقع لم يختبر كفقدان كامل، فالمخاطر ليست مدة توقف فقط، بل فقدان الرؤية والقدرة على التغيير.

تفصل Cloudflare أيضاً بين ما استمر وما فشل. كثير من مرور الحافة استمر [1]. هذا لا يجعل الحادث صغيراً؛ بل يثبت أن المرونة تقاس حسب الطبقة. صحة مستوى البيانات لا تثبت قابلية مستوى التحكم للتعافي.

التعافي من الكوارث يجب أن يثبت بالتشغيل

تقول Cloudflare إنها امتلكت خطط تعافٍ، لكن الحدث أظهر أن بعض الخدمات لم تكن جاهزة لفقدان الموقع كاملاً وأن بعض الإجراءات لم تختبر في الظروف الصحيحة [1]. يمكن للوثيقة أن تسمي موقعاً بديلاً؛ أما الدليل فهو النسخ والصفوف والهوية ولوحات المراقبة والأدوات الداخلية وهي تعمل أثناء الفشل.

يحمل التعافي أيضاً ضغط طلب. عند عودة الخدمات يعيد العملاء والأنظمة الداخلية المحاولة في وقت واحد. يصف التقرير أثراً جماعياً قد يحول العودة إلى حادث ثان إذا لم يستوعب مستوى التحكم التراكم [1].

تقرير 2024 مفيد للمقارنة. بعد أربعة أشهر وقع فشل كهربائي كبير آخر في الموقع نفسه، وفعّلت Cloudflare حالة Code Orange، وقالت إن التغييرات السابقة خففت الأثر [2]. هذا لا يثبت حل كل شيء، لكنه يقدم نمط الدليل الصحيح: حادث مشابه، استعداد جديد، ونتيجة مختلفة.

الحدود المادية ما زالت مهمة

تبدو مستويات التحكم السحابية برمجية، لكن هذا الحادث تضمن التغذية الكهربائية والبطاريات والمولدات والوصول إلى المبنى ومشغل الموقع وترتيب تشغيل الخوادم [1][3]. تقع هذه التفاصيل تحت واجهة البرمجة، لكنها تحكم النتيجة التي يراها العميل.

الاعتماد على مركز بيانات طرف ثالث ليس خطأ تلقائياً. السؤال هو ما يمكن للمشغل إثباته: من يفعّل الخطة البديلة، وأي وظائف للعميل تبقى، وما التدهور المقصود، وأي سجل يثبت اختبار السيناريو.

يضيف Baxtel سياق مشغل الموقع ورداً عاماً من Flexential حول سيناريوهات الشبكة الكهربائية [3]. لا ينبغي تحويل ذلك إلى حكم كامل على السبب. لكنه يبين أن سلسلة التعافي عبرت حدوداً تنظيمية.

سطح Heng.lu هو الاستمرارية التشغيلية

سطح Heng.lu هنا هو استمرارية المشغل وهوية الاستضافة والشبكة. يمكن لدليل أو صفحة حالة أن يسمي المشغل والموقع؛ لكنه لا يثبت أن الإعداد والتحليلات والهوية والأدوات تنجو من فقدان مبنى. طبقة الواقع هي دليل التعافي الفعلي.

لذلك يجب ألا يتحول الاختبار العام إلى مسرح لوم. السؤال هو أي اعتماد كان على المسار الحرج، وهل عرفته Cloudflare مسبقاً، وأي تمرين يثبت الآن أن الاعتماد نفسه لن يزيل سلطة التحكم مرة أخرى.

ما يجب مراقبته

الإشارة الأولى هي استمرار الفصل بين صحة مرور الحافة وصحة مستوى التحكم والتحليلات. لا تكفي حالة خضراء عامة إذا لم يستطع العملاء تغيير الإعداد أو مراقبته.

الإشارة الثانية هي تحول Code Orange إلى نمط قابل للتكرار: فقدان موقع كامل، اختبار انتقال، قياس التراكم، توافر الهوية، نجاح إجراءات العميل، والمقارنة مع الحادث السابق. الدرس الدائم أن نقل المرور لا يكفي. على المشغل أن يرى الخدمة ويغيرها ويعيد تشغيلها ويفسرها عند توقف مبنى حرج.

المصادر

  1. https://blog.cloudflare.com/post-mortem-on-cloudflare-control-plane-and-analytics-outage/
  2. https://blog.cloudflare.com/major-data-center-power-failure-again-cloudflare-code-orange-tested/
  3. https://baxtel.com/news/cloudflare-blames-flexential-dc-outage-for-its-service-disruption