انقطاع هائل في خدمة Cloudflare: نصف الإنترنت يتذبذب لساعات

  • تسبب انقطاع عالمي لشبكة Cloudflare في حدوث أخطاء وتعطلات على مواقع الويب والتطبيقات في جميع أنحاء العالم لعدة ساعات.
  • وأثرت الحادثة بشكل خاص على إسبانيا وأوروبا، مع حدوث مشاكل في الخدمات المصرفية والتجارة الإلكترونية وألعاب الفيديو وأدوات العمل عن بعد.
  • نشأ الحادث في لوحة تحكم Cloudflare وواجهات برمجة التطبيقات والعاملين، تزامنًا مع الصيانة في مراكز البيانات الرئيسية.
  • تسلط الانقطاعات المتكررة لـ Cloudflare ومقدمي الخدمات السحابية الآخرين الضوء على الاعتماد الكبير للإنترنت على عدد قليل من اللاعبين.

انقطاع خدمة Cloudflare يؤثر على الخدمات عبر الإنترنت

في صباح يوم الجمعة، واجه العديد من المستخدمين الذين يحاولون الوصول إلى مواقع الويب والتطبيقات المعتادة الخاصة بهم شاشات فارغة، وأخطاء 500 ورسائل "بوابة سيئة"لم تكن المشكلة في جهاز التوجيه أو الهاتف المحمول: كان المصدر فشلًا جديدًا في Cloudflare، أحد مزودي البنية التحتية الرئيسية للإنترنت.

أدى الانقطاع العالمي إلى حرمان المستخدمين من الوصول إلى الخدمة أو تعرضهم لأعطال متقطعة لعدة ساعات. منصات واسعة الانتشار مثل Zoom وCanva وLinkedIn وFortnite وLeague of Legends وEpic Games Store والخدمات المصرفية الإسبانية والعديد من المتاجر عبر الإنترنتبالنسبة للعديد من المستخدمين، كان هذا بمثابة تأكيد لشعور غير مريح: عندما يتعثر Cloudflare، ينهار نصف الشبكة.

كيفية تحسين سرعة تحميل الويب
المادة ذات الصلة:
كيفية تحسين سرعة تحميل الويب

كيف ومتى حدث فشل Cloudflare

بدأت العلامات الأولى للمشاكل في الظهور حول 8:00-9:00 صباحًا بتوقيت شبه الجزيرة الإسبانيةوفقًا لسجلات Downdetector وأنظمة المراقبة الخاصة بشركة Cloudflare، ارتفعت تقارير الأخطاء في إسبانيا وبقية أوروبا بدءًا من حوالي الساعة 9:45 إلى 10:00 صباحًا. ذروة المئات من الحوادث المسجلة في بضع دقائق.

تم الإبلاغ عن صفحة الحالة الرسمية لـ Cloudflare على الفور "مشاكل في لوحة المعلومات وواجهات برمجة التطبيقات ذات الصلة"أي الأدوات التي تستخدمها الشركات والمطورون لإدارة مواقعهم الإلكترونية، وقواعد الأمان، ونظام أسماء النطاقات (DNS)، وخدمات Workers، وغيرها من الخدمات المتقدمة. وقد حذّرت الشركة من احتمال فشل الطلبات وظهور أخطاء عند محاولة استخدام هذه الميزات.

وفي الوقت نفسه، بدأ المستخدمون يلاحظون أن توقف العديد من المواقع الإلكترونية عن التحميل بشكل صحيح أو عرض أخطاء الخادم.وعلى الرغم من إصرار Cloudflare على أن ميزات CDN والأمان على الحافة لا تزال تعمل، إلا أن النطاق الحقيقي للحادث أظهر أن التأثير تجاوز إلى حد كبير فشل لوحة التحكم البسيط.

وفقًا للتسلسل الزمني المنشور، بدأت الشركة بالتحقيق في العطل قبل الساعة التاسعة صباحًا بقليل (بتوقيت شبه الجزيرة).تم نشر إصلاح للمشكلة حوالي الساعة 10:10-10:20 صباحًا، ثم دخل النظام في مرحلة المراقبة. بحلول منتصف النهار، كانت معظم الخدمات مستقرة، وأُغلقت المشكلة رسميًا حوالي الساعة 13:00-14:00 ظهرًا، مع أن العديد من المستخدمين استمروا في مواجهة مشاكل متقطعة لفترة أطول.

الخدمات المتأثرة: من الخدمات المصرفية الإسبانية إلى ألعاب الفيديو عبر الإنترنت

قائمة الخدمات المتأثرة طويلة ومتنوعة. على الصعيد الدولي، تم الإبلاغ عن حالات فشل أو انقطاع في الوصول في Zoom، وCanva، وLinkedIn، وShopify، وCoinbase، وClaude (روبوت الدردشة الخاص بـAnthropic)، وDeliveroo، وAWS، وخدمات الذكاء الاصطناعي، والعديد من تطبيقات الويبحتى موقع Downdetector، الذي يراقب انقطاعات الخدمة، واجه مشاكل في التحميل.

وفي إسبانيا وأوروبا كان التأثير واضحًا بشكل خاص في التجارة الإلكترونية والخدمات المصرفية عبر الإنترنتأبلغ المستخدمون عن انقطاعات أو أخطاء عند الوصول مواقع PCComponentes وMediaMarktشركتان عملاقتان في مجال التجارة الإلكترونية تعتمدان بشكل كبير على البنية التحتية لـ Cloudflare، ومن يجب أن يأخذوا في الاعتبار متى يتم تحديث منصة التجارة الإلكترونيةوكانت هناك أيضا تقارير الفشل في الخدمات المصرفية الرقمية لبنك كايكسا وبنك إنترمما أدى إلى منع إجراء المشاورات والعمليات الأساسية لبعض الوقت.

ولم يسلم قطاع الترفيه أيضًا: Fortnite وValorant وLeague of Legends وEpic Games Store وCrunchyroll واجهت هذه الخدمات انقطاعات أو أخطاء متقطعة. في بعض الحالات، تم تحميل الصفحات الرئيسية، ولكن توقفت الوظائف المهمة مثل تسجيل الدخول وعربات التسوق وإدارة الملف الشخصي عن العمل بشكل طبيعي.

أدوات الإنتاجية والتواصل المستخدمة على نطاق واسع في بيئات العمل، مثل Zoom ومنصات مؤتمرات الفيديو الأخرى، والشبكات المهنية مثل LinkedIn، وخدمات الذكاء الاصطناعي مثل ChatGPT وClaudeكما واجهوا اضطرابات. بالنسبة للعديد من العمال، توقف يوم العمل تمامًا دون أن يتمكنوا من فعل الكثير لحل الوضع.

ما تشرحه Cloudflare: لوحة المعلومات، وواجهات برمجة التطبيقات، والعمال، وصيانة مركز البيانات

وأوضحت شركة Cloudflare في تصريحاتها أن الحادث أثر في البداية على لوحة المعلومات وواجهات برمجة التطبيقات ذات الصلةويشير هذا إلى وجود مشكلات في الأدوات التي يستخدمها العملاء لإدارة التكوينات والقواعد ونظام اسم المجال (DNS) وجدران الحماية والشهادات والمكونات الأخرى لتواجدهم عبر الإنترنت.

وبعد فترة وجيزة، قامت الشركة بتحديث المعلومات لتأكيد الفشل كما تضمنت Cloudflare Workers، خدمة الحوسبة الطرفية التي تتيح تنفيذ التعليمات البرمجية مباشرةً على شبكة Cloudflare. هذه التفاصيل أساسية لفهم سبب تحميل بعض المواقع الإلكترونية، على الرغم من ظهورها. كانت العديد من الوظائف الديناميكية - مثل عمليات تسجيل الدخول، وعمليات الدفع، أو إنشاء المحتوى في الوقت الفعلي - تفشل بشكل كبير..

وتزامن الحادث مع عدة مهام الصيانة المجدولة في مراكز البيانات الاستراتيجية الشركة. وتحديدًا، يُذكر العمل في مركز البيانات. شيكاغو (ORD)، وفي وقت لاحق أيضًا في ديترويت (DTW) وبوغوتاأثناء هذه العمليات، يتم إعادة توجيه حركة المرور إلى نقاط أخرى في الشبكة، مما قد يؤدي إلى زيادة زمن الوصول وتعقيد إدارة حركة المرور.

وقد اعترفت Cloudflare نفسها بذلك قد يحدث زيادة طفيفة في زمن الوصول للمستخدمين النهائيين في المناطق المتأثرةولكن ما لم يتم توضيحه بشكل كامل هو ما إذا كانت الصيانة مجرد حالة مؤقتة أم أنها كانت مرتبطة بشكل مباشر بالخطأ الذي تسبب في الانقطاع العالمي، وهو أمر لا يزال غير مؤكد.

ديجا فو: حادثة نوفمبر وسلسلة فشل السحابة

وتأتي هذه الحادثة الجديدة بعد أسابيع فقط من تعطل Cloudflare الرئيسي مرة أخرى، سُجِّل في ١٨ نوفمبر. هذا الخطأ أبعده عن اللعبة لأربع ساعات تقريبًا. X (المعروف سابقًا باسم Twitter)، وChatGPT، وIKEA، وLeague of Legends، وMovistar، وLa Caixa، وMediaMarkt، وCanva، وDowndetector، وآلاف المواقع الأخرى في جميع أنحاء العالم.

في هذه الحالة، عزت الشركة المشكلة إلى تغيير في أذونات قاعدة البيانات الداخلية المتعلقة بإدارة الروبوتأدى هذا التعديل إلى توليد النظام آلاف الإدخالات الإضافية في ملف واحد يُستخدم للتمييز بين حركة المرور المشروعة والآلية. تضاعف حجم الملف تجاوز الحد الذي يمكن للبرنامج التعامل معهعرقلة تدفق حركة المرور بشكل صحيح والتسبب في الحادث.

إلى هذه السلسلة من حالات فشل Cloudflare، يجب أن نضيف حوادث سحابية أخرى حديثة، مثل انقطاع كبير في خدمة AWS منذ شهر ونصف والمشاكل في Azure، منصة مايكروسوفتبعد ثلاثة أسابيع فقط. في جميع الحالات، كانت التأثيرات متشابهة: مئات من الخدمات غير المتاحة، والمستخدمين ليس لديهم إمكانية الوصول إلى الأدوات المهمة، والشركات مشلولة لساعات.

إن تكرار هذه الحلقات في مثل هذه الفترة القصيرة يعزز فكرة أن تعتمد البنية التحتية العالمية للإنترنت بشكل متزايد على عدد قليل من مقدمي الخدمة، وبالتالي أهمية انظر عندما تختار الاستضافةوعندما يعاني أحد هذه الأجهزة من خطأ في التكوين، أو مشكلة في القدرة، أو فشل في التفاعل المتسلسل، فإن تأثير الدومينو يُشعَر به في كل ركن من أركان العالم تقريباً.

لماذا يؤدي انقطاع خدمة Cloudflare إلى "إيقاف" نصف الإنترنت؟

Cloudflare ليس مجرد موقع ويب آخر: إنه يتعلق بـ واحدة من أكبر شبكات توصيل المحتوى (CDNs) وخدمات أمان الإنترنتيعمل كوسيط بين خوادم الشركة والمستخدمين، ويوفر تخزين المحتوى، وتخفيف الهجمات، وموازنة التحميل، ونظام اسم المجال (DNS)، والعديد من الميزات المتقدمة.

لتبسيط الأمر، يمكننا أن نتخيل Cloudflare على أنها طريق سريع ضخم يربط جهاز المستخدم بمواقع الويب والتطبيقات التي يزورهاويجمع دورها بين وظيفتين أساسيتين: تسريع تحميل الصفحة بفضل النسخ الموزعة في جميع أنحاء العالم و حمايتهم من الهجمات أو حركة المرور الضارةعندما ينهار هذا الطريق أو ينقطع، فإن الوجهات (المواقع الإلكترونية) لا تزال موجودة، ولكن الطريق للوصول إليهم مغلق مؤقتا.

تتمتع هذه المركزية بمزايا من حيث الأداء والأمان، ولكنها أيضًا لها عيب كبير: تركز كميات هائلة من حركة المرور في عدد قليل من النقاط الحرجةعندما يدخل Cloudflare في الصيانة، أو يواجه خطأ في التكوين، أو مشكلة في البرنامج، فإن التأثير لا يقتصر على صفحة واحدة: بل ينتشر. إلى آلاف أو ملايين المواقع التي تعتمد على شبكتها.

لطالما حذّر خبراء البنية التحتية وعمليات التطوير والتشغيل (DevOps) من هذا التبعية. وكما أوضح مدير فني في شركة استشارية إسبانية، عندما يحدث هذا النوع من الانقطاع، أجهزتنا تصبح "مثقالاً للورق"تظل هذه التكنولوجيات نشطة، ولكن بدون القدرة على الوصول إلى الخدمات الأساسية مثل الخدمات المصرفية، والتسوق، والتعليم عبر الإنترنت، والمعاملات الرقمية، أو الشبكات الاجتماعية، فإن فائدتها العملية تنخفض بشكل كبير.

تثير هذه الحلقة من Cloudflare النقاش حول مرونة الإنترنت في أوروبا وإسبانياوفي هذا السياق، حيث تعتمد المزيد والمزيد من الخدمات العامة والخاصة على السحابات الدولية الكبيرة، لم يعد السؤال هو ما إذا كان سيكون هناك المزيد من الحوادث، ولكن ما هي خطة الطوارئ التي وضعتها المنظمات في حالة فشل مزود الخدمة المركزي لديها.

التأثير على إسبانيا والاتحاد الأوروبي: الخدمات الأساسية على حافة الهاوية

وعلى الرغم من أن الفشل كان عالميًا، فإن بيانات المراقبة تشير إلى أن تأثرت إسبانيا ومعظم دول الاتحاد الأوروبي بشكل خاص في الساعات القليلة الأولىفي الساعة 10:00 صباحًا، كان Downdetector يقوم بالتسجيل بالفعل مئات التقارير عن مشاكل مع Cloudflare في إسبانياوفي الوقت نفسه، كان هناك أكثر من 1.800 تقرير في الولايات المتحدة عن مشكلات في الاتصال.

وعلى المستوى الأوروبي، تم الإبلاغ عن مشاكل من البرتغال أو تركيا أو الهند أو البرازيل...وكذلك العديد من الدول الأعضاء في الاتحاد الأوروبي. على الرغم من أن Cloudflare أشارت إلى أن خدماتها لا تزال تعمل في معظم الدول الأوروبية، في الممارسة العملية، كان الواقع عبارة عن فسيفساء من الأخطاء المتقطعة، والصفحات التي لا يتم تحميلها، والميزات المحظورة..

شركات التجارة الإلكترونية والخدمات المالية والاتصالات ومنصات المحتوى هذه بعضٌ من أكثر المواقع اعتمادًا على هذا المزوّد. عندما تمر مواقعهم الإلكترونية الرئيسية أو أنظمة المصادقة عبر شبكة Cloudflare، إن فشلًا كهذا قد يعني، حتى ولو لبضع ساعات فقط، خسارة المبيعات والثقة والإنتاجية.

وفي الوقت نفسه، فإن كل حادث من هذا النوع بمثابة تذكير للشركات والمؤسسات العامة التي اختارت نقل الإجراءات والملفات والخدمات للمواطنين إلى منصات الإنترنت. إن التوفر العالي الذي وعدت به السحابة ليس مطلقًاوتجبرنا الأحداث مثل حادثة اليوم على إعادة التفكير في الاستراتيجيات: الاستغناء عن الموردين، وخطط استمرارية الأعمال، والأنظمة البديلة لحالات الطوارئ.

وعلى المستوى التنظيمي، كان الاتحاد الأوروبي يعمل على وضع لوائح مثل DORA (لائحة المرونة التشغيلية الرقمية)الذي يهدف إلى تقليل المخاطر الناجمة عن التركيز المفرط للخدمات في أيدي عدد قليل من مزودي التكنولوجيا. وتؤكد الانقطاعات العالمية، مثل انقطاع Cloudflare، على ضرورة تطبيق هذه الأطر ومراقبتها بدقة.

بعد عدة ساعات من الاضطرابات، عادت معظم المواقع والخدمات المتضررة إلى وضعها الطبيعي.تزعم شركة Cloudflare أنها نشرت بالفعل حلاً للمشكلة، وتُبقي أنظمتها تحت مراقبة دقيقة، مؤكدةً أنها لم تكن هجومًا خارجيًا، بل حادثة ناتجة عن تغييرات داخلية حديثة وإجراءات أمنية مُخففة. ومع ذلك، كشف اليوم، بالنسبة لملايين المستخدمين في إسبانيا وأوروبا وبقية العالم، عن أمرٍ مُقلقٍ مرةً أخرى: انقطاع واحد للخدمة مع أحد مزودي الخدمة قد يحول الإنترنت إلى بيت من ورق.حيث أن أي جزء يفشل في العمل يؤدي إلى فقدان جزء كبير من الحياة الرقمية اليومية، حتى ولو لبضع ساعات فقط.


أضف كمصدر مفضل