نشرت Amazon Web Services (AWS) ملخصها لما بعد الحادثة عن العطل الذي ضرب منطقتها في شمال فيرجينيا، us-east-1، يومي 19 و20 أكتوبر. وأرجعت الشركة السبب الجذري إلى “حالة تسابق كامنة في نظام إدارة DNS الخاص بـDynamoDB أدت إلى سجل DNS فارغ وغير صحيح”، وهي حالة امتدت آثارها فأوقفت تطبيقات من Snapchat إلى Lloyds Bank معظم ساعات اليوم.
ما الذي حدث ببساطة
DynamoDB إحدى خدمات قواعد البيانات الأساسية في AWS، وتعتمد عليها خدمات كثيرة داخل Amazon وخارجها. وككل خدمة على الإنترنت، يُوصل إليها عبر اسم DNS يشير إلى مجموعة من عناوين IP. وبحسب ملخص ThousandEyes لتقرير AWS، يدير النظام المسؤول عن هذه السجلات “مئات الآلاف من سجلات DNS”.
هذا النظام مؤتمت، ومن مكوناته عمليات تسميها AWS “منفّذات DNS” (DNS Enactors)، وهي التي تطبّق التغييرات المخطط لها على السجلات. وتقول AWS إن اثنين من هذه المنفّذات دخلا في سباق: الأول تأخر فطبّق خطة قديمة تجاوزها الزمن، بينما أنهى الثاني عمله وشغّل خطوة تنظيف حذفت الخطط القديمة. والنتيجة أن سجل نقطة الوصول الإقليمية لـDynamoDB بقي بلا أي عنوان IP.
السجل الفارغ عطل صامت. لا حريق ولا انقطاع كهرباء، فقط عنوان يشير إلى لا شيء، وكل خدمة تحاول الوصول إلى DynamoDB في المنطقة لا تتلقى ردًا. ولم تستطع الأتمتة إصلاح الوضع وحدها، إذ تقول AWS إن الأمر تطلّب تدخلًا يدويًا من المهندسين المشغّلين.
ما لفت انتباهي هو صغر الشرارة مقارنة بحجم الضرر. لم يكن هجومًا إلكترونيًا ولا انقطاعًا في الطاقة، بل خلل توقيت في الأتمتة ظل كامنًا حتى التقت العمليتان الخطأ في اللحظة الخطأ.
كيف مضى اليوم
كل الأوقات بتوقيت المحيط الهادئ الصيفي (PDT) كما أوردتها AWS:
- 11:48 مساء 19 أكتوبر: بداية المشكلات.
- 2:25 فجر 20 أكتوبر: استعادة DNS الخاص بـDynamoDB.
- 1:50 بعد ظهر 20 أكتوبر: تعافي EC2 بالكامل.
- 2:20 بعد ظهر 20 أكتوبر: إعلان AWS حل المشكلات في جميع الخدمات.
لم ينتهِ العطل بإصلاح DNS، فالأنظمة التي تعطلت أثناء غياب DynamoDB احتاجت بدورها إلى التعافي، ولهذا امتد الذيل الطويل للأزمة حتى ما بعد الظهر. ومن الخدمات التي ذكرت AWS أنها تأثرت: DynamoDB وEC2 وNetwork Load Balancer وLambda وECS وEKS وFargate وAmazon Connect وSTS وRedshift، بل حتى لوحة دعم AWS نفسها (AWS Support Console).
بالأرقام
| البند | الرقم | المصدر |
|---|---|---|
| بداية العطل | 11:48 مساء 19 أكتوبر بتوقيت PDT | AWS |
| استعادة DNS الخاص بـDynamoDB | 2:25 فجر 20 أكتوبر بتوقيت PDT | AWS |
| تعافي EC2 بالكامل | 1:50 بعد ظهر 20 أكتوبر بتوقيت PDT | AWS |
| حل المشكلات في جميع الخدمات | 2:20 بعد ظهر 20 أكتوبر بتوقيت PDT | AWS |
| المدة من البداية حتى الحل الكامل | نحو 14 ساعة ونصف | الجدول الزمني لـAWS |
| سجلات DNS التي يديرها نظام DynamoDB | مئات الآلاف | ThousandEyes |
لماذا يهمنا هذا
قائمة الخدمات الاستهلاكية التي أفادت ABC News Australia بتأثرها تشبه الشاشة الرئيسية لهاتف أي منا: Snapchat وRoblox وFortnite وRobinhood وCoinbase وVenmo وPerplexity وCanva وZoom وDuolingo. ولم تسلم منتجات Amazon نفسها، ومنها Amazon.com وPrime Video وAlexa. وفي بريطانيا شملت القائمة Lloyds Bank وBank of Scotland وVodafone وBT، بل حتى مصلحة الضرائب HMRC.
وهذا الانتشار هو الدرس الحقيقي. فمعظم مستخدمي هذه التطبيقات لم يسمعوا يومًا بشيء اسمه DNS Enactor، ومع ذلك توقفت تطبيقاتهم بسبب سلسلة من الاعتماديات تنتهي عند خدمة واحدة في منطقة واحدة.
تَعِد الحوسبة السحابية بالمرونة والصمود، وتفي بوعدها في الغالب. لكن us-east-1 منطقة واحدة، ويعتمد عليها جزء كبير من الإنترنت، أحيانًا دون أن يدري. فإذا كانت خدمة المصادقة أو قاعدة البيانات أو طابور الرسائل في تطبيقك موجودة هناك فقط، فإعدادك “متعدد الخوادم” يبقى نقطة فشل واحدة.
وبالنسبة إلى الفرق التقنية في العالم العربي، هذه فرصة جيدة لمراجعة صادقة. فمن تجربتي، كثير من الشركات الناشئة في الخليج والمنطقة تنشر خدماتها في منطقة أمريكية تلقائيًا، لمجرد أن الدروس والقوالب الجاهزة تفعل ذلك. ونصيحتي أن تطرح على فريقك أسئلة واضحة: في أي منطقة نعمل فعلًا؟ وأي اعتمادياتنا مرتبطة بمنطقة واحدة؟ وماذا يحدث لعملائنا إذا صمتت تلك المنطقة نصف يوم؟ الإجابة لا تحتاج إلى ميزانية كبيرة، بل إلى انتباه.
ما الذي نراقبه
- تغييرات AWS اللاحقة: شرح الملخص الخلل، لكن الأهم للعملاء هو كيف ستعدّل AWS أتمتة DNS لتمنع تكراره.
- مراجعات البنية لدى العملاء: نتوقع أن تعيد فرق الهندسة النظر في مدى اعتماد أنظمتها على us-east-1 وحدها.
المصادر
- Amazon Web Services، ملخص ما بعد الحادثة عن تعطل خدمة DynamoDB في منطقة شمال فيرجينيا (us-east-1)، أكتوبر 2025، https://aws.amazon.com/message/101925/
- ThousandEyes، تحليل عطل AWS في 20 أكتوبر 2025، أكتوبر 2025، https://www.thousandeyes.com/blog/aws-outage-analysis-october-20-2025
- ABC News Australia، تغطية مباشرة لعطل AWS والخدمات المتأثرة، 20 أكتوبر 2025، https://www.abc.net.au/news/2025-10-20/amazon-aws-experiencing-online-outage/105913856