الخلاصة

  • صنفت Anthropic الحادثة q2kg8n613kr3 حرجة، ونقلت claude.ai وواجهة Claude البرمجية وClaude Code وClaude Cowork من التشغيل الطبيعي إلى انقطاع كبير.
  • قالت لاحقاً إن معدلات الأخطاء ارتفعت عبر نماذج Claude من 19:45 إلى 21:26 UTC في 29 يوليو، أي مئة ودقيقة واحدة من الأعراض.
  • ظل السجل العام مفتوحاً من 19:49:45 حتى الحل عند 22:36:20 UTC، وهي دورة تحقيق وتعاف وتحقق تقارب 171 دقيقة.
  • عند 21:38 كانت معظم النماذج تتعافى، لكن الطلبات وزمن الاستجابة بقيا مرتفعين؛ وعادت الواجهات الأربع إلى التشغيل عند بدء المراقبة في 22:20.
  • لم تنشر Anthropic السبب الجذري أو رموز الأخطاء أو مقام الطلبات أو عدد العملاء والمناطق أو تفاصيل التخفيف أو نتيجة تخص سلامة البيانات أو تقريراً لاحقاً.
  • سجل GitHub حادثة متزامنة لمزودي نماذج خارجيين من دون تسمية Anthropic؛ تزامن الساعتين لا يثبت هوية المزود ولا علاقة سببية.

سطح واسع بلا مقام كمي

تثبت صفحة الحالة أن نطاق الحادثة لم يقتصر على نموذج واحد أو واجهة واحدة. عند فتح التحقيق تغيرت حالة claude.ai وواجهة API وClaude Code وCowork معاً من التشغيل إلى انقطاع كبير. وحمل العنوان في نهايته عبارة الأخطاء المرتفعة عبر كل النماذج، بينما حمل السجل تصنيف الأثر الحرج.

هذه إشارات للاتساع وليست قياساً للعمق. لا يوجد عدد إجمالي للطلبات يمكن وضع الأخطاء فوقه، ولا فصل بين الفشل في المحاولة الأولى والنجاح بعد إعادة المحاولة والفشل النهائي. ولا يبين السجل هل أصاب الخلل العملاء أنفسهم في الواجهات الأربع أو تركز في منطقة أو نموذج أو نوع عمل محدد.

كلمة «حرج» ترفع أولوية استجابة المزود، لكنها ليست نسبة أو عدداً للمؤسسات أو تقديراً للخسارة. وعبارة «كل النماذج» تحدد امتداد الكتالوج ولا تعني أن كل استدعاء لكل نموذج فشل. تحديثات Anthropic نفسها تتحدث عن معدلات مرتفعة ثم تعافي معظم النماذج ثم نجاح كل النماذج، لا عن غياب كامل للخدمة.

انتقال الحالات يحدد مجالاً مشتركاً ولا يكشف السبب

عند 20:33 UTC قالت Anthropic إنها حددت مشكلة تؤدي إلى أخطاء مرتفعة عبر نماذج متعددة. وفي 21:38 قالت إن التعافي ظهر في معظم النماذج مع بقاء الطلبات وزمن الاستجابة مرتفعين. تحولت الواجهات الأربع عندها من انقطاع كبير إلى انقطاع جزئي.

في 22:20 رجعت كلها إلى التشغيل وبدأت المراقبة، ثم جاء إعلان الحل بعد ست عشرة دقيقة. هذا المسار المتزامن مهم لعميل يعتمد على أكثر من مدخل: الانتقال من التطبيق إلى API أو من Code إلى Cowork لا يضمن الخروج من مجال الأثر المنشور.

مع ذلك لا يرسم التزامن بنية النظام. قد تنتج الصورة نفسها من طبقة تقديم نموذج مشتركة أو توجيه أو اعتماد خارجي أو نشر جديد أو حتى طريقة تصنيف مكونات صفحة الحالة. لم تسم Anthropic أياً منها. الدليل يسمح بالحديث عن مجال تشغيل مشترك، ولا يسمح بتشخيص تقني.

كما لا يثبت خللاً في أوزان النماذج أو مخرجاتها. يمكن أن يفشل الطلب قبل الاستدلال أو أثناء البث أو في تنسيق الأدوات والجلسات. تضيف Code وCowork طبقات فوق استدعاء النموذج. ولا توجد نتيجة منشورة عن فقدان بيانات أو فساد إجابات أو تعرض معلومات أو فشل ضوابط السلامة.

نافذة الأعراض ليست دورة الاستجابة

فتح السجل عند 19:49:45 UTC، لكن تحديث المراقبة اللاحق أعاد بداية الأخطاء إلى 19:45 وحدد نهايتها عند 21:26. هذه مئة ودقيقة واحدة، وتبدأ قبل نشر الصفحة بأقل من خمس دقائق.

لم يغلق السجل حتى 22:36:20، أي بعد نحو 171 دقيقة من فتحه. تشمل هذه المدة التحقيق والتحديد والتعافي الجزئي والمراقبة والتأكيد. وصفها كلها بأنها أخطاء مستمرة سيخالف الحد الذي نشره المزود لاحقاً.

وفي المقابل، الاقتصار على مئة ودقيقة واحدة يخفي قرار العميل. بعد 21:26 لم تكن المكونات قد عادت فوراً إلى التشغيل. وبعد عودتها عند 22:20 بقيت مراقبة صريحة لمدة ست عشرة دقيقة. نهاية العرض وزمن الثقة في ثبات التعافي ساعتان مختلفتان، ولا ينبغي دمجهما.

إعادة المحاولة تغير معنى الخطأ

توضح وثائق Anthropic العامة أن الخطأ 500 يعني خطأ داخلياً في API، وأن 529 يعني حملاً زائداً مؤقتاً. وتعيد حزم التطوير الرسمية بعض الأعطال العابرة، مثل أخطاء الاتصال والحدود وأخطاء الخادم، مرتين افتراضياً مع انتظار متزايد.

هذه القواعد لا تشخص الحادثة. لم ينشر السجل رموز HTTP ولم يقل إن السبب حمل زائد. لكنها تبين لماذا يحتاج القياس إلى أكثر من عد الطلبات. قد تفشل المحاولة الأولى لعملية أعمال ثم تنجح الثانية؛ يرى المستخدم تأخيراً، ويرى المزود طلبين، ويسجل التطبيق نجاحاً نهائياً واحداً.

وقد ترفع موجة إعادات متزامنة عدد المحاولات فوق الطلب الأصلي. إشارة 21:38 إلى ارتفاع الطلبات والكمون لا تثبت أن ذلك حدث. المطلوب فصل عمليات الأعمال الأصلية عن مجموع المحاولات وإعاداتها والفشل النهائي. كما تسمح معرفات الطلب التي توثقها Anthropic بربط حالة فردية بدعم المزود بدلاً من الاكتفاء بلون عام.

التعافي يثبت عند حدود العمل الحقيقي

عودة صفحة المزود إلى اللون الأخضر تبدأ اختباراً ولا تحرر كل الطوابير آلياً. يمكن للفريق إرسال عدد صغير من الطلبات الاصطناعية إلى النموذج والواجهة وطول السياق والأدوات المستخدمة فعلياً، ثم إعادة الحركة على مراحل وقياس الفشل النهائي والكمون وعمر الطابور وإكمال مهمة الأعمال.

تحتاج الواجهات الأربع إلى مفاتيح صحة منفصلة. قد ينجح طلب API قصير قبل استقرار جلسة طويلة في Claude Code أو سير عمل Cowork. وقد تتدهور واجهة بينما تبقى قناة مباشرة قابلة للاستخدام. الاختبار المفيد يحاكي الحمل الحقيقي.

من الضروري أيضاً ضبط عدم التكرار. قد تضيع الاستجابة بعد تنفيذ فعل خارجي، فتكرر المحاولة غير المقيدة الأثر. ولا يخلو الانتقال إلى نموذج أو مزود بديل من تكلفة؛ فقد تتغير الجودة والسعر والسياق والأدوات والسلوك الأمني ومسار البيانات. يجب تحديد الأعمال القابلة للتحويل قبل وقوع الحادثة.

تزامن GitHub حد تحريري لا رابط سببي

فتح GitHub عند 20:07 UTC حادثة منفصلة تخص مزودي نماذج Copilot. ذكر زيادة الأخطاء في الطلبات إلى مزودين محددين أو خارجيين واحتمال فشل أو تدهور بعض استخدامات Copilot. وعند 21:51 قال إن المزود الخارجي حل المشكلة وإن حركة Copilot تعافت.

تتداخل هذه الأوقات مع نافذة Anthropic، لكن GitHub لم ينشر اسم المزود أو قائمة النماذج أو السبب. يمكن لمنتج واحد استخدام مزودين عدة، ويمكن لحادثتين مستقلتين أن تتزامنا. لذلك لا يجوز استبدال اسم المزود المجهول باسم Anthropic بناء على الساعة.

يفيد سجل GitHub في إظهار أن عطل نموذج يمكن أن يظهر كتدهور في منصة تابعة. لكنه لا يكمل سلسلة الهوية. الربط يحتاج تسمية صريحة أو دليلاً تقنياً مشتركاً.

التقرير اللاحق يجب أن يضيف المعدل والطبقة والإجراء

قدمت الصفحة الحالية تسلسلاً موثوقاً: تصنيف حرج، كل النماذج، أربع واجهات، تعاف جزئي، تشغيل، مراقبة ثم حل. لكنها لم تقدم معدلات الفشل القصوى والمتوسطة، النتائج قبل إعادة المحاولة وبعدها، التوزيع الجغرافي أو المؤسسي، أو الفرق بين API والتطبيق وCode وCowork.

يحتاج العملاء أيضاً إلى معرفة الطبقة التي فشلت وإجراء التخفيف أو الرجوع والضابط الذي يقلل التكرار. وينبغي إعلان نتائج واضحة عن سلامة البيانات والأمن والسلامة؛ الصمت ليس دليلاً على الضرر ولا على غيابه.

تبقى الحقيقة جوهرية من دون مبالغة: دخلت كل النماذج وأربع واجهات في نطاق حادثة حرجة، واستمرت الأخطاء المرصودة مئة ودقيقة واحدة، بينما استغرقت الاستجابة العامة نحو 171 دقيقة حتى الحل. نعرف أين ظهر الاضطراب ومتى عادت الحالات، ولا نعرف كم عملية فشلت نهائياً أو لماذا. هذا المقام المفقود هو لب تقييم بنية ذكاء اصطناعي يعتمد عليها الآخرون.

المصادر