منهجية الاختبار

توضح هذه الصفحة الطريقة التي نتبعها عند اختبار Claude أو Claude Code أو Claude API أو أي ميزة مرتبطة بها. الهدف هو جعل النتائج مفهومة وقابلة للمراجعة، لا تقديم انطباع شخصي على أنه حقيقة عامة.

متى نصف نتيجة بأنها تم اختبارها؟

نستخدم وصف تم اختباره عمليًا عندما ينفذ فريق الموقع المهمة داخل المنتج أو الواجهة أو الـAPI ويسجل الظروف الأساسية التي أثرت في النتيجة.

لا نستخدم هذا الوصف لمجرد قراءة تجربة شخص آخر أو مشاهدة لقطة شاشة منشورة في موقع خارجي.

تصنيفات التحقق

التصنيفالمعنى
Documentation-verifiedمذكور في وثائق أو صفحات رسمية
Browser-observedظهر داخل واجهة المنتج وقت المراجعة
Hands-on testedتم تنفيذ المهمة وتسجيل النتيجة عمليًا
Editorial interpretationتحليل مستقل للنتائج أو الوثائق

ما الذي نسجله قبل الاختبار؟

  • السؤال أو الفرضية التي نريد اختبارها.
  • تاريخ ووقت الاختبار.
  • النموذج المستخدم.
  • الخطة المستخدمة.
  • المنصة: Web أو Desktop أو Mobile أو Claude Code أو API.
  • لغة الواجهة والمحادثة.
  • الإعدادات التي قد تؤثر في النتيجة.
  • الأدوات المتاحة مثل Web Search أو Research أو Code Execution.
  • البرومبت أو المهمة.
  • الملف أو مجموعة البيانات المستخدمة.

اختبارات الواجهة

تستخدم اختبارات الواجهة للتحقق من وجود ميزة أو إعداد أو زر أو مسار داخل Claude. نوضح أن ظهور الميزة قد يختلف حسب الخطة والمنطقة والحساب ومرحلة الإطلاق.

عند استخدام لقطة شاشة، نحاول تسجيل تاريخها وعدم عرضها على أنها تعكس كل الحسابات إلى أجل غير محدد.

اختبارات الملفات

قد نستخدم ملفات PDF وCSV وXLSX وDOCX وصورًا ومستندات طويلة لاختبار الرفع والاستخراج والتحليل ودقة الإجابة.

  • نستخدم ملفات اختبار ثابتة قدر الإمكان.
  • نعرف القيم الصحيحة مسبقًا عندما يكون الهدف قياس الدقة.
  • نسجل حجم الملف وعدد الصفحات ونوع المحتوى.
  • نفصل بين نجاح الرفع وصحة التحليل.
  • لا نستخدم بيانات شخصية حقيقية دون حاجة وتصريح مناسب.

اختبارات الكتابة العربية

لا نقيس جودة العربية بالانطباع العام فقط. يمكن أن تشمل المعايير:

  • فهم السؤال العربي.
  • سلامة المعنى.
  • الطبيعية وعدم الترجمة الحرفية.
  • الاتساق في المصطلحات.
  • اتباع التعليمات.
  • القدرة على التمييز بين الفصحى واللهجات عند طلب ذلك.
  • عدم إضافة معلومات غير موجودة.

اختبارات البحث والمصادر

عند اختبار Web Search أو Research، لا نقيّم عدد الروابط فقط. نفحص:

  • هل المصدر موجود ويعمل؟
  • هل المصدر أولي أم ثانوي؟
  • هل تاريخ المصدر مناسب؟
  • هل يدعم المصدر الادعاء فعلًا؟
  • هل أغفل Claude قيدًا أو استثناءً جوهريًا؟
  • هل خلط بين خطط أو نماذج أو فترات زمنية مختلفة؟

اختبارات Claude Code

يمكن أن تشمل اختبارات Claude Code فهم مشروع، أو إصلاح خطأ، أو كتابة اختبار، أو تعديل ملفات متعددة، أو استخدام Hooks وSkills وMCP.

نسجل نظام التشغيل، وبيئة التطوير، وإصدار Claude Code، وحالة المستودع، والأدوات والصلاحيات المتاحة. لا نقارن أداة تملك وصولًا كاملًا إلى المشروع بأداة لم تحصل على الصلاحيات نفسها دون توضيح الفرق.

عدد مرات التجربة

نتيجة محاولة واحدة لا تكفي دائمًا للحكم على جودة نموذج احتمالي. نكرر المهمة عندما يكون التباين متوقعًا، ونذكر عدد المحاولات أو نصف الاختبار بأنه استكشافي إذا كان محدودًا.

المقارنات العادلة

  • نستخدم المهمة نفسها قدر الإمكان.
  • نمنح الطرفين السياق والملفات نفسيهما.
  • نستخدم خططًا ونماذج مناسبة للمقارنة.
  • لا نغيّر البرومبت لمصلحة أداة دون توضيح السبب.
  • نوضح عندما لا تكون المزايا متكافئة.
  • نفصل السعر والسرعة والدقة وتجربة الاستخدام بدل دمجها في حكم واحد.

مقياس النتائج

يختلف المقياس حسب المهمة. قد نستخدم إجابة صحيحة أو خاطئة، أو نسبة اكتمال، أو عدد أخطاء، أو وقت تنفيذ، أو تقييمًا تحريريًا متعدد المعايير.

عند استخدام تقييم بشري، نوضح أنه يتضمن حكمًا تحريريًا ولا نقدمه بوصفه قياسًا موضوعيًا بالكامل.

حدود الاختبارات

  • قد تختلف النتيجة بين المحاولات.
  • قد تختلف الميزة بين الحسابات والمناطق.
  • قد يتغير النموذج دون إعادة الاختبار فورًا.
  • لا تمثل مجموعة اختبار صغيرة جميع حالات الاستخدام.
  • لا يعني تفوق أداة في مهمة واحدة أنها الأفضل لجميع المستخدمين.

إعادة الاختبار

قد نعيد الاختبار عند إطلاق نموذج جديد، أو تغيير الخطة، أو تحديث الميزة، أو تغير الوثائق، أو تلقي بلاغ موثق بأن النتيجة القديمة لم تعد قابلة للتكرار.

الاختلاف مع الوثائق الرسمية

إذا اختلف سلوك ظهر في الاختبار مع وصف رسمي، نوضح الأمرين وتاريخ كل منهما. لا نستبدل الوثائق الرسمية بتجربة واحدة، ولا نتجاهل التجربة إذا كشفت فرقًا يستحق التوضيح.

التصحيحات

إذا تبين وجود خلل في البيانات أو طريقة الاختبار أو تفسير النتيجة، نصحح التقرير وفق سياسة التصحيحات.

آخر تحديث: 23 أغسطس 2026