كيف يتم حساب R تربيع (الصيغة والمدخلات والحدود)
الإجابة المباشرة: ما هو R تربيع؟
R تربيع (غالبًا ما يُكتب R²) هو رقم يصف مقدار التباين في هدف مُلاحظ (المتغير التابع) الذي يتم تفسيره بواسطة مجموعة من التوقعات المُركَّبة (مخرجات النموذج). وبأكثر صورة شائعة، يتم حساب R² من كميتين:
- التباين الكلي في البيانات المُلاحظة
- التباين المتبقي (غير المُفسَّر) بعد استخدام التوقعات المُركَّبة
التفسير بلغة بسيطة: إذا كان التباين المتبقي صغيرًا مقارنةً بالتباين الكلي، فإن R² يكون أعلى؛ وإذا كان التباين المتبقي كبيرًا، فإن R² يكون أقل.
الآلية: الصيغة وكل مدخل مطلوب
1) عرّف البيانات
لحساب R² تحتاج إلى مجموعة من القيم المُلاحظة وقيم مُركَّبة (متوقعة) مقابلة.
- القيم المُلاحظة: (y_1, y_2, \dots, y_n)
- القيم المُركَّبة (المتوقعة): (\hat{y}_1, \hat{y}_2, \dots, \hat{y}_n)
- متوسط العينة للقيم المُلاحظة: (\bar{y} = \frac{1}{n}\sum_{i=1}^{n} y_i)
حيث (n) هو عدد نقاط البيانات التي تقوم بتقييمها.
2) احسب مجموعات مربعات
يستخدم R² مجموعات مربعات مبنية على الفروق عن المتوسطات والفروق عن القيم المُركَّبة المتوقعة.
-
مجموع مربعات الكلي (التباين حول المتوسط): [ \mathrm{SST} = \sum_{i=1}^{n} (y_i - \bar{y})^2 ]
-
مجموع مربعات البواقي (التباين المتبقي بعد الملاءمة): [ \mathrm{SSE} = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 ]
3) احسب R تربيع
في التعريف الأكثر شيوعًا: [ R^2 = 1 - \frac{\mathrm{SSE}}{\mathrm{SST}} ]
يتطلب ذلك (\mathrm{SST} > 0). إذا كانت كل القيم المُلاحظة (y_i) متطابقة، فسيكون (\mathrm{SST}=0) وبالتالي لا يكون R² مُعرَّفًا بشكل ذي معنى في هذا الشكل.
4) اختيار عملي أساسي: على أي بيانات يتم حساب (\hat{y})؟
لا تحدد الصيغة نفسها ما إذا كانت (\hat{y}) تأتي من:
- نفس البيانات المستخدمة لتدريب النموذج (داخل العينة)، أو
- بيانات منفصلة لم تُستخدم أثناء التدريب (خارج العينة)
غالبًا ما يؤدي استخدام القيم المُركَّبة داخل العينة إلى تضخيم الأداء للنماذج المرنة. أما استخدام التوقعات خارج العينة فيعطي عادةً إحساسًا أكثر واقعية بمدى تعميم العلاقة، لكنه قد يُنقص R² حتى عندما يكون النموذج مفيدًا من حيث الاتجاه.
دليل أو مثال: حساب ملموس (مع افتراضات واضحة)
افترض أن لديك (n=3) قيمًا مُلاحظة (y) ونموذجًا ينتج قيمًا مُركَّبة (\hat{y}) لنفس النقاط الثلاثة.
لنفرض:
- (y = [2,\ 4,\ 6])
- (\hat{y} = [2,\ 5,\ 5])
الخطوة 1: احسب المتوسط [ \bar{y} = (2+4+6)/3 = 4 ]
الخطوة 2: احسب (\mathrm{SST}) [ \mathrm{SST} = (2-4)^2 + (4-4)^2 + (6-4)^2 = 4 + 0 + 4 = 8 ]
الخطوة 3: احسب (\mathrm{SSE}) [ \mathrm{SSE} = (2-2)^2 + (4-5)^2 + (6-5)^2 = 0 + 1 + 1 = 2 ]
الخطوة 4: احسب R² [ R^2 = 1 - 2/8 = 1 - 0.25 = 0.75 ]
ضمن هذا الحساب، تشير 0.75 إلى أن التباين المتبقي يمثل ربع التباين الكلي (لهذا الإعداد التقييمي).
القيود وأوضاع الفشل: ماذا يمكن أن يخطئ فيه R تربيع
يُستخدم R² على نطاق واسع، لكنه ليس ضمانًا للمنفعة. يمكن لعدة قيود جوهرية أن تجعله يضلل.
1) فرط الملاءمة عند التقييم داخل العينة
إذا كان النموذج مرنًا وقمت بحساب R² باستخدام القيم المُركَّبة على نفس مجموعة البيانات التي تعلم منها، فقد تكون أخطاء البواقي صغيرة بشكل مصطنع. قد يؤدي ذلك إلى الحصول على R² مرتفع حتى عندما لا يلتقط النموذج علاقة مستقرة.
2) عدم تطابق اللاخطية
يقيس R² مدى تطابق القيم المتوقعة مع القيم المُلاحظة عبر البواقي. ولا يضمن أن العلاقة الأساسية لها بنية معينة (مثل الخطية) ما لم يفرض نهج النمذجة لديك تلك البنية.
قد يُظهر النموذج R² متوسطًا أو مرتفعًا بينما يظل غير مناسب للتنبؤ خارج نطاق البيانات، لأن R² وصفي لمجموعة التقييم، وليس قانونًا عامًا.
3) تأثيرات المقياس والمعالجة المسبقة
لأن (\mathrm{SST}) و(\mathrm{SSE}) تعتمد على مقياس (y)، فإن خطوات المعالجة المسبقة (مثل أخذ الفروق، أو التطبيع، أو التحويلات) يمكن أن تغيّر R². قد ينتهي محللان يعملان بتحويلات مختلفة إلى قيم R² مختلفة حتى لو كانت “جودة الملاءمة” قابلة للمقارنة.
4) قد يكون R² غير مُعرّف أو غير بديهي
- إذا كانت (\mathrm{SST}=0)، فإن الصيغة تتعطل.
- اعتمادًا على كيفية إنتاج التوقعات وما إذا كنت تستخدم تعريفات بديلة (مثل النسخ المُعدَّلة)، قد تكون القيمة أقل بديهية من “النسبة المفسَّرة”.
5) العلاقة مقابل السببية
يقيس R² مدى قرب التوقعات من تتبع الملاحظات. ولا يثبت سبب وجود العلاقة. حتى مع R² مرتفع، قد تعكس الارتباطات عوامل مشتركة، أو شوائب في البيانات، أو أنماطًا متزامنة بالصدفة.
التحقق والسؤال التالي: كيف تتحقق بشكل مستقل من R تربيع المُبلَّغ
إذا رأيت R² مُبلَّغًا، يمكنك التحقق من الحساب عبر فحص هذه الحقائق، دون الاعتماد على ادعاءات حول الأداء المستقبلي:
- أكد حجم مجموعة التقييم (n).
- احصل على القيم المُلاحظة (y_i).
- حدّد القيم المُركَّبة/المتوقعة (\hat{y}_i) المستخدمة لحساب أخطاء البواقي.
- أعد حساب (\bar{y})، وSST، وSSE، ثم احسب (R^2 = 1 - \mathrm{SSE}/\mathrm{SST}).
إذا لم يذكر المزود أو الحاسِب أي (\hat{y}) تم استخدامها (داخل العينة مقابل خارج العينة) وما هي المعالجة المسبقة التي تم تطبيقها، فإن R² المُبلَّغ يبقى مُعرّفًا رياضيًا، لكن المقارنة بين الإعدادات تصبح غير مؤكدة.
سؤال متابعة مفيد هو كيف يختلف R² عند حسابه لأفكار مرتبطة (على سبيل المثال، باستخدام تقسيمات تقييم مختلفة أو أشكال نمذجة مختلفة)، لأن هذه الاختيارات تغيّر ما الذي يقيسه R² فعليًا.