در این بخش ، ما تمایز بین Outliers و مشاهدات اهرم بالا را می آموزیم. به اختصار:
- یک نکته مهم یک نقطه داده است که پاسخ y از روند کلی بقیه داده ها پیروی نمی کند.
- اگر مقادیر پیش بینی کننده "شدید" داشته باشد ، یک نقطه داده دارای اهرم بالایی است. با یک پیش بینی کننده واحد ، یک مقدار X شدید به سادگی موردی است که به خصوص بالا یا پایین است. با پیش بینی کننده های متعدد ، مقادیر شدید X ممکن است برای یک یا چند پیش بینی کننده به خصوص زیاد یا پایین باشد ، یا ممکن است ترکیب "غیرمعمول" مقادیر پیش بینی کننده باشد (به عنوان مثال ، با دو پیش بینی کننده که با همبستگی مثبت دارند ، ترکیبی غیرمعمول از مقادیر پیش بینی کننده ممکن است زیاد باشدمقدار یک پیش بینی کننده جفت با مقدار کم پیش بینی کننده دیگر).
توجه داشته باشید که - برای اهداف ما - ما یک نقطه داده را تنها در صورتی که با توجه به مقادیر y دیگر شدید باشد ، نه مقادیر X در نظر می گیریم.
یک نقطه داده تأثیرگذار است اگر به طور غیرقانونی بر هر بخشی از تجزیه و تحلیل رگرسیون ، مانند پاسخ های پیش بینی شده ، ضرایب شیب تخمین زده شده یا نتایج آزمون فرضیه تأثیر بگذارد. Outliers و نقاط داده های اهرم بالا این پتانسیل را دارند که تأثیرگذار باشند ، اما ما به طور کلی باید بررسی کنیم تا مشخص شود که آیا آنها واقعاً تأثیرگذار هستند یا خیر.
یکی از مزیت های موردی که در آن فقط یک پیش بینی کننده داریم این است که می توانیم به منظور شناسایی هرگونه مسافت و نقاط داده بالا ، به توطئه های پراکندگی ساده نگاه کنیم. بیایید نگاهی به چند مثال بیندازیم که باید به روشن شدن تمایز بین دو نوع ارزش شدید کمک کند.
مثال شماره 1
بر اساس تعاریف فوق ، آیا فکر می کنید مجموعه داده های زیر (تأثیر 1. txt) حاوی مسافت های خارج از کشور است؟یا ، هر نقطه داده اهرم بالا؟

فهمیدی! تمام نقاط داده از روند کلی بقیه داده ها پیروی می کنند ، بنابراین هیچ دور از دسترس (در جهت y) وجود ندارد. و هیچ یک از نقاط داده با توجه به X شدید نیست ، بنابراین هیچ نقطه اهرم بالایی وجود ندارد. به طور کلی ، هیچ یک از نقاط داده با توجه به موقعیت بهترین خط مناسب به نظر نمی رسد.
مثال شماره 2
حال ، این مثال چطور؟آیا فکر می کنید مجموعه داده های زیر (INFUCT2. TXT) حاوی مسافت های خارج از کشور است؟یا ، هر نقطه داده اهرم بالا؟

البته! از آنجا که نقطه داده قرمز از روند کلی بقیه داده ها پیروی نمی کند ، این یک چیز مهم در نظر گرفته می شود. با این حال ، این نکته دارای مقدار X شدید نیست ، بنابراین اهرم بالایی ندارد. آیا نقطه داده قرمز تأثیرگذار است؟یک روش آسان برای تعیین اینکه آیا نقطه داده تأثیرگذار است ، یافتن بهترین خط مناسب دو بار است - یک بار با نقطه داده قرمز گنجانده شده و یک بار با نقطه داده قرمز حذف شده است. طرح زیر دو خط مناسب را نشان می دهد:

وای - حتی گفتن دو معادله رگرسیون تخمین زده شده از هم سخت است! خط جامد معادله رگرسیون تخمین زده شده با نقطه داده قرمز را نشان می دهد ، در حالی که خط متراکم نشان دهنده معادله رگرسیون تخمین زده شده با نقطه داده قرمز است که مستثنی است. دامنه های این دو خط بسیار مشابه هستند - به ترتیب 5. 04 و 5. 12.
آیا این دو نمونه هنگام آزمایش H نتایج متفاوتی دارند0: β1= 0؟خوب ، هنگامی که نقطه داده قرمز شامل می شود ، خروجی زیر را بدست می آوریم:

و خروجی زیر هنگامی که نقطه داده قرمز مستثنی است:

مطمئناً برخی از عوارض جانبی جزئی از جمله داده قرمز وجود دارد ، اما هیچ چیز خیلی جدی نیست:
- مقدار R 2 اندکی کاهش یافته است ، اما رابطه بین Y و X همچنان قوی تلقی می شود.
- خطای استاندارد B1، که در محاسبه فاصله اطمینان ما برای β استفاده می شود1، هنگامی که نقطه داده قرمز درج شده است ، بزرگتر است و از این طریق عرض فاصله اطمینان ما را افزایش می دهد. ممکن است به یاد بیاورید که خطای استاندارد B1بستگی به میانگین خطای مربع MSE دارد که تفاوت بین پاسخ های مشاهده شده و پیش بینی شده را تعیین می کند. به این دلیل است که نقطه داده قرمز یک خطای بالاتر - در جهت y - خطای استاندارد b است1افزایش می یابد ، نه به این دلیل که نقطه داده به هر طریقی تأثیرگذار است.
- در هر حالت ، P-Value برای آزمایش H0: β1= 0 کمتر از 0. 001 است. در هر صورت ، می توان نتیجه گرفت که شواهد کافی در سطح 0. 05 وجود دارد تا نتیجه بگیریم که ، در جمعیت ، x مربوط به y است.
به طور خلاصه ، پاسخ های پیش بینی شده ، ضرایب شیب تخمین زده شده و نتایج آزمون فرضیه تحت تأثیر قرار گرفتن نقطه داده قرمز قرار نمی گیرند. بنابراین ، نقطه داده تأثیرگذار تلقی نمی شود. به طور خلاصه ، نقطه داده قرمز تأثیرگذار نیست و از اهرم بالایی برخوردار نیست ، اما این یک چیز مهم است.
مثال شماره 3
حال ، این مثال چطور؟آیا فکر می کنید مجموعه داده های زیر (INFUCT3. TXT) حاوی مسافت های خارج از کشور است؟یا ، هر نقطه داده اهرم بالا؟

در این حالت ، نقطه داده قرمز از روند کلی بقیه داده ها پیروی می کند. بنابراین ، در اینجا به عنوان یک چیز مهم تلقی نمی شود. با این حال ، این نکته دارای مقدار X شدید است ، بنابراین اهرم بالایی دارد. آیا نقطه داده قرمز تأثیرگذار است؟مطمئناً به نظر می رسد از بقیه داده ها (در جهت X) بسیار دور است ، اما آیا این کافی است تا نقطه داده در این مورد تأثیرگذار باشد؟
طرح زیر دو خط مناسب را نشان می دهد - یکی به دست آمده هنگامی که نقطه داده قرمز گنجانده شده است و یکی به دست آمده در هنگام حذف نقطه داده قرمز:

باز هم ، سخت است که حتی به دو معادله رگرسیون تخمین زده شده از هم جدا شویم! خط جامد معادله رگرسیون تخمین زده شده با نقطه داده قرمز را نشان می دهد ، در حالی که خط متراکم نشان دهنده معادله رگرسیون تخمین زده شده با نقطه داده قرمز است که مستثنی است. دامنه دو خط بسیار مشابه است - به ترتیب 4. 927 و 5. 117.
آیا این دو نمونه هنگام آزمایش H نتایج متفاوتی دارند0: β1= 0؟خوب ، هنگامی که نقطه داده قرمز شامل می شود ، خروجی زیر را بدست می آوریم:

و خروجی زیر هنگامی که نقطه داده قرمز مستثنی است:

در اینجا ، به هیچ وجه عوارض جانبی از جمله نقطه داده قرمز وجود ندارد:
- مقدار R 2 به سختی تغییر نکرده است ، و فقط کمی از 97. 3 ٪ به 97. 7 ٪ افزایش می یابد. در هر صورت ، رابطه بین Y و X قوی تلقی می شود.
- خطای استاندارد B1در هر مورد تقریباً یکسان است - 0. 172 وقتی نقطه داده قرمز گنجانده شده است ، و 0. 200 هنگام حذف نقطه داده قرمز. بنابراین ، عرض فواصل اطمینان برای β1تا حد زیادی از وجود نقطه داده قرمز بی تأثیر باقی می ماند. ممکن است توجه داشته باشید که دلیل این امر این است که نقطه داده به شدت بر MSE تأثیر نمی گذارد.
- در هر حالت ، P-Value برای آزمایش H0: β1= 0 کمتر از 0. 001 است. در هر صورت ، می توان نتیجه گرفت که شواهد کافی در سطح 0. 05 وجود دارد تا نتیجه بگیریم که ، در جمعیت ، x مربوط به y است.
به طور خلاصه ، پاسخ های پیش بینی شده ، ضرایب شیب تخمین زده شده و نتایج آزمون فرضیه تحت تأثیر قرار گرفتن نقطه داده قرمز قرار نمی گیرند. بنابراین ، نقطه داده تأثیرگذار تلقی نمی شود. به طور خلاصه ، نقطه داده قرمز تأثیرگذار نیست ، و همچنین از این امر دور نیست ، اما اهرم بالایی دارد.
مثال شماره 4
یک مثال آخر! آیا فکر می کنید مجموعه داده های زیر (INFUCT4. TXT) حاوی مسافت های خارج از کشور است؟یا ، هر نقطه داده اهرم بالا؟

این درست است - در این حالت ، نقطه داده قرمز مطمئناً یک دور از دسترس است و اهرم بالایی دارد! نقطه داده قرمز از روند کلی بقیه داده ها پیروی نمی کند و همچنین دارای مقدار X شدید است. و در این حالت نقطه داده قرمز تأثیرگذار است. دو خط مناسب - یکی به دست آمده هنگامی که نقطه داده قرمز گنجانده شده است و یکی به دست آمده در هنگام حذف نقطه داده قرمز:

(جای تعجب آور نیست) از نظر قابل ملاحظه ای متفاوت است. خط جامد معادله رگرسیون تخمین زده شده با نقطه داده قرمز را نشان می دهد ، در حالی که خط متراکم نشان دهنده معادله رگرسیون تخمین زده شده با نقطه داده قرمز است که مستثنی است. وجود نقطه داده قرمز به طور قابل توجهی شیب خط رگرسیون را کاهش می دهد - آن را از 5. 117 به 3. 320 کاهش می دهد.
آیا این دو نمونه هنگام آزمایش H نتایج متفاوتی دارند0: β1= 0؟خوب ، هنگامی که نقطه داده قرمز شامل می شود ، خروجی زیر را بدست می آوریم:

و خروجی زیر هنگامی که نقطه داده قرمز مستثنی است:

نقطه داده قرمز در تجزیه و تحلیل رگرسیون ما در اینجا چه تأثیری دارد؟به طور خلاصه:
- مقدار R 2 از 97. 32 ٪ به 55. 19 ٪ کاهش یافته است. اگر نقطه داده قرمز را درج کنیم ، نتیجه می گیریم که رابطه بین Y و X فقط نسبتاً قوی است ، در حالی که اگر نقطه داده قرمز را حذف کنیم ، نتیجه می گیریم که رابطه بین Y و X بسیار قوی است.
- خطای استاندارد B1تقریباً 3. 5 برابر بزرگتر است که نقطه داده قرمز گنجانده شده است - از 0. 200 به 0. 686 افزایش می یابد. این افزایش می تواند تأثیر قابل توجهی در عرض فاصله اطمینان ما برای β داشته باشد1بشرباز هم ، این افزایش به این دلیل است که نقطه داده قرمز یک فاصله دور است - در جهت Y.
- در هر حالت ، P-Value برای آزمایش H0: β1= 0 کمتر از 0. 001 است. در هر دو مورد ، می توان نتیجه گرفت که شواهد کافی در سطح 0. 05 وجود دارد تا نتیجه بگیریم که ، در جمعیت ، x مربوط به y است. توجه داشته باشید ، با این حال ، که t-statistic با گنجاندن نقطه داده قرمز به طور چشمگیری از 25. 55 به 4. 84 کاهش می یابد.
در اینجا ، پاسخ های پیش بینی شده و ضرایب شیب تخمین زده شده به وضوح از حضور نقطه داده قرمز تحت تأثیر قرار می گیرند. در حالی که نقطه داده بر اهمیت آزمون فرضیه تأثیر نمی گذارد ، T-statistic به طرز چشمگیری تغییر می کند. در این حالت ، نقطه داده قرمز هم اهرم بالا و هم از نظر دور به نظر می رسد و معلوم شد که نیز تأثیرگذار است.
خلاصه
مثالهای فوق - با استفاده از توطئه های ساده - تمایز بین Outersiers و Data Data با اهرم بالا را برجسته کرده است. در مثالهای 2 و 4 از فاصله دور وجود داشت. در مثال 3 و 4 نقاط داده اهرم بالایی وجود داشت. با این حال ، فقط در مثال 4 نقطه داده را انجام داد که هم یک نقطه حیاط و هم یک نقطه اهرم بالا به نظر می رسد تأثیرگذار است. یعنی ، هر نقطه داده های بیش از حد یا زیاد اهرم به شدت بر تجزیه و تحلیل رگرسیون تأثیر نمی گذارد. این وظیفه شما به عنوان یک تحلیلگر رگرسیون است که همیشه تعیین کنید که آیا تجزیه و تحلیل رگرسیون شما تحت تأثیر یک یا چند نکته داده است.
البته ، وضعیت آسان برای رگرسیون خطی ساده رخ می دهد ، هنگامی که می توانیم برای روشن کردن مسائل به توطئه های پراکندگی ساده اعتماد کنیم. متأسفانه ، ما در مورد رگرسیون چند خطی چندانی از این تجملات نداریم. در این شرایط ، ما باید به اقدامات مختلفی اعتماد کنیم تا به ما کمک کنیم تا تعیین کنیم که آیا یک نقطه داده یک اهرم دورتر ، بالا یا هر دو است. پس از شناسایی چنین نکاتی ، باید ببینیم که آیا این نقاط در واقع تأثیرگذار هستند یا خیر. ما یاد خواهیم گرفت که چگونه همه این کارها را در چند بخش بعدی انجام دهیم!
استراتژی های مؤثر فارکس...
ما را در سایت استراتژی های مؤثر فارکس دنبال می کنید
برچسب :
نویسنده : توران میرهادی
بازدید : <-PostHit->
تاريخ : سه
شنبه
17 مرداد
1402 ساعت: 14:52