اغلب اوقات یک تحلیلگر آماری به یک مجموعه داده مجموعه داده می شود و از آنها خواسته می شود با استفاده از تکنیکی مانند رگرسیون خطی ، یک مدل را متناسب کند. غالباً مجموعه داده ها با سلب مسئولیت مشابه "اوه بله ، ما جمع آوری برخی از این نقاط داده را به هم ریختیم - آنچه را که می توانید انجام دهید".
این وضعیت منجر به متناسب با رگرسیون می شود که به شدت تحت تأثیر حضور در خارج از کشور قرار می گیرند که ممکن است داده های نادرست باشند. با توجه به موارد زیر:
از نظر علمی و هم اخلاقی خطرناک است که داده ها را بدون هیچ دلیلی به غیر از این که "باعث می شود مناسب به نظر برسد" بیرون بیاندازد.
در زندگی واقعی ، افرادی که داده ها را جمع آوری کرده اند ، اغلب برای پاسخ به سؤالاتی از قبیل "هنگام تولید این مجموعه داده ، دقیقاً کدام یک از نکات را خراب کرده اید؟"
از چه آزمایشات آماری یا قوانین انگشت شست می توان به عنوان پایه ای برای محرومیت از مسافت های دور در تجزیه و تحلیل رگرسیون خطی استفاده کرد؟
آیا ملاحظات ویژه ای برای رگرسیون چند خطی وجود دارد؟
10 پاسخ 10
به جای حذف خارج از کشور ، می توانید از یک روش قوی رگرسیون استفاده کنید. به عنوان مثال ، در R ، عملکرد RLM () از بسته انبوه به جای عملکرد LM () قابل استفاده است. روش تخمین را می توان تنظیم کرد که کم و بیش برای Outriers قوی باشد.
$ begingroup $ در صورت استفاده از عملکرد RLM () ، من ضرایب را می بینم و آزمون های T آنها تولید می شود. اما چگونه می توانم مقادیر f-s-square را از اینجا بدست آورم؟من فکر می کنم اگر صحیح باشم ، نمی توانم این مقادیر F-T-Test و R را از نتایج خلاصه "LM" ساده بیاورم.$ endgroup $
$ begingroup $ برای رگرسیون قوی ، فرضیات موجود در آزمون F دیگر راضی نیستند ، و R^2 را می توان به چند روش تعریف کرد که دیگر معادل آن نیستند. برای بحث در مورد این مورد برای Stata ، به Stats. idre. ucla. edu/stata/faq/… مراجعه کنید.$ endgroup $
$ begingroup $ اما من دستور به نام F. Robftest را از بسته SFSMISC پیدا می کنم که نتیجه F-t-test را ارائه می دهد. آیا می توانم از این نتیجه برای تعریف آمار آزمون f برای RLM استفاده کنم؟همچنین ، من به نظر می رسد که با وارد کردن مقادیر در فرمول ریاضی مربع R مانند 1 - SUM ، مربع R را بدست آورم (باقیمانده (RLM (y~x))^2)/sum ((y-mean (y))^2). برای مقادیر آزمون t برای بررسی اهمیت ضرایب ، مقادیر آزمون t را از خلاصه دریافت می کنم (RLM (y~x)) که من با مقادیر T از سطح اطمینان 95 ٪ یا بیشتر مقایسه می کنم. آیا می توانم از این روش ها استفاده کنم؟$ endgroup $
$x08egingroup$ @RobHyndman چرا $1-SSE/TSS$ معمولی (مجموع مربعات خطا، مجموع مجموع مربعات) اعمال نمی شود؟ما مدل را تغییر نداده ایم، فقط روش تخمین را تغییر داده ایم. آیا ربطی به این دارد که $SSE$ و $TSS$ به ویژه نسبت به مقادیر پرت و سایر مقادیر شدید حساس هستند؟$endgroup$
گاهی اوقات داده های پرت داده های بدی هستند و باید از آن حذف شوند، مانند اشتباهات تایپی. گاهی اوقات آنها وین گرتزکی یا مایکل جردن هستند و باید نگه داشته شوند.
روش های تشخیص بیرونی عبارتند از:
Univariate ->طرح جعبهخارج از محدوده 1. 5 برابری بین چارکی یک نقطه پرت است.
Bivariate ->پراکندگی با بیضی اطمینان. مثلاً، خارج از بیضی اطمینان 95 درصد، یک امر پرت است.
Multivariate ->فاصله D2 Mahalanobis
آن مشاهدات را به عنوان موارد پرت علامت گذاری کنید.
یک رگرسیون لجستیک (روی Y=IsOutlier) اجرا کنید تا ببینید آیا الگوهای سیستماتیک وجود دارد یا خیر.
مواردی را که می توانید نشان دهید نماینده هیچ گروه فرعی نیستند را حذف کنید.
$x08egingroup$ و اگر هنوز هم مقادیر پرت دارید، از مدلی متفاوت از مدل خطی استفاده کنید. به عنوان مثال، اگر از مدلی با رفتاری مانند قانون قدرت استفاده کنید، مایکل جردن دیگر یک چیز دور از ذهن نیست (از نظر توانایی مدل ها برای سازگاری با او).$endgroup$
$x08egingroup$ با اکثر مواردی که در اینجا گفته شده موافقم، اما مایلم این احتیاط را اضافه کنم که "خارج از 1. 5 برابر محدوده بین چارکی، یک قرارداد است" یک قرارداد است، نه یک قاعده با هیچ مبنای نظری. نباید به عنوان توجیهی برای حذف نقاط داده استفاده شود.$endgroup$
من فکر می کنم برای حذف موارد پرت می توان چیزی گفت. یک خط رگرسیون قرار است داده ها را خلاصه کند. به دلیل اهرم شما می توانید موقعیتی داشته باشید که 1٪ از نقاط داده شما 50٪ بر شیب تأثیر می گذارد.
فقط از نظر اخلاقی و علمی خطرناک است که به کسی نگویید که موارد پرت را حذف کرده اید. تا زمانی که به آنها اشاره کنید می توانید بگویید:
"این خط رگرسیون به خوبی برای اکثر داده ها مطابقت دارد. 1٪ از مواقع مقداری به دست می آید که با این روند مطابقت ندارد، اما هی، این دنیای دیوانه کننده ای است، هیچ سیستمی کامل نیست."
$x08eginggroup$ مدل های دیگر را در نظر بگیرید. اگر جهان پر از «غیرطبیعی» حذف شده است که داده های واقعی بودند، در نتیجه نمی توان چیز واقعاً مهمی را پیش بینی کرد. بسیاری از فرآیندهای طبیعی رفتاری مانند قانون قدرت با رویدادهای شدید نادر دارند. ممکن است به نظر برسد که مدل های خطی با چنین داده هایی مطابقت دارند (البته نه خیلی خوب)، اما استفاده از یکی و حذف «فرات» به معنای از دست دادن آن رویدادهای شدید است که معمولاً دانستن در مورد آنها مهم است!$endgroup$
$ begingroup $ (-1) خلاصه داده ها با مقادیر شدید به معنای حذف داده هایی نیست که به راحتی توسط یک مدل ساده خلاصه نمی شوند. مدل خود را بهبود بخشید ، داده های (معتبر) را بیرون نکنید.$ endgroup $
با سؤال شما به معنای واقعی کلمه ، من استدلال می كنم كه هیچ آزمایش آماری وجود ندارد یا قوانین شست می تواند به عنوان پایه ای برای محرومیت از مسافت های دور در تجزیه و تحلیل رگرسیون خطی استفاده شود (بر خلاف تعیین اینکه آیا یک مشاهدات خاص یک چیز خاص است یا خیر). این باید از دانش منطقه ناشی شود.
من فکر می کنم بهترین راه برای شروع این است که بپرسید که آیا افراد خارج از کشور حتی معقول هستند ، به خصوص با توجه به متغیرهای دیگری که جمع آوری کرده اید. به عنوان مثال ، آیا واقعاً منطقی است که شما یک زن 600 پوندی در مطالعه خود داشته باشید که از کلینیک های مختلف آسیب ورزشی استخدام شده است؟یا ، عجیب نیست که شخص 55 سال یا تجربه حرفه ای را در هنگام تنها 60 سالگی در لیست قرار دهد؟و غیرهامیدوارم ، پس از آن شما یک مبنای معقول برای پرتاب آنها یا تهیه کامپایلرهای داده برای بررسی سوابق برای شما داشته باشید.
من همچنین روشهای رگرسیون قوی و گزارش شفاف از مشاهدات افتاده را پیشنهاد می کنم ، همانطور که به ترتیب توسط راب و کریس پیشنهاد شده است.
استراتژی های مؤثر فارکس...
ما را در سایت استراتژی های مؤثر فارکس دنبال می کنید
برچسب :
نویسنده : توران میرهادی
بازدید : <-PostHit->
تاريخ : شنبه
19 فروردين
1402 ساعت: 18:29