تجزیه و تحلیل رگرسیون از مدلهای ریاضی برای توصیف روابط استفاده می کند. به عنوان مثال ، فرض کنید که ارتفاع تنها تعیین کننده وزن بدن بود. اگر بخواهیم ارتفاع (متغیر مستقل یا "پیش بینی کننده") را به عنوان تابعی از وزن بدن (متغیر وابسته یا "نتیجه") ترسیم کنیم ، ممکن است یک رابطه بسیار خطی را مشاهده کنیم ، همانطور که در زیر نشان داده شده است.
ما همچنین می توانیم این رابطه را با معادله برای یک خط ، y = a + b (x) توصیف کنیم ، جایی که "a" رهگیری y و "b" شیب خط است. اگر می دانستیم قد یک فرد را می دانیم ، می توانیم از معادله برای پیش بینی وزن استفاده کنیم. در این مثال ، اگر یک فرد 70 اینچ قد داشته باشد ، ما پیش بینی می کنیم وزن او باشد:
وزن = 80 + 2 x (70) = 220 پوند.
در این رگرسیون خطی ساده ، ما تأثیر یک متغیر مستقل بر نتیجه را بررسی می کنیم. اگر ارتفاع تنها تعیین کننده وزن بدن بود ، انتظار داشتیم که نقاط مربوط به افراد جداگانه نزدیک به خط باشد. با این حال ، اگر عوامل دیگری (متغیرهای مستقل) وجود داشته باشد که علاوه بر قد ، وزن بدن را تحت تأثیر قرار می دهد (به عنوان مثال ، سن ، کالری مصرف و سطح ورزش) ، ممکن است انتظار داشته باشیم که امتیاز برای افراد جداگانه در اطراف خط پراکنده تر باشد ، زیرا مافقط ارتفاع را در نظر می گیرند.
تجزیه و تحلیل رگرسیون خطی چندگانه
تجزیه و تحلیل رگرسیون خطی چندگانه ، گسترش تجزیه و تحلیل رگرسیون خطی ساده است که ما را قادر می سازد تا ارتباط بین دو یا چند متغیر مستقل و یک متغیر وابسته مداوم را ارزیابی کنیم.
این یک روش بسیار مفید برای شناسایی و تنظیم برای مخدوش است. برای ارائه درک بصری از چگونگی انجام این کار چند خطی ، مثال فرضی زیر را در نظر بگیرید.
فرض کنید یک بازپرس یک سیستم امتیاز دهی ایجاد کرده است که به او امکان می دهد شاخص توده بدنی یک فرد (BMI) را بر اساس اطلاعاتی در مورد آنچه می خورند و چقدر پیش بینی کرده است ، پیش بینی کند. محقق می خواست این "نمره رژیم غذایی" جدید را آزمایش کند تا تعیین کند که چقدر نزدیک با اندازه گیری های واقعی BMI همراه است. به منظور محاسبه "نمره رژیم غذایی" ، اطلاعات از یک نمونه کوچک از افراد جمع آوری می شود و وزن و قد هر موضوع به منظور محاسبه BMI آنها اندازه گیری می شود. نمودار زیر رابطه بین "نمره رژیم غذایی" جدید و BMI را نشان می دهد ، و این نشان می دهد که "نمره رژیم غذایی" پیش بینی کننده خیلی خوبی نیست ، (به عنوان مثال ، اگر ارتباط بین این دو وجود داشته باشد.
در حالی که این دلسرد کننده است ، بازپرس در نظر می گیرد که ممکن است که گیج کننده از نظر سن و/یا جنسیت ، رابطه واقعی بین "نمره رژیم غذایی" و BMI را انجام دهد. او ابتدا مشخص می کند که افراد قدیمی تر از 20 سال سن دارند و معلوم می شود که افراد جوان و افراد مسن تر در طرح پراکندگی خوشه بندی می شوند ، همانطور که در شکل زیر نشان داده شده است.
محقق گمان کرد که جنسیت نیز ممکن است یک عامل مخدوش باشد و وقتی او مردان و زنان را شناسایی کرد ، این نمودار به این شکل بود:
این یافته ها نشان می دهد که هم سن و هم جنس بر BMI تأثیر می گذارد ، زیرا گروه قدیمی تر از گروه جوان BMI بالاتری دارند ، در حالی که نرها به طور مداوم BMI های بالاتری نسبت به زنان دارند. علاوه بر این ، سن و جنس نیز با "نمره رژیم غذایی" همراه است ، که "قرار گرفتن در معرض" مورد علاقه است ، زیرا نمرات رژیم غذایی به همان اندازه توسط جنسیت یا سن توزیع نمی شود. به عبارت دیگر ، هم سن و هم جنس معیارهایی را برای مخدوش بودن رعایت می کنند. همچنین می توانیم (در این مثال بسیار فرضی) ببینیم که بین "نمره رژیم غذایی" و BMI در هر یک از گروه های چهار سن و جنسیت رابطه خطی قابل توجه وجود دارد. به عبارت دیگر ، تنها پس از "در نظر گرفتن" این دو متغیر مخدوش است که می توانیم ببینیم که واقعاً بین نمره رژیم غذایی و BMI رابطه وجود دارد. رابطه واقعی توسط این عوامل دیگر اشتباه گرفته شد.
هنگام تجزیه و تحلیل داده ها ، همیشه برخورد با داده های عددی به جای متن ساده تر است. به عنوان مثال ، هنگام برخورد با داده های دوگانگی ، شماره "1" ممکن است به راحتی نشان دهد که این ویژگی به جای "بله" یا "درست" وجود دارد و شماره "0" به راحتی نشانگر "نه" یا "نادرست" است. همچنین بهتر است مجموعه های داده را به گونه ای سازماندهی کنید که اطلاعات مربوط به موضوعات جداگانه در یک ردیف ذکر شود و ستون ها حاوی متغیرها هستند. در نتیجه ، در این سناریو مجموعه داده های من شاید چیزی شبیه به این باشد:
استراتژی های مؤثر فارکس...
ما را در سایت استراتژی های مؤثر فارکس دنبال می کنید