رگرسیون خطی ساده

ساخت وبلاگ

تجزیه و تحلیل رگرسیون از مدلهای ریاضی برای توصیف روابط استفاده می کند. به عنوان مثال ، فرض کنید که ارتفاع تنها تعیین کننده وزن بدن بود. اگر بخواهیم ارتفاع (متغیر مستقل یا "پیش بینی کننده") را به عنوان تابعی از وزن بدن (متغیر وابسته یا "نتیجه") ترسیم کنیم ، ممکن است یک رابطه بسیار خطی را مشاهده کنیم ، همانطور که در زیر نشان داده شده است.

Line graph of weight (vertical axis) as a function of height (horixontal axis.

ما همچنین می توانیم این رابطه را با معادله برای یک خط ، y = a + b (x) توصیف کنیم ، جایی که "a" رهگیری y و "b" شیب خط است. اگر می دانستیم قد یک فرد را می دانیم ، می توانیم از معادله برای پیش بینی وزن استفاده کنیم. در این مثال ، اگر یک فرد 70 اینچ قد داشته باشد ، ما پیش بینی می کنیم وزن او باشد:

وزن = 80 + 2 x (70) = 220 پوند.

در این رگرسیون خطی ساده ، ما تأثیر یک متغیر مستقل بر نتیجه را بررسی می کنیم. اگر ارتفاع تنها تعیین کننده وزن بدن بود ، انتظار داشتیم که نقاط مربوط به افراد جداگانه نزدیک به خط باشد. با این حال ، اگر عوامل دیگری (متغیرهای مستقل) وجود داشته باشد که علاوه بر قد ، وزن بدن را تحت تأثیر قرار می دهد (به عنوان مثال ، سن ، کالری مصرف و سطح ورزش) ، ممکن است انتظار داشته باشیم که امتیاز برای افراد جداگانه در اطراف خط پراکنده تر باشد ، زیرا مافقط ارتفاع را در نظر می گیرند.

Toggle open/close quiz question

تجزیه و تحلیل رگرسیون خطی چندگانه

تجزیه و تحلیل رگرسیون خطی چندگانه ، گسترش تجزیه و تحلیل رگرسیون خطی ساده است که ما را قادر می سازد تا ارتباط بین دو یا چند متغیر مستقل و یک متغیر وابسته مداوم را ارزیابی کنیم.

این یک روش بسیار مفید برای شناسایی و تنظیم برای مخدوش است. برای ارائه درک بصری از چگونگی انجام این کار چند خطی ، مثال فرضی زیر را در نظر بگیرید.

فرض کنید یک بازپرس یک سیستم امتیاز دهی ایجاد کرده است که به او امکان می دهد شاخص توده بدنی یک فرد (BMI) را بر اساس اطلاعاتی در مورد آنچه می خورند و چقدر پیش بینی کرده است ، پیش بینی کند. محقق می خواست این "نمره رژیم غذایی" جدید را آزمایش کند تا تعیین کند که چقدر نزدیک با اندازه گیری های واقعی BMI همراه است. به منظور محاسبه "نمره رژیم غذایی" ، اطلاعات از یک نمونه کوچک از افراد جمع آوری می شود و وزن و قد هر موضوع به منظور محاسبه BMI آنها اندازه گیری می شود. نمودار زیر رابطه بین "نمره رژیم غذایی" جدید و BMI را نشان می دهد ، و این نشان می دهد که "نمره رژیم غذایی" پیش بینی کننده خیلی خوبی نیست ، (به عنوان مثال ، اگر ارتباط بین این دو وجود داشته باشد.

A scatter plot of body mass index (vertical axis) in subjects with varying diet scores (horizontal axis)

در حالی که این دلسرد کننده است ، بازپرس در نظر می گیرد که ممکن است که گیج کننده از نظر سن و/یا جنسیت ، رابطه واقعی بین "نمره رژیم غذایی" و BMI را انجام دهد. او ابتدا مشخص می کند که افراد قدیمی تر از 20 سال سن دارند و معلوم می شود که افراد جوان و افراد مسن تر در طرح پراکندگی خوشه بندی می شوند ، همانطور که در شکل زیر نشان داده شده است.

Same as the previous graph but now ellipses identify the adult subjects (above) and younger subjects. A linear relationship between BMI and diet score seems to be emerging.

محقق گمان کرد که جنسیت نیز ممکن است یک عامل مخدوش باشد و وقتی او مردان و زنان را شناسایی کرد ، این نمودار به این شکل بود:

Same as previous graph but now within each ellipse lines identify males and females within both the older and younger groups.

این یافته ها نشان می دهد که هم سن و هم جنس بر BMI تأثیر می گذارد ، زیرا گروه قدیمی تر از گروه جوان BMI بالاتری دارند ، در حالی که نرها به طور مداوم BMI های بالاتری نسبت به زنان دارند. علاوه بر این ، سن و جنس نیز با "نمره رژیم غذایی" همراه است ، که "قرار گرفتن در معرض" مورد علاقه است ، زیرا نمرات رژیم غذایی به همان اندازه توسط جنسیت یا سن توزیع نمی شود. به عبارت دیگر ، هم سن و هم جنس معیارهایی را برای مخدوش بودن رعایت می کنند. همچنین می توانیم (در این مثال بسیار فرضی) ببینیم که بین "نمره رژیم غذایی" و BMI در هر یک از گروه های چهار سن و جنسیت رابطه خطی قابل توجه وجود دارد. به عبارت دیگر ، تنها پس از "در نظر گرفتن" این دو متغیر مخدوش است که می توانیم ببینیم که واقعاً بین نمره رژیم غذایی و BMI رابطه وجود دارد. رابطه واقعی توسط این عوامل دیگر اشتباه گرفته شد.

هنگام تجزیه و تحلیل داده ها ، همیشه برخورد با داده های عددی به جای متن ساده تر است. به عنوان مثال ، هنگام برخورد با داده های دوگانگی ، شماره "1" ممکن است به راحتی نشان دهد که این ویژگی به جای "بله" یا "درست" وجود دارد و شماره "0" به راحتی نشانگر "نه" یا "نادرست" است. همچنین بهتر است مجموعه های داده را به گونه ای سازماندهی کنید که اطلاعات مربوط به موضوعات جداگانه در یک ردیف ذکر شود و ستون ها حاوی متغیرها هستند. در نتیجه ، در این سناریو مجموعه داده های من شاید چیزی شبیه به این باشد:

استراتژی های مؤثر فارکس...
ما را در سایت استراتژی های مؤثر فارکس دنبال می کنید

برچسب : نویسنده : توران میرهادی بازدید : <-PostHit-> تاريخ : شنبه 19 فروردين 1402 ساعت: 13:23