رگرسیون خطی - نمای تفصیلی

ساخت وبلاگ

رگرسیون خطی برای یافتن رابطه خطی بین هدف و یک یا چند پیش بینی کننده استفاده می شود. دو نوع رگرسیون خطی وجود دارد - ساده و چندگانه.

رگرسیون خطی ساده

رگرسیون خطی ساده برای یافتن رابطه بین دو متغیر پیوسته مفید است. یکی متغیر پیش بینی کننده یا مستقل و دیگری پاسخ یا متغیر وابسته است. به دنبال رابطه آماری است اما نه رابطه قطعی. رابطه بین دو متغیر در صورتی قطعی گفته می شود که یک متغیر بتواند به طور دقیق توسط دیگری بیان شود. برای مثال، با استفاده از درجه سانتیگراد می توان فارنهایت را به طور دقیق پیش بینی کرد. رابطه آماری در تعیین رابطه بین دو متغیر دقیق نیست. مثلاً رابطه بین قد و وزن.

ایده اصلی به دست آوردن خطی است که به بهترین وجه با داده ها مطابقت داشته باشد. بهترین خط مناسب خطی است که کل خطای پیش بینی (تمام نقاط داده) تا حد امکان کوچک باشد. خطا فاصله بین نقطه تا خط رگرسیون است.

مثال بلادرنگ

ما یک مجموعه داده داریم که حاوی اطلاعاتی در مورد رابطه بین "تعداد ساعات مطالعه" و "نمرات به دست آمده" است. بسیاری از دانش آموزان مشاهده شده اند و ساعات مطالعه و نمره آنها ثبت شده است. این داده های آموزشی ما خواهد بود. هدف طراحی مدلی است که در صورت توجه به تعداد ساعات مطالعه، بتواند نمرات را پیش بینی کند. با استفاده از داده های آموزشی، یک خط رگرسیون به دست می آید که حداقل خطا را ارائه می دهد. سپس این معادله خطی برای هر داده جدید استفاده می شود. یعنی اگر تعداد ساعات مطالعه دانش آموز را به عنوان ورودی در نظر بگیریم، مدل ما باید نمره آنها را با حداقل خطا پیش بینی کند.

مقادیر b0 و b1 باید طوری انتخاب شوند که خطا را به حداقل برسانند. اگر مجموع مجذور خطا به عنوان یک متریک برای ارزیابی مدل در نظر گرفته شود، آنگاه خطی به دست آورید که به بهترین نحو خطا را کاهش دهد.

اگر خطا را مربع نکنیم، نقطه مثبت و منفی یکدیگر را خنثی می کنند.

برای مدل با یک پیش بینی،

کاوش «b1»

کاوش «b0»

  • اگر مدل x=0 را شامل نشود، پیش بینی فقط با b0 بی معنی خواهد شد. به عنوان مثال، ما یک مجموعه داده داریم که ارتفاع (x) و وزن (y) را مرتبط می کند. با در نظر گرفتن x=0 (یعنی قد برابر با 0)، معادله فقط مقدار b0 خواهد داشت که کاملاً بی معنی است زیرا در زمان واقعی قد و وزن هرگز نمی تواند صفر شود. این به دلیل در نظر گرفتن مقادیر مدل خارج از محدوده آن بود.
  • اگر مدل شامل مقدار 0 باشد، «b0» میانگین تمام مقادیر پیش بینی شده زمانی خواهد بود که x=0 باشد. اما، تنظیم صفر برای همه متغیرهای پیش بینی اغلب غیرممکن است.
  • مقدار b0 تضمین می کند که باقیمانده ها میانگین صفر دارند. اگر عبارت b0 وجود نداشته باشد، رگرسیون مجبور می شود از مبدأ عبور کند. هم ضریب رگرسیون و هم پیش بینی مغرضانه خواهند بود.

ضریب از معادلات نرمال

به غیر از معادله فوق، ضریب مدل از معادله نرمال نیز قابل محاسبه است.

تتا شامل ضریب همه پیش بینی کننده ها از جمله عبارت ثابت «b0» است. معادله عادی محاسبات را با گرفتن معکوس ماتریس ورودی انجام می دهد. با افزایش تعداد ویژگی ها، پیچیدگی محاسبات افزایش می یابد. وقتی تعداد ویژگی ها زیاد می شوند، سرعت آن بسیار کند می شود.

در زیر پیاده سازی پایتون معادله است.

بهینه سازی با استفاده از نزول گرادیان

پیچیدگی معادله نرمال استفاده از آن را دشوار می کند، اینجاست که روش نزول گرادیان به تصویر کشیده می شود. مشتق جزئی تابع هزینه با توجه به پارامتر می تواند مقدار همکار بهینه را ارائه دهد.

کد پایتون برای نزول گرادیان

تجزیه و تحلیل باقیمانده

تصادفی بودن و غیرقابل پیش بینی بودن دو مؤلفه اصلی مدل رگرسیونی هستند.

پیش بینی = قطعی + آمار

قسمت قطعی توسط متغیر پیش بینی در مدل پوشش داده می شود. بخش تصادفی این واقعیت را آشکار می کند که مقدار مورد انتظار و مشاهده شده غیرقابل پیش بینی است. همیشه اطلاعاتی وجود خواهد داشت که پوشش آنها از قلم افتاده است. این اطلاعات را می توان از اطلاعات باقی مانده به دست آورد.

بیایید مفهوم باقیمانده را از طریق یک مثال توضیح دهیم. در نظر بگیرید، ما یک مجموعه داده داریم که فروش آبمیوه را زمانی که دمای یک مکان داده می شود، پیش بینی می کند. مقدار پیش بینی شده از معادله رگرسیون همیشه با مقدار واقعی تفاوت دارد. فروش دقیقاً با مقدار خروجی واقعی مطابقت نخواهد داشت. این تفاوت به عنوان باقیمانده نامیده می شود.

نمودار باقیمانده به تحلیل مدل با استفاده از مقادیر باقیمانده کمک می کند. بین مقادیر پیش بینی شده و باقیمانده رسم می شود. ارزش های آنها استاندارد شده است. فاصله نقطه از 0 مشخص می کند که پیش بینی آن مقدار چقدر بد بوده است. اگر مقدار مثبت باشد، پیش بینی پایین است. اگر مقدار منفی باشد، پیش بینی بالا است. مقدار 0 نشان دهنده پیش بینی بخشدار است. تشخیص الگوی باقیمانده می تواند مدل را بهبود بخشد.

الگوی غیر تصادفی نمودار باقیمانده نشان می دهد که مدل،

  • از دست دادن متغیری که سهم قابل توجهی در هدف مدل دارد
  • از دست دادن غیر خطی (با استفاده از اصطلاح چند جمله ای) از دست رفته است
  • هیچ تعامل بین اصطلاحات در مدل وجود ندارد

خصوصیات یک باقیمانده

  • باقیمانده هیچ الگویی را نشان نمی دهد
  • باقیمانده های مجاور نباید همانند آنها نشان دهند که برخی از اطلاعات توسط سیستم از دست رفته است.

اجرای و طرح باقیمانده

معیارهای ارزیابی مدل

ارزش مربع R

این مقدار از 0 تا 1 متغیر است. مقدار ‘1" نشان می دهد که پیش بینی کننده تمام تغییرات در y را نشان می دهد. 0 "نشان می دهد که پیش بینی کننده" X "هیچ تغییری در" Y "ندارد.

1. رگرسیون مربع (SSR)

این اطلاعات در مورد چگونگی خط رگرسیون تخمین زده شده از خط افقی "بدون رابطه" (میانگین خروجی واقعی) است.

2. مجموع خطای مربع (SSE)

چقدر مقدار هدف در اطراف خط رگرسیون متفاوت است (مقدار پیش بینی شده).

3. کل مربع ها (SSTO)

این نشان می دهد که نقطه داده چقدر به میانگین حرکت می کند.

آیا دامنه R-Square همیشه بین 0 تا 1 است؟

اگر خط رگرسیون ساخته شود تا از یک نقطه به زور عبور کند ، ممکن است ارزش R2 منفی باشد. این امر باعث می شود که خط رگرسیون به زور از منشأ عبور کند (بدون رهگیری) خطایی بالاتر از خطای ایجاد شده توسط خط افقی. این اتفاق می افتد اگر داده ها از مبدأ دور باشند.

همبستگی همبستگی (R)

این مربوط به ارزش "R-Squared" است که می تواند از خود نماد مشاهده شود. ا ز-1 تا 1 متغیر است.

اگر مقدار B1 منفی باشد ، "R" منفی است در حالی که اگر مقدار "B1" مثبت باشد ، "R" مثبت است. بدون واحد است.

صالح و ارزش P

فرضیه تهی ادعای اولیه است که محقق با استفاده از تحقیقات یا دانش قبلی مشخص می کند.

مقدار p پایین: فرضیه تهی را رد می کند که نشان می دهد مقدار پیش بینی کننده به پاسخ مربوط می شود

مقدار بالا P: تغییرات در پیش بینی کننده با تغییر در هدف همراه نیست

خط رگرسیون به دست آمده

کد کامل: https://github.com/ssaishruthi/linear_regression_detailed_implementation

این یک پست آموزشی است که با تسکین مطالب (مانند Prof. Andrew NG Course ، فیلم های Siraj Raval و غیره) ساخته شده است که در سفر من به من کمک کرده است. منابع دیگر در نزدیکی محتوا بیان شده است.

استراتژی های مؤثر فارکس...
ما را در سایت استراتژی های مؤثر فارکس دنبال می کنید

برچسب : نویسنده : توران میرهادی بازدید : <-PostHit-> تاريخ : شنبه 26 فروردين 1402 ساعت: 14:36