1. 1مدل های خطی ¶

ساخت وبلاگ

موارد زیر مجموعه ای از روشهای در نظر گرفته شده برای رگرسیون است که در آن انتظار می رود مقدار هدف ترکیبی خطی از ویژگی ها باشد. در نماد ریاضی ، اگر ( hat ) مقدار پیش بینی شده است.

در سراسر ماژول ، ما بردار (w = (w_1 ،. w_p) ) را به عنوان coef_ و (w_0 ) به عنوان رهگیری تعیین می کنیم.

برای انجام طبقه بندی با مدلهای خطی عمومی ، به رگرسیون لجستیک مراجعه کنید.

1. 1. 1. حداقل مربعات معمولی¶

LinearRegression متناسب با یک مدل خطی با ضرایب (W = (W_1 ، W_P) ) برای به حداقل رساندن مقدار باقیمانده مربع بین اهداف مشاهده شده در مجموعه داده ها ، و اهداف پیش بینی شده توسط تقریب خطی. از نظر ریاضی مشکل فرم را حل می کند:

../_images/sphx_glr_plot_ols_001.png

LinearRegression در روش مناسب خود آرایه های X ، Y را به خود اختصاص می دهد و ضرایب (W ) مدل خطی را در عضو Coef_ خود ذخیره می کند:

برآورد ضریب برای حداقل مربعات معمولی به استقلال ویژگی ها متکی است. هنگامی که ویژگی ها همبستگی دارند و ستون های ماتریس طراحی (x ) وابستگی تقریباً خطی دارند ، ماتریس طراحی نزدیک به مفرد می شود و در نتیجه ، تخمین حداقل مربعات نسبت به خطاهای تصادفی در هدف مشاهده شده بسیار حساس می شود. تولید یک واریانس بزرگ. این وضعیت چند قطبی بودن می تواند ایجاد شود ، به عنوان مثال ، هنگامی که داده ها بدون طراحی آزمایشی جمع آوری می شوند.

1. 1. 1. 1. حداقل مربعات غیر منفی

می توان همه ضرایب را غیر منفی محدود کرد ، که ممکن است در هنگام نشان دادن مقادیر فیزیکی یا طبیعی غیر منفی (مثلاً شمارش فرکانس یا قیمت کالاها) مفید باشد. LinearRegression یک پارامتر مثبت بولی را می پذیرد: هنگامی که روی مربع های غیر منفی واقعی تنظیم می شود ، استفاده می شود.

1. 1. 1. 2. پیچیدگی معمولی حداقل مربعات ow

The least squares solution is computed using the singular value decomposition of X. If X is a matrix of shape (n_samples, n_features) this method has a cost of (O(n_> n_>^2)) , assuming that (n_> geq n_>) .

1. 1. 2. رگرسیون و طبقه بندی ریج ¶ ¶

1. 1. 2. 1. پسرفت¶

رگرسیون ریج با اعمال مجازات بر اندازه ضرایب ، برخی از مشکلات حداقل مربعات معمولی را برطرف می کند. ضرایب خط الراس مبلغ باقیمانده مجازات مربعات را به حداقل می رساند:

پارامتر پیچیدگی ( alpha geq 0 ) میزان انقباض را کنترل می کند: هرچه مقدار ( alpha ) بزرگتر باشد ، میزان انقباض بیشتر می شود و در نتیجه ضرایب برای جمع آوری قوی تر می شود.

../_images/sphx_glr_plot_ridge_path_001.png

مانند سایر مدلهای خطی ، ریج روش های متناسب خود را آرایه های X ، Y می گیرد و ضرایب (W ) مدل خطی را در عضو Coef_ خود ذخیره می کند:

توجه داشته باشید که Class Ridge به کاربر اجازه می دهد تا با تنظیم Solver = "Auto" به طور خودکار انتخاب شود. هنگامی که این گزینه مشخص شد ، ریج بین حل کننده های "LBFGS" ، "Cholesky" و "plats_cg" انتخاب می کند. ریج شروع به بررسی شرایط نشان داده شده در جدول زیر از بالا به پایین خواهد کرد. اگر شرط صحیح باشد ، حل کننده مربوطه انتخاب می شود.

حل کننده

وضعیت

گزینه مثبت = واقعی مشخص شده است.

آرایه ورودی X پراکنده نیست.

هیچ یک از شرایط فوق برآورده نمی شود.

1. 1. 2. 2. طبقه بندی¶

Ridge Regrengor دارای یک نوع طبقه بندی کننده است: Ridgeclassifier. این طبقه بندی کننده ابتدا اهداف باینری را به آن تبدیل می کند و سپس مشکل را به عنوان یک کار رگرسیون رفتار می کند و همان هدف را در بالا بهینه می کند. کلاس پیش بینی شده با نشانه پیش بینی رگرسیون مطابقت دارد. برای طبقه بندی چند طبقه ، مشکل به عنوان رگرسیون چند حالته رفتار می شود ، و کلاس پیش بینی شده با بالاترین مقدار با خروجی مطابقت دارد.

به نظر می رسد استفاده از یک از دست دادن حداقل مربعات حداقل (مجازات) برای متناسب با یک مدل طبقه بندی به جای تلفات سنتی تر لجستیک یا لولا ، جای سوال دارد. با این حال ، در عمل ، تمام این مدلها می توانند از نظر دقت یا دقت/فراخوان به نمرات اعتبارسنجی مشابه منجر شوند ، در حالی که حداقل از دست دادن مربعات مجازات شده توسط Ridgeclassifier امکان انتخاب بسیار متفاوتی از حلال های عددی را با پروفایل عملکرد محاسباتی مجزا فراهم می کند. واد

RIDGECLASSIFIER می تواند به طور قابل توجهی سریعتر از مثلاً باشد. LogisticRegression با تعداد زیادی از کلاس ها زیرا می تواند ماتریس طرح ریزی را محاسبه کند ((x^t x)^x^t ) فقط یک بار.

این طبقه بندی کننده گاهی اوقات به عنوان حداقل ماشین های وکتور پشتیبانی مربعات با هسته خطی گفته می شود.

1. 1. 2. 3. پیچیدگی ریج ¶

این روش دارای همان ترتیب پیچیدگی با حداقل مربعات معمولی است.

1. 1. 2. 4. تنظیم پارامتر تنظیم: اعتبار سنجی متقابل را ترک کنید

RIDGECV رگرسیون ریج را با اعتبار سنجی متقابل پارامتر آلفا پیاده سازی می کند. این شی به همان روشی که GridSearchCV کار می کند ، به جز این که به طور پیش فرض برای ترک یک اعتبار سنجی متقاطع به طور پیش فرض است:

تعیین مقدار ویژگی CV باعث استفاده از اعتبارسنجی متقابل با GridSearchCV ، به عنوان مثال CV = 10 برای اعتبارسنجی متقابل 10 برابر ، به جای اعتبارسنجی متقابل یک خارج می شود.

"یادداشت های حداقل مربعات منظم" ، ریفکین و لیپرت (گزارش فنی ، اسلایدهای دوره).

1. 1. 3. کمند¶

Lasso یک مدل خطی است که ضرایب پراکنده را تخمین می زند. در بعضی از زمینه ها به دلیل تمایل به ترجیح راه حل هایی با ضرایب غیر صفر کمتر ، مفید است و به طور موثری تعداد ویژگی هایی را که به محلول داده شده وابسته است ، کاهش می دهد. به همین دلیل ، لاسو و انواع آن برای زمینه سنجش فشرده اساسی هستند. در شرایط خاص ، می تواند مجموعه دقیقی از ضرایب غیر صفر را بازیابی کند (به سنجش فشاری مراجعه کنید: بازسازی توموگرافی با L1 قبلی (Lasso)).

از نظر ریاضی ، از یک مدل خطی با یک اصطلاح منظم اضافه شده تشکیل شده است. عملکرد هدف برای به حداقل رساندن:

برآورد لاسو بنابراین به حداقل رساندن مجازات حداقل مربعات با ( alpha || w || _1 ) اضافه می شود ، جایی که ( alpha ) ثابت است و (|| w || _1 ) است ( ell_1 ) -کرم بردار ضریب.

اجرای در کلاس Lasso از نزول مختصات به عنوان الگوریتم متناسب با ضرایب استفاده می کند. برای اجرای دیگری حداقل رگرسیون زاویه را ببینید:

تابع lasso_path برای کارهای سطح پایین مفید است ، زیرا ضرایب را در طول مسیر کامل مقادیر ممکن محاسبه می کند.

انتخاب ویژگی با Lasso

از آنجا که رگرسیون لاسو مدلهای پراکنده را به دست می آورد ، بنابراین می توان از آن برای انجام انتخاب ویژگی استفاده کرد ، همانطور که در انتخاب ویژگی های مبتنی بر L1 به تفصیل ارائه شده است.

دو مرجع زیر تکرار مورد استفاده در حل کننده نزول مختصات Scikit-Lea و همچنین محاسبه شکاف دوگانگی مورد استفاده برای کنترل همگرایی را توضیح می دهد.

"مسیر منظم برای مدلهای خطی تعمیم یافته با هماهنگی نزول" ، فریدمن ، هاستی و تیبشیرانی ، J STAT SOFTW ، 2010 (مقاله).

"یک روش داخلی برای مربع های حداقل L1 در مقیاس بزرگ ،" S. J. Kim ، K. Koh ، M. Lustig ، S. Boyd و D. Gorinevsky ، در مجله IEEE موضوعات منتخب در پردازش سیگنال ، 2007 (مقاله)

1. 1. 3. 1. تنظیم پارامتر تنظیم تنظیم

پارامتر آلفا میزان کمبود ضرایب تخمین زده شده را کنترل می کند.

1. 1. 3. 1. 1. با استفاده از اعتبار سنجی متقابل

Scikit-Lea اشیاء را که پارامتر Lasso Alpha را با اعتبارسنجی متقابل تنظیم می کنند ، در معرض دید قرار می دهد: Lassocv و Lassolarscv. Lassolarscv بر اساس الگوریتم رگرسیون کمترین زاویه ای است که در زیر توضیح داده شده است.

برای مجموعه داده های با ابعاد بالا با بسیاری از ویژگی های خطی ، LassoCV اغلب ترجیح داده می شود. با این حال ، LassolarsCV این مزیت را دارد که مقادیر مرتبط تر پارامتر آلفا را کاوش کند ، و اگر تعداد نمونه ها در مقایسه با تعداد ویژگی ها بسیار اندک باشد ، اغلب سریعتر از LassoCV است.

lasso_cv_1 lasso_cv_2

1. 1. 3. 1. 2. انتخاب مدل مبتنی بر معیارها

از طرف دیگر ، برآوردگر Lassolarsic پیشنهاد می کند از معیار اطلاعات Akaike (AIC) و معیار اطلاعات Bayes (BIC) استفاده کند. این یک جایگزین از نظر محاسباتی ارزان تر برای یافتن مقدار بهینه آلفا است زیرا مسیر تنظیم فقط یک بار به جای K+1 بار هنگام استفاده از اعتبار سنجی متقاطع K محاسبه می شود.

در واقع ، این معیارها در مجموعه آموزش های نمونه محاسبه می شوند. به طور خلاصه ، آنها با انعطاف پذیری آنها ، نمرات بیش از حد مدل های مختلف Lasso را مجازات می کنند (به بخش "جزئیات ریاضی" در زیر).

با این حال ، چنین معیارهایی نیاز به تخمین مناسب از درجه آزادی محلول دارند ، برای نمونه های بزرگ (نتایج بدون علامت) به دست می آیند و فرض می کنند که مدل صحیح نامزدهای تحت بررسی است. آنها همچنین تمایل به شکستن دارند که مشکل به شدت مشروط شود (به عنوان مثال ویژگی های بیشتر از نمونه ها).

../_images/sphx_glr_plot_lasso_lars_ic_001.png

جزئیات ریاضی

تعریف AIC (و در نتیجه BIC) ممکن است در ادبیات متفاوت باشد. در این بخش ، ما اطلاعات بیشتری در مورد معیار محاسبه شده در Scikit-Lea ارائه می دهیم. معیار AIC به این صورت تعریف شده است:

جایی که ( hat ) حداکثر احتمال مدل است و (d ) تعداد پارامترها است (همچنین در بخش قبلی به عنوان درجه آزادی گفته می شود).

تعریف BIC جایگزین (2 ) توسط ( log (n) ) است:

جایی که (n ) تعداد نمونه ها است.

برای یک مدل خطی گاوسی ، حداکثر احتمال ورود به سیستم به این صورت تعریف شده است:

جایی که ( sigma^2 ) برآوردی از واریانس نویز است ، (y_i ) و ( hat_i ) به ترتیب اهداف واقعی و پیش بینی شده هستند و (n ) تعداد نمونه ها است.

وصل کردن حداکثر احتمال ورود به سیستم در فرمول AIC:

اولین اصطلاح عبارت فوق گاهی اوقات دور ریخته می شود زیرا در صورت ارائه ( sigma^2 ) ثابت است. علاوه بر این ، گاهی اوقات بیان می شود که AIC معادل آماری (C_P ) است [12]. با این حال ، به معنای دقیق ، فقط با برخی از عوامل ثابت و چند برابر معادل است.

در آخر ، ما در بالا ذکر کردیم که ( sigma^2 ) تخمینی از واریانس نویز است. در لاسولارسیک هنگامی که پارامتر نویز_ واریانس ارائه نشده است (پیش فرض) ، واریانس نویز از طریق برآوردگر بی طرفانه تخمین زده می شود [13] تعریف شده به عنوان:

where (p) is the number of features and (hat_i) is the predicted target using an ordinary least squares regression. Note, that this formula is valid only when n_samples>n_features.

1. 1. 3. 1. 3. مقایسه با پارامتر تنظیم SVM¶

هم ارزی بین آلفا و پارامتر منظم سازی SVM، C با آلفا = 1 / C یا آلفا = 1 / (n_samps * C)، بسته به برآوردگر و تابع هدف دقیق بهینه شده توسط مدل، داده می شود.

1. 1. 4. کمند چند کاره¶

MultiTaskLasso یک مدل خطی است که ضرایب پراکنده را برای مسائل رگرسیون چندگانه به طور مشترک تخمین می زند: y یک آرایه دو بعدی با شکل (n_samples، n_tasks) است. محدودیت این است که ویژگی های انتخاب شده برای همه مشکلات رگرسیون، که وظایف نیز نامیده می شوند، یکسان هستند.

شکل زیر محل ورودی های غیر صفر را در ماتریس ضریب W بدست آمده با یک کمند ساده یا یک MultiTaskLasso مقایسه می کند. تخمین های Lasso غیرصفرهای پراکنده را به دست می دهد در حالی که غیرصفرهای MultiTaskLasso ستون های کامل هستند.

multi_task_lasso_1 multi_task_lasso_2

برازش یک مدل سری زمانی، تحمیل اینکه هر ویژگی فعال همیشه فعال باشد.

از نظر ریاضی، از یک مدل خطی تشکیل شده است که با یک هنجار ترکیبی (ell_1) (ell_2) برای منظم سازی آموزش داده شده است. تابع هدف برای کمینه سازی:

جایی که ( ext) هنجار Frobenius را نشان می دهد

و (ell_1) (ell_2) می خواند

پیاده سازی در کلاس MultiTaskLasso از نزول مختصات به عنوان الگوریتم برای برازش ضرایب استفاده می کند.

1. 1. 5. شبکه الاستیک¶

ElasticNet یک مدل رگرسیون خطی است که با تنظیم ضرایب هنجار (ell_1) و (ell_2) آموزش داده شده است. این ترکیب امکان یادگیری یک مدل پراکنده را فراهم می کند که در آن تعداد کمی از وزنه ها مانند کمند غیر صفر هستند، در حالی که همچنان خواص منظم سازی Ridge را حفظ می کند. ما ترکیب محدب (ell_1) و (ell_2) را با استفاده از پارامتر l1_ratio کنترل می کنیم.

Elastic-net زمانی مفید است که چندین ویژگی وجود داشته باشد که با یکدیگر مرتبط باشند. Lasso احتمالاً یکی از این موارد را به صورت تصادفی انتخاب می کند، در حالی که elastic-net احتمالاً هر دو را انتخاب می کند.

یک مزیت عملی معامله بین Lasso و Ridge این است که به Elastic-Net اجازه می دهد تا بخشی از ثبات Ridge را تحت چرخش به ارث ببرد.

تابع هدف به حداقل رساندن در این مورد است

../_images/sphx_glr_plot_lasso_coordinate_descent_path_001.png

کلاس ElasticNetCV می تواند برای تنظیم پارامترهای alpha ( (alpha) ) و l1_ratio ( (

دو مرجع زیر تکرار مورد استفاده در حل کننده نزول مختصات Scikit-Lea و همچنین محاسبه شکاف دوگانگی مورد استفاده برای کنترل همگرایی را توضیح می دهد.

"مسیر منظم برای مدلهای خطی تعمیم یافته با هماهنگی نزول" ، فریدمن ، هاستی و تیبشیرانی ، J STAT SOFTW ، 2010 (مقاله).

"یک روش داخلی برای مربع های حداقل L1 در مقیاس بزرگ ،" S. J. Kim ، K. Koh ، M. Lustig ، S. Boyd و D. Gorinevsky ، در مجله IEEE موضوعات منتخب در پردازش سیگنال ، 2007 (مقاله)

"یک روش نقطه داخلی برای حداقل مربعات منظم L1 در مقیاس بزرگ"، S. J. Kim، K. Koh، M. Lustig، S. Boyd و D. Gorinevsky، در IEEE Joual of Selected Topics in Signal Processing، 2007 (مقاله)

1. 1. 6. شبکه الاستیک چند کاره¶

MultiTaskElasticNet یک مدل شبکه الاستیک است که ضرایب پراکنده را برای مسائل رگرسیون چندگانه به طور مشترک تخمین می زند: Y یک آرایه دوبعدی از شکل (n_samples، n_tasks) است. محدودیت این است که ویژگی های انتخاب شده برای همه مشکلات رگرسیون، که وظایف نیز نامیده می شوند، یکسان هستند.

از نظر ریاضی، از یک مدل خطی تشکیل شده است که با هنجارهای ترکیبی (ell_1) (ell_2) -norm و (ell_2) -norm برای منظم سازی آموزش داده شده است. تابع هدف برای کمینه سازی:

پیاده سازی در کلاس MultiTaskElasticNet از نزول مختصات به عنوان الگوریتم برای برازش ضرایب استفاده می کند.

کلاس MultiTaskElasticNetCV می تواند برای تنظیم پارامترهای alpha ( (alpha) ) و l1_ratio ( (

ho)) با اعتبارسنجی متقابل استفاده شود.

1. 1. 7. رگرسیون کمترین زاویه¶

  • رگرسیون حداقل زاویه (LARS) یک الگوریتم رگرسیون برای داده های با ابعاد بالا است که توسط بردلی افرون، ترور هستی، ایین جانستون و رابرت تیبشیرانی توسعه یافته است. LARS مشابه رگرسیون گام به گام رو به جلو است. در هر مرحله، ویژگی بیشترین ارتباط را با هدف پیدا می کند. هنگامی که چندین ویژگی با همبستگی مساوی وجود دارد، به جای ادامه دادن در امتداد یک ویژگی، در جهت متساوی الاضلاع بین ویژگی ها پیش می رود.

  • مزایای LARS عبارتند از:

  • از نظر عددی در زمینه هایی که تعداد ویژگی ها به طور قابل توجهی بیشتر از تعداد نمونه ها است کارآمد است.

  • از نظر محاسباتی به اندازه انتخاب رو به جلو سریع است و دارای همان ترتیب پیچیدگی حداقل مربعات معمولی است.

  • این یک مسیر حل خطی کامل تکه ای تولید می کند که در اعتبارسنجی متقاطع یا تلاش های مشابه برای تنظیم مدل مفید است.

اگر دو ویژگی تقریباً به طور مساوی با هدف همبستگی داشته باشند، ضرایب آنها باید تقریباً با همان سرعت افزایش یابد. بنابراین الگوریتم همانطور که شهود انتظار دارد رفتار می کند و همچنین پایدارتر است.

  • به راحتی برای تولید راه حل برای برآوردگرهای دیگر، مانند کمند، اصلاح می شود.

معایب روش LARS عبارتند از:

از آنجایی که LARS مبتنی بر نصب مجدد مکرر باقیمانده ها است، به نظر می رسد به ویژه نسبت به اثرات نویز حساس باشد. این مشکل به طور مفصل توسط ویزبرگ در بخش بحث Efron و همکاران مورد بحث قرار گرفته است.(1383) مقاله سالنامه آمار.

مدل LARS را می توان از طریق برآوردگر LARS یا اجرای سطح پایین آن LARS_PATH یا LARS_PATH_GRAM استفاده کرد.

../_images/sphx_glr_plot_lasso_lars_001.png

1. 1. 8. لارس لاسو

Lassolars یک مدل Lasso است که با استفاده از الگوریتم LARS اجرا می شود و بر خلاف اجرای بر اساس نزول مختصات ، این راه حل دقیق را ارائه می دهد ، که به عنوان تابعی از هنجار ضرایب آن خطی است.

الگوریتم LARS مسیر کامل ضرایب را در امتداد پارامتر تنظیم تقریباً به صورت رایگان فراهم می کند ، بنابراین یک عمل مشترک برای بازیابی مسیر با یکی از توابع lars_path یا lars_path_gram است.

1. 1. 8. 1. فرمولاسیون ریاضی ¶

این الگوریتم شبیه به رگرسیون گام به گام رو به جلو است ، اما به جای اینکه در هر مرحله ویژگی هایی را درج کنید ، ضرایب تخمین زده شده در جهت همبستگی هر یک از همبستگی هر یک با باقیمانده افزایش می یابد.

به جای ارائه نتیجه بردار ، محلول LARS از منحنی تشکیل شده است که نشان دهنده راه حل برای هر مقدار از هنجار ( ell_1 ) بردار پارامتر است. مسیر ضرایب کامل در Array Coef_Path_ از شکل ذخیره می شود (n_features ، max_features + 1). ستون اول همیشه صفر است.

الگوریتم اصلی در مقاله رگرسیون حداقل زاویه توسط هاستی و همکاران به تفصیل شرح داده شده است.

1. 1. 9. تعقیب تطبیق متعامد (OMP)

OrthogonalmatchingPursuit و Orthogonal_MP الگوریتم OMP را برای تقریب تناسب یک مدل خطی با محدودیت های تحمیل شده بر تعداد ضرایب غیر صفر (یعنی ( ell_0) شبه نورم) پیاده سازی می کنند.

به عنوان یک روش انتخاب ویژگی به جلو مانند رگرسیون حداقل زاویه ، پیگیری تطبیق متعامد می تواند وکتور محلول بهینه را با تعداد مشخصی از عناصر غیر صفر تقریب دهد:

از طرف دیگر ، پیگیری تطبیق متعامد می تواند به جای تعداد مشخصی از ضرایب غیر صفر ، خطای خاصی را هدف قرار دهد. این می تواند به صورت زیر بیان شود:

OMP بر اساس یک الگوریتم حریص است که در هر مرحله اتم را بسیار با باقیمانده فعلی همبستگی می کند. این شبیه به روش ساده تر تطبیق (MP) است ، اما در این مورد بهتر است که در هر تکرار ، باقیمانده با استفاده از یک پیش بینی متعامد در فضای عناصر دیکشنری قبلاً انتخاب شده ، مجدداً مورد استفاده قرار می گیرد.

1. 1. 10. رگرسیون بیزی ¶

از تکنیک های رگرسیون بیزی می توان برای شامل پارامترهای منظم در روش تخمین استفاده کرد: پارامتر تنظیم به معنای سخت تنظیم نمی شود بلکه با داده های موجود تنظیم می شود.

این کار را می توان با معرفی مقدمات ناآگاهانه بر روی پارامترهای بیش از حد مدل انجام داد. منظم سازی ( ell_ ) که در رگرسیون و طبقه بندی ریج مورد استفاده قرار می گیرد ، معادل یافتن حداکثر یک تخمین خلفی در زیر یک گاوسی قبل از ضرایب (w ) با دقت ( lambda^) است. به جای تنظیم دستی لامبدا ، می توان آن را به عنوان یک متغیر تصادفی از داده ها تخمین زد.

برای به دست آوردن یک مدل کاملاً احتمالی ، فرض می شود که خروجی (y ) گاوسی در اطراف (x w ) توزیع شده است:

  • جایی که ( alpha ) دوباره به عنوان یک متغیر تصادفی که از داده ها تخمین زده می شود ، درمان می شود.

  • مزایای رگرسیون بیزی عبارتند از:

این با داده های موجود سازگار است.

  • می توان از آن برای شامل پارامترهای منظم در روش تخمین استفاده کرد.

مضرات رگرسیون بیزی شامل موارد زیر است:

استنباط مدل می تواند وقت گیر باشد.

مقدمه خوبی برای روشهای بیزی در C. اسقف: تشخیص الگوی و یادگیری ماشین آورده شده است

الگوریتم اصلی در کتاب یادگیری Bayesian برای شبکه های عصبی توسط Radford M. Neal به تفصیل شرح داده شده است

1. 1. 10. 1. رگرسیون ریج بیزی

BayesianRidge یک مدل احتمالی از مشکل رگرسیون را همانطور که در بالا توضیح داده شد ، تخمین می زند. قبلی برای ضریب (w ) توسط یک گاوسی کروی داده شده است:

مقدمات بیش از ( alpha ) و ( lambda ) به عنوان توزیع گاما انتخاب شده اند ، مزدوج قبل از دقت گاوسی. مدل حاصل رگرسیون ریج بیزی نامیده می شود و شبیه به خط الراس کلاسیک است.

پارامترهای (w ) ، ( alpha ) و ( lambda ) به طور مشترک در طول متناسب با مدل تخمین زده می شوند ، پارامترهای تنظیم شده ( alpha ) و ( lambda ) تخمین زده می شوندبه حداکثر رساندن احتمال حاشیه ورود به سیستم. اجرای Scikit-Lea بر اساس الگوریتم شرح داده شده در پیوست A از (Tipping ، 2001) است که در آن به روزرسانی پارامترها ( alpha ) و ( lambda ) همانطور که در (Mackay ، 1992) پیشنهاد شده است. مقدار اولیه روش حداکثر سازی را می توان با HyperParameters alpha_init و lambda_init تنظیم کرد.

چهار hyperparameter دیگر ، ( alpha_1 ) ، ( alpha_2 ) ، ( lambda_1 ) و ( lambda_2 ) توزیع های قبلی گاما بیش از ( alpha ) و lambda وجود دارد.)اینها معمولاً غیر اطلاعاتی انتخاب می شوند. به طور پیش فرض ( alpha_1 = alpha_2 = lambda_1 = lambda_2 = 10^).

رگرسیون ریج بیزی برای رگرسیون استفاده می شود:

پس از نصب ، از مدل می توان برای پیش بینی مقادیر جدید استفاده کرد:

به ضرایب (W ) مدل قابل دسترسی است:

با توجه به چارچوب بیزی ، وزنهای یافت شده کمی متفاوت با مواردی است که توسط مربع های حداقل معمولی یافت می شود. با این حال ، رگرسیون ریج بیزی نسبت به مشکلات غیرمجاز قوی تر است.

بخش 3. 3 در کریستوفر م. اسقف: تشخیص الگوی و یادگیری ماشین ، 2006

1. 1. 10. 2. تعیین ارتباط خودکار - ARD¶

تعیین ارتباط خودکار (همانطور که در Ardregression اجرا می شود) نوعی مدل خطی است که بسیار شبیه به رگرسیون ریج بیزی است ، اما منجر به ضرایب پراکنده می شود (W ) [1] [2].<lambda_<1>Ardregression پیش از این بیش از (W ) متفاوت است: توزیع گاوسی کروی را برای توزیع گاوسی بیضوی محور محور کاهش می دهد. این بدان معناست که هر ضریب (w_ ) خود را می توان از توزیع گاوسی ، با محوریت صفر و با دقت ( lambda_ ) کشید:

>) .

با (a ) یک ماتریس مورب قطعی مثبت و ( text (a) = lambda = <lambda_i>واد lambda_

برخلاف رگرسیون ریج بیزی ، هر مختصات (W_ ) انحراف استاندارد خاص خود را دارد ( frac

)قبلی بیش از همه ( lambda_i ) همان توزیع گاما است که توسط hyperparameters ( lambda_1 ) و ( lambda_2 ) داده شده است.

ARD همچنین در ادبیات به عنوان ماشین وکتور یادگیری پراکنده بیزی شناخته شده است [3] [4]. برای مقایسه کار شده بین رگرسیون ARD و Bayesian Ridge ، مثال زیر را ببینید.

کریستوفر م. اسقف: تشخیص الگوی و یادگیری ماشین ، فصل 7. 2. 1

1. 1. 11. رگرسیون لجستیک ¶

رگرسیون لجستیک در LogisticRegression اجرا می شود. با وجود نام آن ، آن را به عنوان یک مدل خطی برای طبقه بندی به جای رگرسیون از نظر نامگذاری Scikit-Lea/ML اجرا می شود. رگرسیون لجستیک همچنین در ادبیات به عنوان رگرسیون ورود به سیستم ، طبقه بندی حداکثر آنتروپی (MAXENT) یا طبقه بندی خطی ورود به سیستم شناخته شده است. در این مدل ، احتمالات توصیف نتایج احتمالی یک آزمایش واحد با استفاده از یک عملکرد لجستیک مدل می شوند.

این پیاده سازی می تواند رگرسیون لجستیک باینری ، یک ولت یا چندمجمی با اختیاری ( ell_1 ) ، ( ell_2 ) یا تنظیم net الاستیک متناسب باشد.

منظم سازی

منظم سازی به طور پیش فرض اعمال می شود ، که در یادگیری ماشین متداول است اما در آمار نیست. یکی دیگر از مزیت های منظم این است که ثبات عددی را بهبود می بخشد. بدون تنظیم تنظیم C به مقدار بسیار بالایی نیست.

رگرسیون لجستیک به عنوان یک مورد خاص از مدلهای خطی تعمیم یافته (GLM)

رگرسیون لجستیک یک مورد خاص از مدلهای خطی تعمیم یافته با توزیع مشروط Binomial / Beoulli و پیوند ورود به سیستم است. خروجی عددی رگرسیون لجستیک ، که احتمال پیش بینی شده است ، می تواند با استفاده از آستانه (به طور پیش فرض 0. 5) به آن به عنوان طبقه بندی کننده استفاده شود. اینگونه است که در Scikit-Lea اجرا می شود ، بنابراین انتظار یک هدف طبقه بندی را دارد و باعث می شود رگرسیون لجستیک به یک طبقه بندی کننده تبدیل شود.

1. 1. 11. 1. مورد دودویی ¶

برای سهولت یادداشت ، فرض می کنیم که هدف (y_i ) مقادیر موجود در مجموعه (\) را برای نقطه داده (i ) می گیرد. پس از نصب ، روش predict_proba logisticregression احتمال کلاس مثبت (p (y_i = 1 | x_i) ) را پیش بینی می کندبه عنوان یک مشکل بهینه سازی ، رگرسیون لجستیک کلاس باینری با اصطلاح منظم (r (w) ) عملکرد هزینه زیر را به حداقل می رساند:

[ min_

c sum_^n سمت چپ (-y_i log ( hat

(x_i)) - (1 - y_i) log (1 - کلاه

(x_i)) راست) + r (w). ]

ما در حال حاضر چهار گزینه برای اصطلاح تنظیم (r (w) ) از طریق استدلال مجازات ارائه می دهیم:

برای Elasticnet ، ( rho ) (که مطابق با پارامتر L1_Ratio است) استحکام ( ell_1 ) منظم را در مقابل ( ell_2 ) تنظیم می کند.net الاستیک معادل ( ell_1 ) است که ( rho = 1 ) و معادل ( ell_2 ) وقتی ( rho = 0 ).

1. 1. 11. 2. مورد چندمجمی

مورد باینری را می توان به کلاسهای (k ) که منجر به رگرسیون لجستیک چندمجمی می شود ، گسترش دهید ، همچنین به مدل خطی مراجعه کنید.

می توان یک مدل طبقه بندی طبقه بندی (k ) را با استفاده از بردارهای وزن تنها ( k-1 ) پارامتر کرد و یک احتمال کلاس را با استفاده از این واقعیت که تمام احتمالات کلاس باید به یک نفر باشد ، به طور کامل توسط سایر احتمالات کلاس تعیین می کند. وادما عمداً برای سهولت در اجرای و حفظ تعصب القایی متقارن در مورد سفارش کلاس ها ، عمداً مدل را با استفاده از بردارهای وزن (k ) انتخاب می کنیم. این اثر هنگام استفاده از تنظیمات به ویژه اهمیت پیدا می کند. انتخاب پارامتری بیش از حد می تواند برای مدلهای غیرمجاز مضر باشد ، از آن زمان ممکن است محلول منحصر به فرد نباشد ، همانطور که در [16] نشان داده شده است.

بگذارید (y_i in ) متغیر هدف رمزگذاری شده برچسب (مرتبه) برای مشاهده (i ) باشد. به جای یک بردار ضریب واحد ، اکنون یک ماتریس ضرایب (W ) داریم که در آن هر بردار ردیف (W_K ) با کلاس (K ) مطابقت دارد. هدف ما پیش بینی احتمالات کلاس (p (y_i = k | x_i) ) از طریق predict_proba به عنوان:

هدف بهینه سازی می شود

جایی که ([P]) نشان دهنده براکت آیورسون است که اگر (P) نادرست باشد به (0) ارزیابی می کند، در غیر این صورت به (1) ارزیابی می شود. ما در حال حاضر چهار گزینه برای عبارت منظم سازی (r(W)) از طریق آرگومان مجازات ارائه می دهیم:

1. 1. 11. 3. حل کننده ها

حل کننده های پیاده سازی شده در کلاس LogisticRegression عبارتند از "lbfgs"، "liblinear"، "newton-cg"، "newton-cholesky"، "sag" و "saga":

حل کننده «liblinear» از الگوریتم مختصات فرود (CD) استفاده می کند و بر کتابخانه عالی C++ LIBLINEAR تکیه دارد که با scikit-lea ارسال می شود. با این حال، الگوریتم CD پیاده سازی شده به صورت liblinear نمی تواند یک مدل چندجمله ای (چند کلاسه) واقعی را یاد بگیرد. در عوض، مسئله بهینه سازی به روش «یک در مقابل استراحت» تجزیه می شود، بنابراین طبقه بندی کننده های باینری جداگانه برای همه کلاس ها آموزش داده می شوند. این در زیر هود اتفاق می افتد، بنابراین نمونه های LogisticRegression که از این حل کننده استفاده می کنند، به عنوان طبقه بندی کننده چند کلاسه رفتار می کنند. برای تنظیم (ell_1) sklea. svm. l1_min_c اجازه می دهد تا کران پایین را برای C محاسبه کنید تا یک مدل غیر تهی (همه وزن ویژگی ها به صفر) بدست آورید.

حل کننده های "lbfgs"، "newton-cg" و "sag" فقط از تنظیم (ell_2) پشتیبانی می کنند یا هیچ تنظیمی ندارند، و مشخص شده است که برای برخی داده های با ابعاد بالا سریع تر همگرا می شوند. تنظیم multi_class به "چند جمله ای" با این حل کننده ها یک مدل رگرسیون لجستیک چند جمله ای واقعی [5] را می آموزد، به این معنی که تخمین های احتمال آن باید بهتر از تنظیم پیش فرض "یک در مقابل استراحت" کالیبره شوند.

حل کننده "sag" از نزول گرادیان میانگین تصادفی [6] استفاده می کند. زمانی که تعداد نمونه ها و تعداد ویژگی ها زیاد باشد، سریع تر از حل کننده های دیگر برای مجموعه داده های بزرگ است.

The “newton-cholesky” solver is an exact Newton solver that calculates the hessian matrix and solves the resulting linear system. It is a very good choice for n_samples>>حل کننده "saga" [ 7 ] نوعی از "sag" است که از پنالتی غیر هموار =="l1" نیز پشتیبانی می کند. بنابراین این حل کننده انتخابی برای رگرسیون لجستیک چندجمله ای پراکنده است. همچنین تنها حل کننده ای است که penalty="elasticnet" را پشتیبانی می کند.

 

استراتژی های مؤثر فارکس...
ما را در سایت استراتژی های مؤثر فارکس دنبال می کنید

برچسب : نویسنده : توران میرهادی بازدید : <-PostHit-> تاريخ : شنبه 19 فروردين 1402 ساعت: 17:46