ایجاد شهود برای آنچه همبستگی دارد و چه چیزی به شما می گوید
آمار در قلب علوم داده های کاربردی است و آمار درک شما را به دانشمند داده بهتر تبدیل می کند. حتی اگر - یا شاید به خصوص اگر - بیشتر وقت خود را صرف وصل کردن در کتابخانه های آماده کنید و نیازی به ایجاد یک مدل یادگیری ماشین از ابتدا نخواهید داشت ، از درک مکانیک آماری زیر مدل های خود بهره مند خواهید شد. دانستن اینکه چه نوع کار آماری رایانه از طرف شما انجام می دهد وقتی از نوع خاصی از مدل تماس می گیرید می تواند برای انتخاب مدل برای یک وضعیت معین ، مهم باشد ، برای دانستن اینکه چه نوع پردازش داده ها به چه نوع پردازش نیاز دارند و برای تنظیم صحیحمدل شما
یک دانشجوی علوم داده ، به ویژه یک تعویض کننده میانی شغلی که مسیر بوت کامپ را طی می کند ، ممکن است ناچیز مطالعه آمار را کمی دلهره آور پیدا کند-مانند بسیاری از زمینه های پیچیده ، آمار دارای اصطلاحات و نمادهای خاص خود است که نیاز به یادگیری دارند. برای بهتر یا بدتر ، بسیاری از افراد به عنوان دانشمندان داده با حداقل زمینه در آمار کار می کنند ، اما یک شهود خاص برای اصول آماری باید یک پیش نیاز باشد. داشتن یک حس داخلی خوب از اصولی که حتی نیازی به ریاضی ندارند ، مسیری طولانی را طی می کند. اول از این اصول ، همبستگی است.
همبستگی/استقلال
همبستگی شاید مهمترین مفهوم برای درک هر نوع علم داده های کاربردی یا تجزیه و تحلیل باشد. منظور از همبستگی دو متغیر چیست؟به عبارت ساده ، این بدان معنی است که می توانیم بگوییم متغیرها مرتبط هستند زیرا آنها به نوعی با هم حرکت می کنند. شاید یکی بلند شود در حالی که دیگری سقوط می کند یا هر دو با هم بلند می شوند. این همان حرکت در یک متغیر نیست که باعث افزایش یا سقوط دیگری شود - ممکن است متغیر سوم و غیب وجود داشته باشد که دو مورد دیگر را کنترل می کند - اما دانستن ارزش یکی از متغیرها هنوز هم اطلاعاتی در مورد شما خواهد داشتدوم اگر همبستگی داشته باشند.
بسیاری از افراد در کلاسهای آماری با فرمول برای ضریب همبستگی پیرسون و مجموعه ای از نمودارها که نشان دهنده سطوح مختلف همبستگی مانند این است ، با همبستگی آشنا می شوند:
در نمودار سمت چپ ، فقط بین متغیرهای X و Y ما همبستگی بسیار کمی وجود دارد. در سمت راست همبستگی بسیار بالایی وجود دارد. به نظر می رسد که این دو متغیر در قفل حرکت می کنند ، با افزایش x ، به طور همیشگی Y نیز انجام می شود. ارزش ضریب همبستگی پیرسون ، روندهای مهم را به خوبی نشان می دهد ، با رابطه Lockstep در سمت راست که توسط یک مقدار نزدیک به 1 نشان داده شده است و همبستگی کم در سمت چپ توسط یک مقدار نزدیک به 0 اسیر شده است. البته متغیرها نیز می توانند منفی باشندبا همبستگی ، جایی که مقدار y به طور کلی با افزایش x کاهش می یابد:
به نظر می رسد ضریب پیرسون چیزهای زیادی به ما می گوید و به عنوان یک اندازه گیری همبستگی تقریباً همه گیر است (اگر به "ضریب همبستگی" مراجعه کنید و در غیر این صورت مشخص نمی شود ، به راحتی می توان فرض کرد که به پیرسون اشاره دارد). با این حال ، من می خواهم از محاسبه این مقدار مفرد فاصله بگیرم و روی آنچه که متغیرها به طور گسترده تر ارتباط دارند ، فاصله بگیرم. از یک چیز ، دانشجویان جدید آمار تمایل دارند که ارزش همبستگی با بزرگی ارتباط بین دو متغیر را اشتباه بگیرند. این واقعاً اینگونه نیست که ضریب همبستگی کار می کند. ضریب همبستگی نزدیک به 1 فقط نشان می دهد که متغیرهای x و y به طور هم زمان حرکت می کنند: انتظار می رود که با بالا رفتن X بالا برود ، اما با بالا رفتن از X با بالا رفتن x نیست. افزایش شیب خط در واقع ارزش ضریب همبستگی را تغییر نمی دهد:
برای چیز دیگر ، ضریب پیرسون در واقع تنها یکی از اقدامات مختلف همبستگی است. چرا اقدامات متفاوتی برای همبستگی وجود دارد؟خوب ، متغیرها به روش های مختلف می توانند در ارتباط باشند. این مجموعه از امتیازات را در نظر بگیرید:
امیدوارم بلافاصله ببینید که متغیرهای X و Y مرتبط هستند ، اما ارزش ضریب پیرسون بین آنها نزدیک است. چرا این امر خواهد بود؟ضریب پیرسون اندازه گیری همبستگی خطی است و رابطه این دو متغیر خطی نیست! این واقعیت که مقدار Y با افزایش x با افزایش x کمتر می شود اما با افزایش X بالاتر از 0 این متریک افزایش می یابد. خوشبختانه روش های دیگری برای اندازه گیری همبستگی وجود دارد. برای این مورد خاص ، ممکن است همبستگی فاصله را در نظر بگیرید. سایر اقدامات همبستگی نیز وجود دارد که رتبه متغیر را نسبت به کمیت در نظر می گیرند.
چرا این موضوع اینقدر مهم است؟
به نوعی ، همبستگی واقعاً قلب تمام علم داده های کاربردی است. هنگامی که دو متغیر با هم در ارتباط هستند ، دانستن اینکه ممکن است یکی به شما کمک کند دیگری را پیش بینی کنید. روابط بین متغیرها ممکن است پیچیده و غیر خطی باشد ، به همین دلیل مهم است که در مورد همبستگی بیش از یک ضریب واحد فکر کنیم. آنچه واقعاً مهم است ارزش هیچ ضریب همبستگی خاصی نیست ، اما به نظر می رسد که آیا مقادیر دو متغیر مرتبط هستند یا خیر. با وجود ضریب 0 پیرسون ، دو متغیر که پارابولا فوق را تشکیل می دهند مرتبط هستند و دانستن مقدار متغیر X به شما یک اشاره بسیار خوب در مورد مقدار متغیر Y می بخشد.
در دنیای واقعی ، اندازه گیری متغیرها پر سر و صدا هستند - اندازه گیری شما بسته به نحوه یا زمان اندازه گیری آن ممکن است کمی بالاتر یا پایین تر باشد. روابط بین متغیرها نیز می تواند اشتباه گرفته شود ، به این معنی که یک متغیر سوم و اندازه گیری نشده وجود دارد که به طور مستقل بر یک یا هر دو متغیر مورد نظر شما تأثیر می گذارد. در نتیجه ، همیشه به راحتی نمی توان گفت که آیا دو متغیر به طور مفید مرتبط هستند یا خیر. یک رابطه مفید می تواند با سر و صدای آماری پوشانده شود. بخش اعظم یادگیری ماشین به سادگی ابزارهای هوشمندانه ای هستند که سعی می کنند همبستگی های قابل استفاده را از بین ببرند حتی اگر فوراً مشخص نشود که این روابط چیست.
"همبستگی های پایین" هنوز هم می تواند بسیار معنی دار باشد
یکی دیگر از دلایلی که می خواهم تمرکز خود را از یک ضریب واحد تغییر دهم این است که ضریب کم به خودی خود به معنای این نیست که اتفاق بسیار معنی داری در جریان نیست. بسیاری از دوره های آمار مقدماتی کار خوبی را برای هشدار دادن به افراد در مورد خطرات "همبستگی های فریبنده" انجام می دهند ، که در آن دو متغیر که هیچ ارتباطی با یکدیگر ندارند به دلیل شانس تصادفی (به ویژه هنگامی که نمونه ها کوچک هستند) با یکدیگر ارتباط دارند. شما می توانید نمونه های بسیار خوبی از چنین همبستگی های فریبنده ای پیدا کنید ، من به خصوص دوست دارم که تایلر ویجن جمع آوری کرده است:
آیا فیلم های NIC Cage باعث غرق شدن مردم می شوند؟از مجموعه شگفت انگیز تایلر ویگن از همبستگی های فریبنده
دوره های مقدماتی تمایل به صرف وقت کافی برای تمرکز بر روی مشکل مخالف ندارند ، با این حال ، که در آن روابط واقعی توسط ضرایب همبستگی پایین مبهم است. ضرایب همبستگی کم می تواند با اثرات بسیار معنی دار همراه باشد. اگر برخی از تأثیر دلایل مختلف و مستقل متعددی داشته باشد ، ضریب همبستگی بین اثر و هر متغیر جداگانه ممکن است با وجود پیوندهای علی کم باشد. برای نشان دادن ، 50 نکته زیر را که من ایجاد کرده ام در نظر بگیرید و در زیر ترسیم کرده ام:
آیا به نظر می رسد که بین متغیرهای X و Y در اینجا رابطه قوی وجود دارد؟احتمالا نه. ضریب پیرسون یک ناچیز است . 17. آیا این متغیر X در مدلی مفید است که سعی در پیش بینی Y دارد؟اولین فکر شما ممکن است خیر باشد ، اما اگر توضیح دهم که چگونه این شماره ها را تولید کردم ، ممکن است نظر خود را تغییر دهید. من نورد 6 تاس را شبیه سازی کردم که نیمی از آنها شش طرفه و نیمی دیگر از آن بیست طرفه بودند و اعداد را اضافه کردم. متغیر X که در بالا ترسیم شده است ، به سادگی اولین این رول ها است.
از آنجا که کل از بسیاری از رول ها گرفته شده است و هر رول مستقل است ، ضریب همبستگی در هر رول واحد احتمالاً خیلی زیاد نخواهد بود. اما ، همانطور که می بینید ، ضرایب کم به معنای کم به معنای این نیست که متغیرها بی فایده هستند. متغیر X که در بالا ترسیم کردم (همراه با 5 رول دیگر) قدرت توضیحی واقعی دارد. تمام آنچه شما باید کل را با دقت کامل پیش بینی کنید ، نتایج شش رول مستقل است و هرگز بدون این یک دقت را کامل نمی کنید.
علت
قدم بعدی از یافتن همبستگی ، فکر کردن در مورد علیت است. شما ممکن است شنیده باشید که Mantra Intro Stats of "همبستگی علیت برابر نیست". دانستن اینکه دو متغیر به نوعی در ارتباط هستند ، مشابه دانستن نحوه پیوند آنها نیست. شما می توانید بگویید که آیا x و y با نگاه ساده به داده ها با هم ارتباط دارند ، اما روش های بی شماری برای ارتباط X و Y وجود دارد. x می تواند بر Y یا Y تأثیر بگذارد ، می تواند بر x تأثیر بگذارد یا برخی از متغیرهای دیگر می تواند هر دو را تحت تأثیر قرار دهد. شما نمی توانید بگویید که کدام یک از این موارد فقط از داده ها است.
به عنوان مثال ، مطالعات بیشماری نشان داده است که کودکانی که یک ساز موسیقی را یاد می گیرند در مدرسه بهتر عمل می کنند. غالباً از این نوع مطالعات به عنوان شواهدی استفاده می شود که یادگیری یک ابزار باعث می شود کودکان در مدارس بهتر عمل کنند. والدین ممکن است در مورد آنها بشنوند و تصمیم بگیرند که فرزندشان باید پیانو یاد بگیرد ، یا برای افزایش بودجه برای برنامه های موسیقی مدرسه استدلال کند. در حالی که من طرفدار برنامه های موسیقی مدرسه هستم ، احتمالاً رابطه در اینجا به سادگی نیست - به ویولن دانش آموز آموزش دهید و تماشا کنید که نمرات آنها بالا می رود ". از یک چیز ، عوامل مخدوش بی شماری وجود دارد ، که کمترین آنها وضعیت اقتصادی اقتصادی نیست - خانواده هایی با درآمد یکبار مصرف بیشتر به احتمال زیاد قادر به تهیه یک درس ساز و موسیقی برای یک کودک علاقه مند هستند. برای چیز دیگر ، ممکن است علیت در واقع به روش دیگر جریان یابد - شاید دانش آموزانی که در مدرسه خوب عمل می کنند ، بیشتر می خواهند یک ساز موسیقی را یاد بگیرند. نوع کودک با تمرکز و عزم و اراده برای برتری در کلاس ریاضی نیز ممکن است بیشتر از یادگیری یک ابزار تا زمانی که نتایج رضایت بخش را مشاهده کند ، بیشتر باشد.
این واقعیت که نمی توانیم از یک مطالعه مشاهده ای بگوییم دقیقاً چه چیزی باعث ایجاد پیامدهای مهم برای سیاست می شود. این گفته ، مهم است که به یاد داشته باشید که لازم نیست بدانید که علیت از چه روشی برای همبستگی برخوردار است تا بتواند قدرت پیش بینی کننده داشته باشد. یک افسر پذیرش کالج را در نظر بگیرید که متقاضیان را جستجو می کند. با دانستن اینکه دانش آموزانی که مدت طولانی موسیقی را مطالعه کرده اند ، تمایل به انجام بهتر در دانشگاه دارند ، ممکن است افسر از انتخاب دانش آموزانی که ابزاری برای پذیرش بازی می کنند ، طرفداری کند ، همه موارد دیگر برابر هستند. برای آنها ، به نوعی ، مهم نیست که چرا این پیوند وجود دارد ، آنها لزوماً اهمیتی نمی دهند که آیا مطالعه موسیقی باعث می شود دانش آموزان بهتر عمل کنند یا اینکه عامل دیگری در بازی وجود دارد ، همه چیز به آنها اهمیت می دهد ، واقعیت استاین که وجود رابطه به آنها امکان می دهد عملکرد آینده دانش آموز را بهتر پیش بینی کنند.
همبستگی می تواند نمونه های شما را مغرضانه کند
شما اغلب صحبت از مواردی مانند "نمونه های تصادفی" را می شنوید و نمونه هایی که تصادفی نیستند می توانند مغرضانه باشند ، اما منظور از این است که یک نمونه "تصادفی" باشد؟بیشتر فرایندهایی که ما با آنها سر و کار داریم (و احتمالاً همه چیز در جهان نیز ، هرچند که این یک موضوع فلسفی برای زمان دیگری است) که به نظر می رسد تصادفی است ، واقعاً تعیین کننده هستند. یک سکه سکه "تصادفی" است به این معنا که شما بعید به نظر می رسد که بتوانید به کدام راه بروید ، اما کاملاً قطعی است به این معنا که این که آیا سر و یا دم می کند کاملاً وابسته به چرخش سکه و حرکت از طریق هوا استکه خود کاملاً وابسته به زاویه و نیرویی است که سکه از دست شما بیرون می رود. به همین ترتیب ، رایانه ها نمی توانند به روشی واقعاً تصادفی عمل کنند. اگر از رایانه خود بخواهید اعداد تصادفی تولید کند یا یک نمونه تصادفی مصرف کند ، این تعداد "شبه تصادفی" را تولید می کند ، که به نظر می رسد به طور تصادفی به نظر می رسد اما در واقع از هرج و مرج اما در نهایت تعیین کننده فیزیکی ، دستکاری های حسابی یا ترکیبی از این دو مشتق شده است.
چرا به اعداد تصادفی احتیاج دارید و چگونه می توانیم بگوییم که شماره های شبه تصادفی به اندازه کافی "تصادفی" هستند؟یکی از کلیدها این است که تعداد تصادفی (یا نمونه انتخاب شده از طریق یک روش تصادفی) مستقل و با هر آنچه که ما مطالعه می کنیم ، مستقل و غیر مرتبط است. حتی اگر روشها واقعاً "تصادفی" نباشند ، انتخاب نمونه با چرخاندن سکه ها یا تاس نورد به خوبی کار می کند زیرا نتیجه سکه یا رول تاس به موارد موجود در نمونه مربوط نمی شود و برعکس.
من این را مطرح می کنم زیرا بسیاری از علم داده با استفاده از استخرهای داده انجام می شود که به هیچ وجه تصادفی نیستند. به عنوان مثال ، شرکت ها داده های مشتری زیادی را که ممکن است بخواهند برای نوعی بینش از آن استفاده کنند ، دارند ، اما با این تعریف ، شما فقط می توانید اطلاعات مشتری را در مورد مشتریان خود داشته باشید. غالباً این نوع استنتاج هایی را که می توانید به طور منطقی از داده ها انجام دهید ، به طور خاص به این دلیل که متغیری که می خواهید مطالعه کنید با نحوه جمع آوری نمونه در ارتباط است.
به عنوان مثال ، من یک بار روی پروژه ای کار کردم که رضایت مردم از اتومبیل های آنها را بررسی کرد. یک نظرسنجی از بین رفته بود و مردم با اطلاعات اساسی در مورد اتومبیل های خود (ساخت ، مدل ، سال و غیره) پاسخ داده بودند ، خواه با انواع خاصی از مشکلات با اتومبیل ها و رضایت کلی آنها روبرو شده باشند. این تیم سعی کرده بود الگوبرداری کند که چقدر شخص راضی بود که با ماشین خود باشد و برخی از افراد از این که با افزایش سن خودرو ، شگفت زده شدند ، این مدل رضایت بالاتری را پیش بینی می کرد. مطمئناً مردم از اتومبیل های قدیمی تر رضایت کمتری خواهند داشت؟
در اینجا یک مورد از روش انتخاب نمونه بود و متغیر هدف (رضایت) در ارتباط بود. از این گذشته ، اگر واقعاً از ماشین خود راضی نیستید ، به محض اینکه توانایی آن را دارید ، بیشتر آن را جایگزین خواهید کرد. افرادی که پانزده سال است که همان ماشین را رانندگی کرده اند ، احتمالاً مانند رانندگی آن ماشین هستند. افرادی که از ماشین خود متنفر هستند ، تمایل ندارند آن را برای مدت طولانی نگه دارند. همه موارد دیگر با هم برابر هستند ، ممکن است انتظار داشته باشید که مردم اتومبیل های جدیدتر را نسبت به افراد مسن تر ترجیح دهند ، اما نمونه ای که توسط نظرسنجی حاصل می شود ، تقاطع اتومبیل های قدیمی و رانندگان ناراضی را ندارد.
این بدان معنا نیست که این نظرسنجی مفید نیست یا نمی توانید سن خودرو را در مدل خود بگنجانید. در واقع ، سن به دلیل این همبستگی یک پیش بینی کننده بسیار مفید از رضایت است. اگر به من بگویید که مدت طولانی همان ماشین را هدایت کرده اید ، شرط بدی نیست که شما این کار را تا حدودی انجام داده اید زیرا آن را دوست دارید (یا حداقل آن را دوست ندارید). این همبستگی محدود می کند که از مدل شما می توان برای آن استفاده کرد. اگر این تجزیه و تحلیل را انجام داده اید و یک شرکت اتومبیل به شما نزدیک شده است که چگونه می توانید رضایت مشتری را بهبود بخشید ، پاسخ دادن به "خوب ، افرادی که اتومبیل های قدیمی تر رانندگی می کنند ، تمایل دارند که از آنها راضی باشند ، بنابراین باید به مشتریان خود بدهیدماشین های قدیمی".
فارکس کاران ایران...
ما را در سایت فارکس کاران ایران دنبال می کنید
برچسب :
نویسنده : ديناروند فهيمه
بازدید : <-PostHit->
تاريخ : جمعه
19 خرداد
1402 ساعت: 14:06