توضیح مفاهیم علوم داده با تمرکز بر بازارهای مالی
D Ata Science امروزه موضوعی محبوب است. همه در مورد داده ها هستند. چه کاری می تواند انجام دهد و چگونه می تواند کمک کند. بارها داده ها به عنوان اعداد نشان داده می شوند و این اعداد می توانند چیزهای مختلفی را نشان دهند. این تعداد می تواند میزان فروش ، موجودی ، مصرف کنندگان و آخرین اما قطعاً کم اهمیت باشد - پول نقد.
این ما را به داده های مالی یا به طور خاص بازار سهام سوق می دهد. سهام ، کالاها ، اوراق بهادار و چنین مواردی در هنگام تجارت بسیار شبیه به هم هستند. ما می فروشیم ، می فروشیم ، نگه می داریم. همه اینها به منظور سودآوری. سوال این است:
چگونه علم داده می تواند در هنگام انجام این معاملات در بورس به ما کمک کند؟
مفاهیم علوم داده برای بازار سهام
وقتی صحبت از علم داده می شود ، کلمات و عبارات زیادی وجود دارد یا اصطلاحات استفاده شده است که بسیاری از آنها نمی دانند. ما اینجا هستیم تا همه این موارد را حل کنیم. ذاتاً ، علم داده شامل دانش آمار ، ریاضی و برنامه نویسی است. اگر علاقه مند به دانستن اطلاعات بیشتر در مورد این مفاهیم هستید ، من در طول مقاله برخی از منابع را پیوند می دهم.
حال بیایید درست به آنچه همه ما می خواهیم بدانیم - با استفاده از علم داده برای انجام تجزیه و تحلیل در بازار. با تجزیه و تحلیل ، ما تعیین می کنیم که سهام ارزش سرمایه گذاری را دارد یا خیر. بیایید برخی از مفاهیم علوم داده با محوریت امور مالی و بورس را توضیح دهیم.
الگوریتم
در علم و برنامه نویسی داده ، از الگوریتم ها کاملاً گسترده استفاده می شود. الگوریتم مجموعه ای از قوانین به منظور انجام یک کار خاص است. ممکن است شنیده باشید که تجارت الگوریتمی یک چیز محبوب در بورس سهام است. معاملات الگوریتمی از الگوریتم های معاملاتی استفاده می کند و این الگوریتم ها شامل قوانینی مانند خرید سهام فقط پس از کاهش 5 ٪ آن روز یا فروش اگر سهام در اولین خرید 10 ٪ از ارزش خود را از دست داده است.
این الگوریتم ها همه قادر به اجرای بدون مداخله انسانی هستند. آنها اغلب به عنوان رباتهای تجاری شناخته می شوند زیرا در روش های تجاری خود اساساً مکانیکی هستند و بدون احساسات تجارت می کنند.
اگر می خواهید نمونه ای از ایجاد یک الگوریتم معاملاتی را ببینید ، مقاله زیر را بررسی کنید:
من یک الگوریتم تجارت ساده را در پایتون ساختم و شما هم می توانید
تجارت و اتوماسیون الگوریتمی با پایتون
آموزش
این آموزش معمولی شما نیست. با علم داده و یادگیری ماشین ، آموزش شامل استفاده از داده های منتخب یا بخشی از داده ها برای "آموزش" یک مدل یادگیری ماشین است. کل مجموعه داده ها معمولاً برای آموزش و آزمایش در دو بخش مختلف تقسیم می شوند. این تقسیم معمولاً 80/20 با 80 ٪ از کل مجموعه داده ها برای آموزش است. به این داده ها داده های آموزش یا مجموعه آموزش گفته می شود. برای اینکه مدل یادگیری ماشین به طور دقیق پیش بینی ها را انجام دهد ، آنها باید از داده های گذشته (مجموعه آموزش) بیاموزند.
اگر بخواهیم از یک مدل یادگیری ماشین برای پیش بینی قیمت های آینده یک سهام انتخابی استفاده کنیم ، از سال گذشته قیمت سهام را به مدل می دهیم تا قیمت ماه آینده را پیش بینی کنیم.
آزمایش کردن
پس از آموزش یک مدل با مجموعه آموزش ، می خواهیم بدانیم که مدل ما چقدر خوب عمل می کند. این جایی است که 20 ٪ دیگر داده ها وارد می شوند. این داده ها معمولاً داده های آزمایش یا مجموعه آزمایش نامیده می شوند. برای تأیید عملکرد مدل خود ، ما پیش بینی های مدل خود را انجام می دهیم و آن را با مجموعه آزمایش خود مقایسه می کنیم.
به عنوان مثال ، بیایید بگوییم که ما یک مدل را به ارزش یک سال داده قیمت سهام آموزش می دهیم. ما از ژانویه تا اکتبر از قیمت ها استفاده خواهیم کرد زیرا مجموعه آموزش های ما و نوامبر و دسامبر مجموعه آزمایشات ما خواهد بود (این یک نمونه بسیار ساده از تقسیم داده های سالانه است و نباید به دلیل فصلی و مواردی از این دست به طور معمول استفاده شود). پس از آموزش مدل خود در مورد قیمت های ژانویه-اکتبر ، ما آن را دو ماه آینده پیش بینی خواهیم کرد. این پیش بینی ها سپس با قیمت های واقعی از نوامبر و دسامبر مقایسه می شوند. میزان خطا بین پیش بینی ها و داده های واقعی همان چیزی است که ما قصد داریم در حالی که با مدل خود اشتباه می کنیم ، کاهش دهیم.
ویژگی ها و هدف
در علوم داده ، داده ها معمولاً در قالب جدولی مانند یک برگه اکسل یا یک DataFrame نمایش داده می شوند. این نقاط داده می تواند هر چیزی را نشان دهد. ستون ها نقش مهمی دارند. بیایید بگوییم که ما قیمت سهام را در یک ستون ، نسبت P/B ، حجم و سایر داده های مالی در ستون های دیگر داریم.
در این حالت ، قیمت سهام هدف ما خواهد بود. بقیه ستون ها ویژگی ها خواهند بود. در علم و آمار داده متغیر هدف متغیر وابسته نامیده می شود. این ویژگی ها به عنوان متغیرهای مستقل شناخته می شوند. هدف همان چیزی است که ما می خواهیم مقادیر آینده را برای آن پیش بینی کنیم و ویژگی ها همان چیزی است که مدل یادگیری ماشین برای انجام این پیش بینی ها استفاده می کند.
مدل سازی: سری زمانی
یک مورد که علم داده به شدت از آن استفاده می کند ، مفهومی به نام "مدل سازی" است. مدل سازی معمولاً از یک رویکرد ریاضی برای پیش بینی نتایج آینده استفاده می کند. وقتی صحبت از داده های مالی در بورس سهام می شود ، این مدل معمولاً یک مدل سری زمانی است. اما سری زمانی چیست؟
سری زمانی مجموعه ای از داده ها است ، در مورد ما این می تواند ارزش قیمت یک سهام باشد که به ترتیب یک دوره زمانی که می تواند ماهانه ، روزانه ، ساعتی یا حتی به طور دقیق باشد ، فهرست بندی شود. بیشتر نمودارها و داده های سهام یک سری زمانی است. بنابراین ، وقتی نوبت به مدل سازی این قیمت سهام می رسد ، یک دانشمند داده معمولاً یک مدل سری زمانی را پیاده سازی می کند.
ایجاد یک مدل سری زمانی شامل استفاده از یک یادگیری ماشین یا مدل یادگیری عمیق برای گرفتن داده های قیمت است. این داده ها سپس مورد تجزیه و تحلیل و متناسب با مدل قرار می گیرند. سپس این مدل ما را قادر می سازد تا قیمت سهام آینده را در طی یک دوره زمانی انتخاب شده پیش بینی کنیم. اگر می خواهید این کار را در عمل مشاهده کنید ، پس از آن مقاله های زیر را در مورد جزئیات هر دو یادگیری ماشین و رویکرد یادگیری عمیق برای پیش بینی قیمت بیت کوین بررسی کنید:
فارکس کاران ایران...
ما را در سایت فارکس کاران ایران دنبال می کنید
برچسب :
نویسنده : ديناروند فهيمه
بازدید : <-PostHit->
تاريخ : يکشنبه
11 تير
1402 ساعت: 15:42