یک چارچوب استراتژی تجارت جدید مبتنی بر تقویت یادگیری عمیق برای پیش بینی های بازار مالی

ساخت وبلاگ

پیش بینی سهام با محیط پویا ، پیچیده و هرج و مرج بازار سهام پیچیده است. سرمایه گذاران پول خود را در بازار مالی قرار می دهند ، به این امید که با درک روند بازار و طراحی استراتژی های معاملاتی در نقاط ورود و خروج ، سود را به حداکثر برسانند. بیشتر مطالعات مدلهای یادگیری ماشین را برای پیش بینی قیمت سهام پیشنهاد می کنند. با این حال ، ساخت استراتژی های معاملاتی برای بازرگانان برای جلوگیری از اشتباه و از دست دادن پول مفید است. ما یک چارچوب معاملاتی اتوماتیک را با استفاده از LSTM همراه با یادگیری عمیق Q پیشنهاد می کنیم تا سیگنال معاملاتی و اندازه موقعیت تجارت را تعیین کنیم. این پیشرفته تر از مدل های پیش بینی قیمت سنتی است. در این مطالعه از داده های قیمت از بازار سهام تایوان استفاده شده است ، از جمله قیمت افتتاح روزانه ، قیمت بسته شدن ، بالاترین قیمت ، کمترین قیمت و حجم معاملات. سودآوری سیستم با استفاده از ترکیبی از حالتهای مختلف سهام مختلف مورد بررسی قرار گرفت. سودآوری سیستم پیشنهادی پس از مدت طولانی آزمایش مثبت بود ، به این معنی که این سیستم در پیش بینی افزایش و سقوط سهام عملکرد خوبی داشته است.

1. معرفی

نیروهای بازار باعث می شود که قیمت سهام هر روز تغییر کند. تأثیرگذاری در بورس سهام عوامل نامشخصی است که مهمترین آنها به دلیل مسائل سیاسی و دولت است. چنین عدم قطعیت تعیین استراتژی های تجاری مناسب برای فروش یا خرید سهام را پیچیده می کند. تجزیه و تحلیل بازار سهام شامل بهینه سازی نمونه کارها [1] ، تعیین استراتژی سرمایه گذاری [2] و تجزیه و تحلیل ریسک بازار است [3]. پیش بینی روند قیمت سهام ، محققان و شرکت کنندگان از رشته های مختلف مانند اقتصاد ، مهندسی مالی ، آمار ، تحقیقات عملیات و یادگیری ماشین را به خود جلب کرده است [4،5،6].

مطالعات سنتی الگوریتم هایی را برای پیش بینی روند سهام بر اساس تکنیک های یادگیری ماشین ، مانند شبکه های عصبی مصنوعی (ANN) و دستگاه های بردار پشتیبانی (SVM) ارائه داده اند [5،6،7،8]. اخیراً ، محققان برای پیش بینی قیمت سهام ، تکنیک های شناخته شده یادگیری عمیق ، مانند شبکه های عصبی مکرر (RNN) و حافظه کوتاه مدت (LSTM) را اتخاذ کرده اند. طراحی یک استراتژی سودآور تجارت سهام یک مسئله چالش برانگیز در تحقیقات بازار مالی است ، زیرا داده های سری زمانی مالی بسیار بی ثبات و پر سر و صدا است. معامله گران سنتی باید مقادیر زیادی از داده ها را تجزیه و تحلیل کنند تا تصمیم بگیرند که آیا سفارشات خالی ، سفارشات متعدد یا بدون معامله را قرار دهند. علاوه بر این ، پس از تصمیم گیری برای ایجاد یک سفارش واحد ، برای به حداکثر رساندن سود ، آنها باید در مورد اندازه معامله تصمیم بگیرند. اخیراً ، برخی از محققان الگوریتم های معاملاتی را برای به حداکثر رساندن سود پیشنهاد داده اند [3].

یادگیری تقویت و یادگیری Q الگوریتم های یادگیری ماشین برای خودکارسازی یادگیری و تصمیم گیری هدفمند است [11]. Moody and Saffell [12] پرتفوی بهینه سازی شده و سهام معاملاتی با استفاده از یادگیری مستقیم تقویت. با استفاده از یادگیری تقویت کننده ، DeepMind یاد گرفت که هفت بازی ویدیویی Atari را انجام دهد ، حتی به سطح آزمایش انسان و در سه نفر نیز برسد. این سیستم بعداً در بیش از 20 بازی مختلف Atari به یک سطح آزمایشی انسانی دست یافت [13]. Alphago ، که ترکیب شبکه های عصبی و یادگیری تقویت شده است ، بهترین بازیکن Go در جهان را شکست داده و باعث افزایش محبوبیت یادگیری تقویت شده در یادگیری عمیق به عنوان موضوعی از تحقیق می شود.

در این مطالعه ، ما یک سیستم معاملاتی خودکار جدید را پیشنهاد می کنیم که ترکیبی از یادگیری عمیق و یادگیری تقویت برای تعیین سیگنال تجارت و اندازه موقعیت تجارت است. این سیستم از یک شبکه LSTM همراه با یادگیری Q عمیق ساخته شده است ، که یک الگوریتم یادگیری تقویت کننده خارج از سیاست است که با توجه به وضعیت فعلی به دنبال یافتن بهترین اقدامات برای انجام است. این غیرقانونی در نظر گرفته می شود زیرا عملکرد q یادگیری از اقداماتی که خارج از سیاست فعلی است ، مانند اقدامات تصادفی ، یاد می گیرد و بنابراین هیچ سیاستی لازم نیست. به طور خاص ، Q-Leaing به دنبال یادگیری سیاستی است که حداکثر پاداش را به حداکثر می رساند. سیستم ما مبتنی بر شبکه Q عمیق است [14]. ما این سیستم را با پنج محصول مالی مختلف و سه ایالت مختلف تأیید می کنیم. مقاله بصورت زیر مرتب شده است. در بخش 2 ، ما کارهای مرتبط را مرور می کنیم ، و در بخش 3 روش خود را معرفی می کنیم. داده ها و نتایج تجربی ما در بخش 4 ارائه شده است. ما در بخش 5 نتیجه می گیریم.

2. بررسی ادبیات

پیش بینی بازار سهام توسط بسیاری از محققان با استفاده از چندین تکنیک یادگیری ماشین ارائه شده است [15،16،17،18،19]. به تازگی ، مدل های یادگیری عمیق یک موضوع تحقیق محبوب [20،21،22] بوده است و ما به طور خلاصه در مورد برنامه های قبلی یادگیری عمیق برای تجارت مالی بحث می کنیم. دینگ و همکاران.[23] با استفاده از تعبیه رویداد که تأثیر وقایع بلند مدت و رویدادهای کوتاه مدت را برای پیش بینی قیمت سهام ترکیب می کند ، یک شبکه عصبی عمیق و عمیق را پیشنهاد کرد. رویدادهای آنها شامل تغییرات قیمت سهام در طی ماه ها ، هفته ها و روزها بود. آنها نشان دادند که ترکیب تعبیه رویداد با شبکه های عمیق حلقوی برای پیش بینی قیمت سهام مفید است.

آکیتا و همکاران.[24] یک مدل LSTM را با استفاده از اطلاعات متنی و عددی برای پیش بینی ده قیمت سهام شرکت ایجاد کرد. نتایج تجربی نشان داد که ترکیب اطلاعات متنی و عددی بهتر از روشهایی است که فقط از داده های متنی یا فقط داده های عددی استفاده می کنند. نلسون ، پریرا و د الیویرا [25] مدلی را بر اساس LSTM با استفاده از پنج اقدامات تاریخی قیمت (باز ، نزدیک ، کم ، بالا و حجم) و 175 شاخص فنی برای پیش بینی حرکت قیمت سهام ارائه دادند.

لیو و همکاران.[26] حرکات قیمت سهام را با استفاده از یک مدل رویداد مبتنی بر توجه پایان به پایان به پایان رساند. آنها مدل Att-en را برای سوء استفاده از همبستگی های ضمنی بین وقایع جهانی ، از جمله تأثیر شمارش رویداد و تأثیر کوتاه مدت ، میان مدت و طولانی مدت و همچنین حرکت قیمت سهام پیشنهاد کردند. QIN [27] سری زمانی را با استفاده از یک شبکه عصبی مکرر مبتنی بر توجه دو مرحله ای (DA-RNN) که شامل یک رمزگذار با مکانیسم توجه ورودی و یک رمزگذار با مکانیسم توجه زمانی بود ، پیش بینی کرد.

فیشر و کراوس [9] از دسامبر 1992 تا اکتبر 2015 یک مدل LSTM را برای یک کار پیش بینی بازار مالی در مقیاس بزرگ در داده های S& P 500 به کار برد. ژائو و همکاران.[28] پویایی بازار را از اطلاعات چندمادی (شاخص های اساسی ، شاخص های فنی و ساختار بازار) برای پیش بینی بازده سهام با استفاده از یک سیستم آگاهی از بازار پایان به پایان رساند. سیستم آگاهی از بازار آنها منجر به کاهش خطا شد و آگاهی زمانی در پشته های تصاویر بازار منجر به کاهش خطای بیشتر شد.

در یادگیری تقویت (RL) ، مدل می آموزد که موقعیت هایی را برای اقدامات برای به حداکثر رساندن پاداش ترسیم کند [29]. به عامل RL صریحاً در مورد چگونگی بهبود یادگیری خود دستور داده نمی شود [14] ؛در عوض ، نماینده فقط اطلاعات دولتی را از محیط خود مشاهده می کند. سپس نماینده به خودی خود می آموزد که با توجه به این حالت و پاداش به دست آمده ، اقدامات را انتخاب کند.

یک سیستم یادگیری تقویت کننده شامل یک سیاست ، پاداش ، عملکرد ارزش و یک محیط است. در هر مرحله T = 0 ، 1 ، 2 ، 3 ،… ، عامل و محیط با یکدیگر تعامل دارند. عامل ST ∈ S را مشاهده می کند ، جایی که S مجموعه ای از حالت های ممکن از محیط است ، و سپس یک عمل را در ∈ A (ST) انتخاب می کند ، جایی که A (ST) مجموعه اقداماتی است که ممکن است در ST State اجرا شود. در مرحله بعدی ، نماینده پاداش ، RT + 1 ∈ ℜ را دریافت می کند و وضعیت جدیدی را مشاهده می کند ، ST + 1. سیاست عامل نقشه برداری از حالت ها به اقدامات در هر مرحله زمانی است. یک خط مشی مشخص شده است ، جایی که πt (s ، a) این احتمال است که در = a if st = s. یادگیری تقویت کننده این است که چگونه نماینده با توجه به تجربه خود ، سیاست خود را بهبود می بخشد. هدف عامل حداکثر پاداش در دراز مدت است.

مودی و Saffell [12] یادگیری تقویت کننده مکرر (RRL) را معرفی کردند ، یک رویکرد تقویت مستقیم که از اجرای یادگیری Q بهتر عمل می کند. معامله گر RRL آنها از NN یک لایه برای به حداکثر رساندن عملکردی از سود تنظیم شده ریسک استفاده می کند ، که به عنوان هشت بازده گذشته و خروجی قبلی آن طول می کشد. معامله گر بر روی داده های جفت ارز USD/GBP ، نیم ساعته از ژانویه 1996 تا آگوست 1996 مورد آزمایش قرار گرفت و به سود سالانه 15 ٪ رسید. طلا [30] RRL را در سایر بازارهای ارزی با داده های نیم ساعته برای کل سال 1996 آزمایش کرد و به سود متنوع از 82. 1 ٪ تا 49. 3 ٪ رسید و به طور متوسط 4. 2 ٪ بیش از ده جفت ارز مختلف. دورسون و همکاران.[31] از دو تکنیک مبتنی بر یادگیری تقویت کننده مکرر (RLL) و دو بر اساس یادگیری Q برای مشکل تعیین استراتژی سرمایه گذاری استفاده کرد. آنها یادگیری تقویت و یک سیستم تجارت را با هم ترکیب کردند. به طور سنتی ، پیش بینی سهام و معاملات به عنوان سیستم های پیش بینی و معامله گر به سیستم های مستقل جدا می شوند. آنها عملکرد قوی را برای رویکرد q یادگیری نشان دادند: در برخی از سری داده ها ، نتایج دو برابر استراتژی خرید و نگهدارنده بود. Nevmyvaka و همکاران.[32] در اولین کاربرد تجربی گسترده یادگیری تقویت (RL) برای مشکل اجرای بهینه شده با استفاده از مجموعه داده های ریزساختار بازار NASDAQ در مقیاس بزرگ گزارش شده است. آنها از سوابق تاریخی INET استفاده کردند و آزمایش هایی را در سه سهام انجام دادند - Amazon (AMZN) ، Qualcomm (QCOM) و Nvidia (NVDA) - با بیان اینکه RL سیاست ارسال و ترک (S& L) را شکست داد ، که قبلاً بهبودی نسبت به یک بازار ساده بودسفارش.

Dempster و Leemans [33] از یادگیری تقویت کننده تطبیقی (ARL) در بازار ارز استفاده کردند. در سیستم خود ، آنها یک لایه مدیریت ریسک و یک لایه بهینه سازی بیش از حد پارامتر پویا اضافه کردند. آنها این سیستم را بر روی دو سال داده های تاریخی یورو/دلار ، از ژانویه 2000 تا ژانویه 2002 ، با 1 دقیقه دانه بندی ، آزمایش کردند و به طور متوسط 26 ٪ بازده سالانه را بدست آوردند. لی و همکاران.[34] یک سیستم معاملات سهام جدید را بر اساس یادگیری تقویت کننده پیشنهاد کرد. MQ-Trader ، چارچوب پیشنهادی ، از چهار عامل یادگیری Q تعاونی تشکیل شده است: عوامل سیگنال را بخرید و بفروشید ، که از پیش بینی روند جهانی برای تعیین زمان خرید یا فروش سهام سهام استفاده می کنند و نمایندگان سفارش را خریداری و فروش می کنند ، که تصمیم می گیرند بهترین خرید را انتخاب کنند. قیمت (BP) و قیمت فروش (SP) برای اجرای سفارشات داخلی. لی از رویکرد چهار عامل به KOSPI 200 استفاده کرد ، که شامل 200 سهام عمده کره است. آنها هنگام استفاده از داده های سهام از بازار سهام کره ، دریافتند که سیستم های آنها عملکرد بهتری نسبت به سایر سیستم های پایه دارد.

کاممینگ و همکاران.[35] یک الگوریتم معاملاتی RL را بر اساس اختلاف زمانی حداقل مربعات (LSTD) معرفی کرد. سیگنال دولتی آنها از 8 دوره گذشته شامل باز ، بالاترین ، پایین ترین و نزدیکترین قیمت ها (فقط پیشنهاد) بود ، جایی که هر دوره یک دقیقه را پوشش می دهد. پاداش به عنوان سود هر معامله تعریف شد. در آزمایشات ، روش آنها به سود سالانه 1. 64 ٪ در بازار جفت EUR/USD دست یافت. روشهای یادگیری تقویت عمیق همراه با استراتژی های مختلف معاملاتی محبوب شده است [36،37] و به دلیل استحکام و اثربخشی آنها در بازارهای سهام کشورهای مختلف ارزیابی شده است. رویکرد چند لایه سه لایه پیشنهادی بهتر از یک استراتژی خرید و نگهدارنده معمولی انجام شده است [38]. چارچوب سه لایه سهام ، از جمله یک لایه انباشته ، آرماتور متا یادگیرنده و لایه گروهی ، با مجموعه داده های آزمایشی حاوی سهام S& P500 ، J. P. مورگان و مایکروسافت بین 1 ژانویه 2012 و 31 دسامبر 2019 مورد بررسی قرار گرفت. روش گروه پیشنهادی منجر به بهتر شدن شد. نتایج معاملاتی و بیش از حد بیش از حد. بازگشت نهایی بهتر از معیار بود. به تازگی ، یک رویکرد یادگیری تقویت کننده عمیق چند عامل برای تجارت سهام با استفاده از روش S& P500 با استفاده از روش پیاده روی به جلو ارائه و ارزیابی شد. نتایج آزمایش نشان داد که رویکرد یادگیری عمیق چند جانبه بهتر از یک استراتژی خرید و نگهدارنده معمولی عمل می کند [39]. این مطالعه از این روش به عنوان خط پایه استفاده می شود.

3. روش شناسی

یادگیری تقویت کننده (RL) در حال یادگیری است که چه کاری باید انجام شود ، یعنی نحوه نقشه برداری موقعیت ها به اقدامات ، برای به حداکثر رساندن یک سیگنال پاداش عددی. بر خلاف یادگیری تحت نظارت ، عامل RL هرگز نمونه هایی از عملکرد صحیح یا نادرست را برای تقویت یادگیری دریافت نمی کند [24]. درعوض ، نماینده فقط با اطلاعات دولتی از محیط خود ارائه می شود. سپس نماینده یاد می گیرد که از طریق دولت عمل کند. این می آموزد که چه عملی از پاداش های به دست آمده برای تلاش برای اقدامات مختلف به خودی خود بهترین است. تنها هدف عامل حداکثر رساندن پاداش های دریافت شده است.

ما چارچوبی را برای تعیین سیگنال های معاملاتی پیشنهاد می کنیم تا بسته به مقدار Q در هر لحظه سود کل را به حداکثر برساند. در چارچوب ما ، ما الگوریتم یادگیری عمیق Q را در بورس سهام پیشنهادی MNIH اصلاح می کنیم [24]. آنها شبکه های عصبی عمیق و یادگیری Q را برای تسلط بر سیاست های کنترل دشوار برای بازی های رایانه ای Atari 2600 ترکیب کردند.

شکل 1 چارچوب پیشنهادی ما را نشان می دهد. یک سیستم یادگیری تقویت شده شامل چهار عنصر اصلی است: یک خط مشی ، یک سیگنال پاداش ، عملکرد ارزش و به صورت اختیاری ، یک مدل از محیط. به طور خاص ، عامل و محیط در هر یک از توالی مراحل گسسته زمان ، t = 0 ، 1 ، 2 ، 3 ،… در هر مرحله t ، نماینده برخی از نمایندگی از وضعیت محیط زیست ، S را دریافت می کند.t∈ S جایی که S مجموعه ای از حالت های ممکن است ، و بر اساس آن یک عمل را انتخاب می کند ،t∈ A (St)، در حالیکهt) مجموعه اقدامات موجود در ایالت S استtبشریک قدم بعد ، تا حدودی در نتیجه عمل خود ، نماینده پاداش عددی دریافت می کند ، rt+ 1∈ ℜ ، و خود را در حالت جدید پیدا می کند ، st +1بشردر هر مرحله ، عامل نقشه برداری را از حالتها به احتمال انتخاب هر عمل ممکن پیاده سازی می کند. این نقشه برداری سیاست نماینده نامیده می شود و مشخص می شود πtجایی که πt(s ، a) احتمال اینکه at= a if st= s. روشهای یادگیری تقویت کننده چگونگی تغییر نماینده سیاست خود را در نتیجه تجربه خود مشخص می کند. هدف عامل ، به طور گسترده ، به حداکثر رساندن کل پاداش دریافت شده در طولانی مدت است.

در هر لحظه ، نماینده حالت را از محیط مشاهده می کند و سپس تصمیم می گیرد که با استفاده از شبکه Q عمیق چه اقدامی را انجام دهد. پس از اقدام ، نماینده پاداش دریافت می کند. تعاریف دقیق از ایالات ، اقدامات و پاداش هر نماینده و شبکه Q عمیق در بخش های بعدی ارائه شده است.

3. 1سیگنال دولت

سهام را در فاصله زمانی [1 ،… ، t] در نظر بگیرید. مشخص کردن O P T ، H P T ، L P T ، C P T ، V O T به عنوان قیمت باز ، بالاترین قیمت ، کمترین قیمت ، قیمت نزدیک و حجم سهام در زمان T به ترتیب. توجه داشته باشید که فاصله زمانی بین T - 1 و T نشان دهنده یک روز ، یک هفته یا یک ماه است. در این مقاله ، بازده ناخالص این پنج ویژگی را به عنوان ورودی Q-Leaing در نظر می گیریم. نمادهای بازده ناخالص به عنوان o t = o p t - o p t - 1 o p t - 1 ، h t = h p t - h p t - 1 h p t - 1 ، c t = c p t - c p t - 1 c p t t- 1 ، l t = l p t - l p t - 1 l p t - 1 ، v t = v o t - v o t - 1 v o t - 1.

S t ، 5 = [o t - 4 ، H t - 4 ، l t - 4 ، c t - 4 ، v t - 4 o t - 3 ، h t - 3 ، l t - 3 ، c t - 3 ،V T - 3 O T - 2 ، H T - 2 ، L T - 2 ، C T - 2 ، V T - 2 O T - 1 ، H T - 1 ، L T - 1 ، C T - 1 ، V T- 1 O T ، H T ، L T ، C T ، V T] ، S T ، 10 = [O T - 9 ، H T - 9 ، L T - 9 ، C T - 9 ، V T - 9 O T- 8 ، H T - 8 ، L T - 8 ، C T - 8 ، V T - 8… O T - 1 ، H T - 1 ، L T - 1 ، C T - 1 ، V T - 1 O T T، H T ، L T ، C T ، V T] ، و S T ، 20 = [O T - 19 ، H T - 19 ، L T - 19 ، C T - 19 ، V T - 19 O T - 18 ،H T - 18 ، L T - 18 ، C T - 18 ، V T - 18… O T - 1 ، H T - 1 ، L T - 1 ، C T - 1 ، V T - 1 O T ، H T ، H T ،به ترتیب L T ، C T ، V T].

اجزای اصلی سیگنال حالتt∈ S ، جایی که S مجموعه ای از حالت ها است1، s2، s3, …>ویژگی های استخراج شده از داده های بازار ، از جمله قیمت باز ، بالاترین قیمت ، قیمت نزدیک ، کمترین قیمت و حجم. هر ایالتtشامل k ∈ روز داده های سهام است. هر ویژگی به محدوده عادی می شود [1 ، 1]:

[o t - 2 ، h t - 2 ، c t - 2 ، l t - 2 ، v t - 2] ، [o t - 1 ، h t - 1 ، c t - 1 ، l t - 1 ، v t t- 1] ، [O T ، H T ، C T ، L T ، V T]]

o t = o p t - o p t - 1 o p t - 1 ، h t = h p t - h p t - 1 h p t - 1 ، c t = c p t - c c p t - 1 c p t - 1 ،

جایی که OPtقیمت باز در زمان t ، hp استtبالاترین قیمت در زمان t ، cp استtقیمت نزدیک در زمان t ، l استtکمترین قیمت در زمان t و v استtحجم در زمان t است.

3. 2استراتژی تجارت

پنج عمل وجود دارد که به عنوان عمل = مشخص شده استبرای عوامل در مدل پیشنهادی. این اقدامات نشان دهنده اندازه بزرگ طولانی (یک LL) ، اندازه کوچک طولانی (A LS) ، SIT (A SIT) ، اندازه کوچک کوتاه (A SS) و اندازه بزرگ کوتاه (A SL) است. ورودی مدل آموزش ما در زمان T حالت S T ، K ∈ S است. مطابق با دولت S T ، K مدل یک عمل در عمل در زمان t را تعیین می کند.

عامل پیشنهادی فقط می تواند پنج عمل مختلف را انجام دهد: اندازه بزرگ طولانی ، اندازه کوچک طولانی ، نشستن ، اندازه کوچک کوتاه و اندازه بزرگ. سیگنال عمل را می توان به A (s) = [a ll ، a ls ، a sit ، a ss ، a sl] ∀s s ساده کرد ، جایی که [a ll ، a ls ، a sit ، a ss ، a sl]در جدول 1 توسط محیط مورد نظر تفسیر می شود. اگر سیگنال عمل A0 یا A1 باشد ، ما یک موقعیت طولانی را باز می کنیم. اگر سیگنال عمل A2 باشد ، ما هیچ کاری نمی کنیم (نشسته). اگر سیگنال عمل A3 یا A4 باشد ، ما یک موقعیت کوتاه را باز می کنیم.

استراتژی معاملاتی ما در حال حاضر قبل از بسته شدن بازار سهام طولانی (کوتاه) است و موقعیت را در لحظه باز شدن بازار در روز بعد تمیز می کند. به عنوان مثال ، اگر سهام را با قیمت بسته C P T در روز T طولانی کنیم ، روز بعد سهام را با قیمت O P T تمیز می کنیم. سود و ضرر در روز T به صورت C P T + 1 - O P T محاسبه می شود. در این مطالعه ، ما پنج عمل در مورد موقعیت ها با اندازه های مختلف را نشان می دهیم ، جایی که یک L L نمایانگر دو واحد طولانی از سهام است ، A L S یک واحد طولانی از سهام را نشان می دهد ، A S I TES هیچ کاری انجام نمی دهد ، A S S یک واحد کوتاه سهام را نشان می دهد، و A S L نشان دهنده دو واحد کوتاه سهام است.

استراتژی معاملاتی ما در طی دو روز تجارت روز است. ما موقعیت را با قیمت معاملاتی C T ، قیمت بسته در زمان t باز می کنیم و سپس موقعیت را در زمان T + 1 با قیمت معاملاتی o t + 1 می بندیم ، قیمت باز در زمان t + 1. ما k را مشاهده می کنیم<5, 10, 20>روزهای قیمت باز ، بالاترین قیمت ، قیمت نزدیک ، کمترین قیمت و حجم و سپس تصمیم به باز کردن موقعیت طولانی یا باز کردن یک موقعیت کوتاه در زمان t. علاوه بر این ، ما موقعیت را در زمان T + 1 می بندیم. علاوه بر سیگنال معاملاتی ، شبکه Q عمیق ما نیز اندازه موقعیت را تعیین می کند ، یعنی کوچک یا بزرگ. به عبارت دیگر ، نماینده تصمیم می گیرد که پس از شناختن دولت ، چه اقدامی را برای استفاده از شبکه Q عمیق انجام دهد و سپس معامله را در زمان t انجام دهد. محیط در زمان T + 1 پاداش را برمی گرداند.

در رویکرد یادگیری کلاسیک Q، ما باید حالت و عمل را به عنوان ورودی بدهیم که در نتیجه یک مقدار Q برای آن حالت و عمل ایجاد شود. تکرار این رویکرد در شبکه های عصبی مشکل ساز است، زیرا باید به مدل حالت و عمل را برای هر عمل ممکن عامل ارائه داد، که منجر به عبورهای رو به جلو در همان مدل می شود. در عوض، مدل به گونه ای طراحی شده است که مقادیر Q را برای هر عمل برای یک حالت معین پیش بینی می کند. در نتیجه فقط یک پاس رو به جلو مورد نیاز است. اجرای DQN برای مدل ما شبیه به روش یادگیری Q است. برای شروع، به جای مقداردهی اولیه ماتریس Q، مدل مقداردهی اولیه می شود. در خط مشی طمع ϵ، به جای انتخاب عمل بر اساس خط مشی π، مقادیر Q بر اساس مدل محاسبه می شود. در پایان هر قسمت، مدل با استفاده از مینی دسته های تجربی تصادفی آموزش داده می شود.

هسته چارچوب یک شبکه عصبی عمیق است که به صورت شماتیک در شکل 2 نشان داده شده است. این شبکه وظیفه محاسبه ارزش عمل را برای محیط بازار دارد. لایه ورودی دارای تعدادی نورون است که توسط عناصر موجود در سیگنال وضعیت ما تعریف شده است که شامل k∈ [6] روز قیمت باز نرمال شده، بالاترین قیمت، قیمت بسته، کمترین قیمت و حجم است. این لایه ورودی با پنج لایه پنهان دنبال می شود.

اولین لایه پنهان یک لایه حافظه کوتاه مدت بلند مدت (LSTM) است. LSTM انتخاب شده است زیرا یکی از پیشرفته ترین معماری های یادگیری عمیق برای کارهای مالی است (Fischer & C. Krauss, 2018). لایه های پنهان باقی مانده، لایه های شبکه عصبی عمیق (DNN) هستند.

لایه خروجی دارای پنج نورون برای نمایش مقادیر عمل (Q a L L ( S ) ، Q a L s ( S ) ، Q a S i t ( S ) ، Q a S S ( S ) ، Q a S L ( S ) ، که در آنQ a L L ( S ) نشان دهنده پیش بینی Q-value بر اساس حالت و عمل a L L , Q a L s ( S ) است که برای حالت و عمل a L s , Q a S i t ( S ) که برای حالت و عمل a Si t , Q a S S ( S ) که برای حالت و عمل یک S S , و Q a S L ( S ) که برای حالت و عمل یک S L .

ما مقدار حداکثر عمل را به عنوان اقدام خود انتخاب می کنیم. شبکه Q عمیق با یک مجموعه تصادفی مقداردهی اولیه می شود. همانطور که شبکه در یک فرآیند آموزشی با محیط بازار تعامل می کند، حالت، عمل و پاداش را در حافظه جمع آوری و ذخیره می کند. پس از یک دوره ثابت، شبکه Q عمیق را با استفاده از میانگین مربعات خطا (MSE) بین پاداش و مقدار عمل دریافتی از شبکه عصبی به روز می کنیم.

4. آزمایش کنید

ما برای تأیید سیستم پیشنهادی دو نوع داده مختلف مالی جمع آوری کردیم. توضیحات داده ها در جدول 2 نشان داده شده است. این شش محصول مالی می توانند در همین مدت الگوهای مختلفی داشته باشند. سود انباشته این محصولات در شکل 3 ، شکل 4 ، شکل 5 ، شکل 6 ، شکل 7 و شکل 8 نشان داده شده است. کد 0050 و TSMC همان الگوی را دارند زیرا 0050 دارای 18. 78 ٪ از سهام TSMC است. اگرچه 1101 روند فزاینده یا در حال کاهش را نشان نمی دهد ، اما از 0050 و TSMC بی ثبات تر است.

کدهای 00655L و 00672L از ETF استفاده می شوند ، این یک امنیت است که به دنبال آن است که بازده روزانه مشتقات مالی یا بدهی های مالی را ضرب یا معکوس کند. کد 00655L عملکرد دو بار در روز شاخص FTSE چین A50 را ردیابی می کند ، و 00672L عملکرد S& P GSCI نفت خام 2 × شاخص Eareed Er را ردیابی می کند.

ما 0050 را انتخاب کردیم زیرا ترکیبات این صندوق از 50 سهام برتر ذکر شده در بورس اوراق بهادار تایوان با وزن بازار ، از جمله 1101 ، 2330 و 2881 انتخاب می شوند. ما همچنین 00655L و 00672L را انتخاب کردیم زیرا ETF های اهرمی دارای بی ثباتی بالایی هستند.

4. 1نتایج و بحث

نتایج ما در دو مرحله ارائه شده است. ابتدا عملکرد شبکه LSTM را با شبکه عصبی عمیق و شبکه RNN مقایسه کردیم و سپس شبکه بهترین عملکرد را برای ساخت چارچوب پیشنهادی انتخاب کردیم. دوم ، ما آزمایش های مختلفی را برای تأیید چارچوب پیشنهادی انجام دادیم. در این آزمایش از یک پنجره نورد برای ارزیابی رویکرد پیشنهادی استفاده کردیم. هر پنجره شامل یک دوره تمرین سه ماهه و یک دوره آزمایش یک ماهه (3 ماه/1 ماه) بود.

وظیفه اصلی چارچوب پیشنهادی پیش بینی دقیق سهام و تعیین عملکرد انجام شده است. در این بخش از شبکه های عصبی مختلف برای پیش بینی حرکت قیمت سهام استفاده کردیم. لایه ورودی شبکه های عصبی با وضعیت ما مطابقت دارد ، به گونه ای که داده های ورودی شامل قیمت باز ، بالاترین قیمت ، قیمت نزدیک ، کمترین قیمت و حجم است. لایه خروجی یک لایه طبقه بندی است. همانطور که در جدول 3 نشان داده شده است ، ما در تمام مدلها حداقل 77 ٪ دقت کسب کردیم. LSTM در چهار یا پنج سهام مختلف از مدل های دیگر پیشی گرفت. از این رو ، ما از LSTM برای ساخت شبکه Q عمیق استفاده کردیم.

4. 2تجزیه و تحلیل عملکرد عمیق Q-Leaing

ما آزمایش های مختلفی را برای تأیید سیستم های پیشنهادی با استفاده از پنج سهام مختلف و سه حالت مختلف (5 ، 10 و 20 روز OHCLV) انجام دادیم. ما صندوق های سرمایه گذاری اولیه 100000 را به عهده گرفتیم. ما از آوریل 2016 تا دسامبر 2018 ، 00655L از ژوئیه 2016 تا دسامبر 2018 و 00672L از ژانویه 2017 تا دسامبر 2018 از چارچوب خود برای تجارت 0050 ، 2330 و 1101 استفاده کردیم.

در شکل 3 ، محور y سود انباشته شده را نشان می دهد ، و محور x نشان دهنده زمان است. سه خط مختلف نشان دهنده سود انباشته سه ایالت مختلف است. نتایج نشان می دهد که کشورهای 5 روزه و 20 روزه سود مثبتی کسب کرده اند. کشورهای 10 روزه سود منفی داشتند. ما دریافتیم که آموزش مدل با 5 روز OHCLV در 0050 بهترین عملکرد را به همراه دارد.

در شکل 4 ، نتایج نشان می دهد که 5 روز ، 10 روز و 20 روز سود مثبتی کسب کرده اند. آموزش مدل با 10 روز OHCLV در 1101 بهترین عملکرد را به همراه داشت. علاوه بر این ، این مدل در ژوئن سال 2018 متحمل ضرر زیادی شد.

در شکل 5 ، نتایج نشان می دهد که هر سه ایالت با گذشت زمان سود مثبتی کسب کرده اند. آموزش مدل با 10 روز OHCLV در 2330 بهترین عملکرد را به همراه داشت.

در شکل 6 ، نتایج نشان می دهد که کشورهای 10 روزه و 20 روزه سود مثبتی کسب کرده اند و دولت 5 روزه سود منفی دارد. آموزش مدل با 10 و 20 روز OHCLV در 2881 بهترین عملکرد را به همراه داشت. این مدل برای دولت 5 روزه در نوامبر 2016 متحمل ضرر زیادی شد.

در شکل 7 و شکل 8 ، ما این مدل را برای تجارت ETF های اهرمی آموزش دادیم. باز هم ، محور Y نشان دهنده سود انباشته شده است ، محور X نشان دهنده زمان است و سه خط مختلف نشان دهنده سود انباشته شده از سه حالت مختلف است. شکل 7 نشان می دهد که کشورهای 5 روزه و 20 روزه سود مثبتی کسب کرده اند. شکل 8 نشان می دهد که این مدل در نوامبر 2018 متحمل ضرر زیادی شده است.

همانطور که در جدول 4 نشان داده شده است ، ما بیشتر از نرخ پیروزی برای تجزیه و تحلیل عملکرد چارچوب استفاده کردیم. نرخ پیروزی سیستم معاملاتی ما بین 48 تا 60 درصد بود. این نتایج کم به دلیل هدف چارچوب ما بود ، یعنی ساختن چارچوبی که یاد می گیرد تجارت سهام بالایی را بین دو روز گسترش دهد. نتیجه نشان می دهد که هدف ما به دست آمده است. اگرچه ما نرخ پیروزی بالایی نداشتیم ، اما سود خوبی کسب کردیم.

4. 3ارزیابی عملکرد مالی

توسعه یک استراتژی نیاز به یک معیار ارزیابی خوب دارد تا قضاوت کند که آیا این استراتژی سودآور است. ابتدایی ترین معیارها شامل احتمال پیروزی ، نسبت شانس ، حداکثر ترسیم پایین (MDD) و پاداش نسبت به MDD است. ما عملکرد آزمایشات خود را در جدول 5 ، جدول 6 ، جدول 7 و جدول 8 ذکر کرده ایم. از نظر فاکتور سود (PF) ، اگر بیشتر از 1 باشد ، این استراتژی در وضعیت سودآور است. به طور کلی ، PF توصیه می شود بیشتر از 1. 5 باشد ، به طوری که سود و منحنی تجمعی به طور پیوسته بالا می رود. در آزمایش ، ما مشاهده کردیم که مدل تجارت ما برای اکثر پارامترها عملکرد خوبی دارد.

5. نتیجه گیری و کار آینده

به طور سنتی ، ایجاد یک استراتژی تجارت دشوار است. ما باید بسیاری از جنبه های هدف - داده های قیمت ، شاخص های فنی و غیره را تجزیه و تحلیل کنیم - پس از آن باید تصمیم بگیریم که چه موقع تجارت کنیم و چه تعداد سهام را برای تجارت انجام دهیم. این یک کار دشوار و وقت گیر برای معامله گران است. از این رو ، ما یک چارچوب معاملاتی خودکار را بر اساس شبکه های عصبی عمیق و یادگیری تقویت ساختیم. در این آزمایش از ژانویه 2009 تا دسامبر 2018 از پنج ماده تشکیل دهنده سهام مختلف تایوان استفاده شده است.

ما سه کمک کلیدی در ادبیات انجام می دهیم: با تمرکز بر روی شبکه های عصبی عمیق مختلف ، دریافتیم که LSTM از سایر شبکه های عصبی در وظایف پیش بینی سری زمانی بر اساس داده های سهام جمع آوری شده ما استفاده می کند. LSTM برای چهار از پنج سهام مختلف بهتر عمل کرد. سهم دوم سیستم معاملاتی خودکار ما است ، بر اساس پنج نوع داده های اولیه قیمت روزانه (به عنوان مثال ، قیمت باز ، بالاترین قیمت ، قیمت بسته ، کمترین قیمت و حجم). استراتژی معاملاتی ما طی دو روز تجارت روزانه بود. ما سیگنال ها و اندازه های معاملاتی را از چارچوب خود به دست آوردیم تا تصمیم بگیریم که آیا روز بعد فروش ، نگه داشتن یا خرید و بسته شدن را ببندیم. ما نشان دادیم که چارچوب پیشنهادی در برخی از سهام بازده خوبی دارد. با این حال ، ما فقط چارچوب خود را در بازار سهام تایوان تأیید کردیم و از همان شبکه عصبی برای ساخت چارچوبی برای پنج سهام مختلف استفاده کردیم.

اخیراً ، برخی از محققان برای پیش بینی سهام ، قیمت سهام و اخبار مالی یکپارچه چارچوب را پیشنهاد کرده اند. در تحقیقات آینده ، تجزیه و تحلیل احساسات مقالات خبری باید به عنوان منبع دیگری از اطلاعات در مورد محیط زیست ادغام شود. یک مدل یادگیری تقویت نیز باید در بازار cryptocurrency از جمله بیت کوین ، اتریوم و غیره اعمال شود.

یک محدودیت این است که مدل پیشنهادی فقط برای یک سهم در بازار سهام تایوان ارزیابی شد. از آنجایی که ما از نظر بودجه محدود بودیم، ما فقط یک مجموعه داده کوچک برای ارزیابی مدل پیشنهادی جمع آوری کردیم. کار آینده باید شامل تأیید مدل پیشنهادی با جمع آوری مجموعه داده بزرگ تر باشد.

مشارکت های نویسنده

مفهوم سازی، L.-C. C. و M.-E. W. روش شناسی، L.-C. C.، M.-E. W. و ی.-ح. ح. نرم افزار، ی.-ح. ح. نوشتن - آماده سازی پیش نویس اصلی، Y.-H. H. و L.-C. C. نوشتن-بررسی و ویرایش، L.-C. C.، M.-H. H. و M.-E. W. همه نویسندگان نسخه منتشر شده نسخه خطی را خوانده و با آن موافقت کرده اند.

منابع مالی

این مطالعه تا حدی توسط وزارت علوم و فناوری تایوان با شماره های کمک هزینه MOST 105-2410-H-031-035-MY3 و MOST 108-2410-H-027-020 پشتیبانی شده است.

فارکس کاران ایران...
ما را در سایت فارکس کاران ایران دنبال می کنید

برچسب : نویسنده : ديناروند فهيمه بازدید : <-PostHit-> تاريخ : يکشنبه 11 تير 1402 ساعت: 19:14