گروه سیستم و مهندسی اطلاعات Qifeng Qiao ، دانشگاه ویرجینیا ، P. O. جعبه 400747CHARLOTTESVILLE ، VA ، 22904USA.
پیتر A. گروه مهندسی سیستم ها و مهندسی اطلاعات ، دانشگاه ویرجینیا ، P. O. جعبه 400747CHARLOTTESVILLE ، VA ، 22904USA.
ویلیام تی. شرر گروه سیستم ها و مهندسی اطلاعات ، دانشگاه ویرجینیا ، P. O. جعبه 400747CHARLOTTESVILLE ، VA ، 22904USA.
آندری A. کیریلنکو گروه سیستم ها و مهندسی اطلاعات ، دانشگاه ویرجینیا ، P. O. جعبه 400747CHARLOTTESVILLE ، VA ، 22904USA. ؛دانشکده مدیریت MIT SLOAN ، 50 Drive Memorial ، Cambridge ، MA ، 02142USA. مکاتبات syang14@stevens. edu ak67@mit. edu
صفحات 1683-1703 29 نوامبر 2012 دریافت کرد پذیرفته شده 08 ژانویه 2015 منتشر شده به صورت آنلاین: 12 مارس 2015
- استناد را بارگیری کنید
- https://doi. org/10. 1080/14697688. 2015. 1011684
- جایگاه
- 1. معرفی
- 2. رویکرد خلاصه آمار به طبقه بندی معامله گر
- 3. مدل فرآیند تصمیم گیری مارکوف پویایی بازار
- 4- یادگیری تقویت معکوس
- 5. با بازار آتی شاخص سهام E-Mini S& P 500 آزمایش کنید
- 6. نتیجه گیری
- پانویسها و منابع
- منابع
مقالات تحقیقاتی
شناسایی استراتژی تجارت الگوریتمی مبتنی بر فرآیند گاوسی
خلاصه
نمایش فرمول:؟فرمول های ریاضی به عنوان MATHML رمزگذاری شده اند و در این نسخه HTML با استفاده از MathJax به منظور بهبود نمایشگر خود نمایش داده می شوند. جعبه را برای خاموش کردن MathJax از آن جدا کنید. این ویژگی به JavaScript نیاز دارد. برای بزرگنمایی روی فرمول کلیک کنید.
بسیاری از شرکت کنندگان در بازار اکنون از تجارت الگوریتمی استفاده می کنند ، که معمولاً به عنوان استفاده از الگوریتم های رایانه ای تعریف می شوند ، تا به طور خودکار تصمیمات تجاری خاصی بگیرند ، سفارشات را ارسال کرده و آن سفارشات را پس از ارسال مدیریت کنند. شناسایی و درک تأثیر تجارت الگوریتمی در بازارهای مالی به یک مسئله مهم برای اپراتورهای بازار و تنظیم کننده ها تبدیل شده است. داده های پیشرفته داده ها و اطلاعات دنباله حسابرسی از اپراتورهای بازار اکنون امکان مشاهده کامل اقدامات شرکت کنندگان در بازار را فراهم می کند. یک سؤال اساسی این است که میزان درک و توصیف رفتار شرکت کنندگان در مورد مشاهدات اقدامات تجاری امکان پذیر است. در این مقاله ، ما مشکلات اساسی طبقه بندی و شناخت معامله گران (یا معادل الگوریتم های معاملاتی) را بر اساس سفارشات حد مشاهده شده در نظر می گیریم. این مشکلات مورد توجه تنظیم کننده هایی است که برای اهداف تشخیص کلاهبرداری و توسعه سیاست درگیر شناسایی استراتژی هستند. روشها در ادبیات برای توصیف رفتار معامله گر با استفاده از قوانین طبقه بندی تعریف شده در فضای ویژگی متشکل از آمار معاملات خلاصه حجم و موجودی ، همراه با متغیرهای مشتق شده که منعکس کننده قوام خرید یا فروش رفتار است ، پیشنهاد شده است. سهم اصلی ما این است که یک فضای ویژگی کاملاً متفاوت را پیشنهاد کنیم که با استنباط پارامترهای کلیدی یک مدل بهینه سازی متوالی ساخته می شود که ما به عنوان یک جانشین برای روند تصمیم گیری معامله گران می گیریم. به طور خاص ، ما رفتار معامله گر را از نظر یک فرآیند تصمیم گیری مارکوف الگوبرداری می کنیم. ما عملکرد پاداش (یا عینی) را برای این فرایند از مشاهدات اقدامات معاملاتی با استفاده از یک فرآیند از یادگیری ماشین که به عنوان یادگیری تقویت معکوس (IRL) شناخته می شود ، استنباط می کنیم. توابع پاداش آموخته شده از طریق IRL سپس یک فضای ویژگی را تشکیل می دهد که می تواند پایه و اساس یادگیری تحت نظارت (برای طبقه بندی یا شناخت معامله گران) یا یادگیری بدون نظارت (برای طبقه بندی معامله گران) باشد. با استفاده از مجموعه داده های دنیای واقعی از قرارداد آینده E-Mini ، ما دو نوع اصلی IRL ، IRL خطی و فرآیند گاوسی IRL را با روشی مبتنی بر آمار معاملات خلاصه مقایسه می کنیم. نتایج نشان می دهد که فضاهای ویژگی مبتنی بر IRL از طبقه بندی دقیق و خوشه بندی معنی دار پشتیبانی می کنند. علاوه بر این ، ما استدلال می کنیم که ، زیرا آنها سعی می کنند گزاره های ارزش اصلی معامله گران را در شرایط مختلف بازار بیاموزند ،
- روشهای IRL از رویکرد خلاصه آماری خلاصه تر و قوی تر هستند و برای کشف الگوهای رفتاری جدید شرکت کنندگان در بازار مناسب هستند.
- یادگیری تقویت معکوس
- روند گاوسی
- تجارت با فرکانس بالا
- تجارت الگوریتمی
- دارایی رفتاری
- روند تصمیم گیری مارکوف
1. معرفی
1. معرفی
بازارهای مالی طی 10 سال گذشته به طرز چشمگیری تغییر کرده است. این تغییرات نشانگر اوج یک روند یک دهه از یک ساختار بازار با تجارت در درجه اول دستی به یک ساختار بازار است که تحت تأثیر تجارت خودکار رایانه است. این تحول سریع با تکامل فن آوری ها برای تولید ، مسیریابی و اجرای سفارشات هدایت شده است که به طرز چشمگیری سرعت ، ظرفیت و پیشرفت عملکردهای تجاری را که برای شرکت کنندگان در بازار در دسترس است بهبود بخشیده است.
بازارهای تجاری با کیفیت بالا با تعیین قیمت برای اوراق بهادار و این امکان را برای سرمایه گذاران فراهم می کند تا بتوانند از موقعیت های خود در اوراق بهادار در هر کجا و هر زمان که بخواهند این کار را انجام دهند ، تشکیل و تخصیص سرمایه را ارتقا دهند. یکی از ویژگی های مهم انواع استراتژی تجارت الگوریتمی ، کشف پدیده های تجاری مداوم و ایجاد فرصت های تجاری مناسب است. این فرصت های معاملاتی شامل حرکات قیمت میکرو ثانیه ای است که به یک معامله گر اجازه می دهد تا از معاملات ساخت بازار بهره مند شود ، چندین استراتژی طولانی که با پیش بینی حرکت توسط تئوری های ساختار ساختار بازار و چندین حرکت بازار یک ساعته که حوادث مکرر و انحراف از روابط آماری را احاطه کرده است ، تجارت می کند.(Aldrid Citation 2010). بازرگانان الگوریتمی سپس الگوریتم ها و سیستم های تجاری خود را با هدف تولید سیگنالهایی طراحی می کنند که منجر به نتایج مثبت مداوم در شرایط مختلف بازار می شوند. استراتژی های مختلف ممکن است فرکانس های مختلفی را هدف قرار دهد ، و سودآوری یک استراتژی معاملاتی اغلب توسط یک متریک بازده خاص اندازه گیری می شود. متداول ترین اندازه گیری ، نسبت شارپ ، یک متریک بازده تنظیم شده با ریسک است که برای اولین بار توسط شارپ ارائه شده است (استناد 1966).
به طور خاص ، یک زیر گروه در استراتژی های تجارت الگوریتمی به نام استراتژی های تجارت با فرکانس بالا (HFT) وجود دارد که مورد توجه سرمایه گذاران ، تنظیم کننده ها ، سیاست گذاران و دانشگاهیان قرار گرفته است. طبق اعلام کمیسیون بورس و اوراق بهادار ایالات متحده ، معامله گران با فرکانس بالا "معامله گران حرفه ای هستند که با ظرفیت اختصاصی عمل می کنند که به استراتژی هایی می پردازند که روزانه تعداد زیادی معاملات را ایجاد می کنند."(انتشار مفهوم SEC در ساختار بازار سهام ، 75 Fed. Reg. 3603 ، 21 ژانویه 2010). SEC HFT را به عنوان (1) استفاده از برنامه های رایانه ای فوق العاده با سرعت بالا و پیشرفته برای تولید ، مسیریابی و اجرای سفارشات مشخص می کند.(2) استفاده از خدمات همکار و فیدهای داده های فردی که توسط مبادلات و دیگران ارائه می شود برای به حداقل رساندن شبکه و سایر انواع تأخیر.(3) بازه های زمانی بسیار کوتاه برای ایجاد و انحلال موقعیت ها.(4) ارسال سفارشات بیشماری که اندکی پس از ارسال لغو می شوند. و (5) پایان دادن به روز معاملات در حد ممکن نزدیک به یک موقعیت مسطح (یعنی عدم داشتن موقعیت های قابل توجه و غیرقابل تحمل در طول شب). اگرچه امروزه بسیاری از استراتژی های HFT وجود دارند و تا حد زیادی برای عموم ناشناخته اند ، اما محققان اخیراً ویژگی های کلی خود را روشن کرده اند. چندین استراتژی مصور HFT عبارتند از: (1) عمل به عنوان یک بازار سازنده غیر رسمی یا رسمی ، (2) تجارت با ارزش نسبی با فرکانس بالا و (3) تجارت جهت دار در نسخه های خبری ، جریان سفارش یا سایر سیگنال های با فرکانس بالا (استناد به جونز2012).
در چند سال گذشته تعدادی از مطالعات مربوط به تجارت HFT و الگوریتمی به طور کلی انجام شده است. هدف اصلی آنها درک تأثیر اقتصادی این شیوه های تجارت الگوریتمی بر کیفیت بازار ، از جمله جنبه هایی از قبیل نقدینگی ، فرآیند کشف قیمت ، هزینه های معاملات و غیره است. از طرف تجربی ، برخی از محققان توانسته اند HFT خاصی را از آن شناسایی کنندداده ها و سایرین قادر به شناسایی اینکه آیا تجارت از معامله گران الگوریتمی است یا خیر. با توجه به میزان اطلاعات ارائه شده توسط مبادلات و فروشندگان داده ، می توان الگوهای موجود در ارسال سفارش الگوریتمی ، لغو سفارش و رفتار تجارت را توصیف کرد. همچنین می توان مشاهده کرد که آیا فعالیت های الگوریتمی یا HFT با گسترش پیشنهادات و پیشنهادات ، نوسانات موقت و/یا دائمی ، حجم معاملات و سایر فعالیت های بازار و اقدامات کیفیت در ارتباط است. هندرسوت و همکاران.(استناد 2004) اجرای یک نقل قول خودکار در بورس نیویورک را مطالعه کنید. آنها دریافتند که اجرای نقل قول خودکار با افزایش ترافیک پیام الکترونیکی و بهبود کیفیت بازار از جمله گسترش موثر محدود ، کاهش انتخاب نامطلوب و افزایش کشف قیمت همراه است. این اثرات در بنگاه های بزرگ متمرکز شده است و در سهام کلاه های کوچک تأثیر کمی دارد. Menkveld (استناد 2012) در مورد ورود ژوئیه 2007 از یک بازار ساز با فرکانس بالا به معاملات سهام هلندی مطالعه می کند. وی استدلال می کند که رقابت بین سالن های معاملاتی ، ورود سازندگان بازار با فرکانس بالا و به طور کلی HFTS را تسهیل می کند و وی نشان می دهد که ورود به بازار سازنده با فرکانس بالا با 23 ٪ انتخاب نامطلوب کمتر همراه است. همچنین نوسانات اندازه گیری شده با استفاده از 20 دقیقه نوسانات تحقق یافته با ورود بازار سازنده فرکانس بالا بی تأثیر است. Riordan and Storkenmaier (استناد 2012) تأثیر ارتقاء تکنولوژیکی بر کیفیت بازار 98 سهام آلمانی را که به طور فعال معامله می شود ، بررسی می کنند. آنها نتیجه می گیرند که توانایی به روزرسانی سریعتر به ارائه دهندگان نقدینگی کمک می کند تا ضررهای خود را به تقاضای نقدینگی به حداقل برسانند و کشف قیمت بیشتری صورت می گیرد. Boehmer و همکاران.(استناد 2012) شواهد بین المللی در مورد ترافیک پیام الکترونیکی و کیفیت بازار را در 39 بورس سهام طی دوره 2001-2009 بررسی کنید. آنها می دانند که مکان همکار باعث افزایش تجارت الگوریتمی و HFT می شود و معرفی همکار باعث بهبود نقدینگی و راندمان اطلاعات قیمت ها می شود. آنها ادعا می کنند ، با این حال ،
این نوسانات به همان اندازه که بر اساس گسترش پیشنهادات باریک تر و باریک تر کاهش نمی یابد ، کاهش نمی یابد. گای و همکاران.(استناد 2012) تأثیر دو به روزرسانی فناوری NASDAQ در سال 2010 را که حداقل زمان بین پیام های 950 نانو ثانیه به 200 نانو ثانیه کاهش می یابد ، مطالعه کنید. این تغییرات تکنولوژیکی منجر به افزایش قابل توجهی در تعداد سفارشات لغو شده ، بدون تغییر قابل توجه در حجم معاملات کلی یا گسترش و گسترش و پیشنهادات و عمق می شود. به طور کلی ، این مطالعات بر شواهد تجربی متمرکز شده اند که افزایش تجارت الگوریتمی تأثیر مثبتی بر کیفیت بازار به طور کلی دارد.
از طرف نظری ، تعدادی از مدل ها برای درک تأثیر اقتصادی این شیوه های تجارت الگوریتمی تهیه شده اند. Biais و همکاران.(استناد 2012) نتیجه گیری می کند که HFT می تواند سریعتر از غیر HFT ، اطلاعات جدید را ایجاد کند ، هزینه های انتخاب نامطلوب را ایجاد کند ، و همچنین چندین امتیاز تعادل را در مدل خود پیدا می کنند و برخی از آنها ناکارآمدی اجتماعی را نسبت به سرمایه گذاری در HFT نشان می دهند. این مدل از Jovanovic و Menkveld (استناد 2010) نشان می دهد که HFT می تواند از انتخاب نامطلوب جلوگیری کند ، و می تواند برخی از این مزایا را برای سرمایه گذاران بی اطلاع که نیاز به تجارت دارند ، فراهم کند. مارتینز و روزو (استناد 2012) از الگوی خود نتیجه می گیرند که HFT قبل از در دسترس بودن دیگران ، اطلاعاتی را به دست می آورد و با آن تجارت می کند و انتخاب نامطلوب را برای سازندگان بازار تحمیل می کند. بنابراین ، نقدینگی بدتر است و قیمت ها دیگر کارآمد نیستند. مارتینز و روزو (استناد 2012) بر HFT ها تمرکز می کنند که نیاز به نقدینگی دارند ، و نشان می دهند که HFT با در نظر گرفتن اطلاعات به محض در دسترس بودن ، قیمت های بازار را بسیار کارآمد می کند. بازارها بی ثبات نیستند ، تا زمانی که جمعیت سازندگان بازار آماده تأمین نقدینگی با قیمت های رقابتی باشند. سایر مدلهای نظری مرتبط شامل Pagnotta و Philippon (استناد 2012) است که به منظور جذب حجم معاملات از سرمایه گذاران حساس به سرعت ، روی سرمایه گذاری در سرعت انجام شده توسط مبادلات تمرکز می کنند. Moallemi و Saglam (استناد 2012) استدلال می کنند که کاهش تأخیر به ارسال کنندگان سفارش محدود می کند تا سریعتر سفارشات خود را به روز کنند و از این طریق ارزش گزینه معاملاتی را کاهش می دهند که یک سفارش محدود به یک نقدینگی کمک می کند. موضوع متداول در این مدل ها این است که HFT ممکن است انتخاب نامطلوب را افزایش دهد و برای نقدینگی مضر است. با این حال ، توانایی واسطه برای معامله گران که در زمان های مختلف می رسند ، به طور کلی برای نقدینگی مفید است.
علاوه بر این ، تعدادی از مطالعات متمرکز بر رفتارهای بازرگانان الگوریتمی انجام شده است. این مطالعات فعالیتهای تجاری انواع مختلف معامله گران را مورد بررسی قرار می دهد و سعی می کند تفاوتهای رفتاری آنها را تشخیص دهد. هندرسوت و ریوردان (استناد 2013) از طبقه بندی مبادله برای تمایز معامله گران الگوریتمی از سفارشات مدیریت شده توسط انسان استفاده می کنند. آنها دریافتند که معامله گران الگوریتمی در اندازه تجارت کوچکتر متمرکز هستند ، در حالی که معاملات بزرگ بلوک 5000 سهام یا بیشتر بیشتر توسط معامله گران انسانی سرچشمه می گیرد. معامله گران الگوریتمی نقدینگی را مصرف می کنند وقتی که گسترش پیشنهادات نسبتاً باریک است ، و نقدینگی را در هنگام گسترش پیشنهادات و پیشنهادات نسبتاً گسترده می کنند. این نشان می دهد که معامله گران الگوریتمی سطح نقدینگی را در طول زمان فراهم می کنند. Brogaard (استناد 2012) و هندشوت و همکاران.(استناد 2004) با داده های NASDAQ کار کنید که پرچم گذاری می کنند که آیا تجارت شامل HFT است. هندرسوت و همکاران.(استناد 2004) دریافت که HFT حدود 42 ٪ از حجم NASDAQ (دو برابر) در سهام بزرگ را تشکیل می دهد اما فقط در حدود 17 ٪ از حجم در سهام کوچک. آنها یک مدل فضای دولتی را تخمین می زنند که تغییرات قیمت را به اجزای دائمی و موقت تجزیه می کند و سهم تأمین نقدینگی HFT و غیر HFT و تقاضا را برای هر یک از این مؤلفه های تغییر قیمت اندازه می گیرد. آنها دریافتند که وقتی HFT ها معاملات را آغاز می کنند ، در جهت مخالف با مؤلفه گذرا از قیمت ها تجارت می کنند. بنابراین ، HFT ها به کشف قیمت کمک می کنند و به قیمت های کارآمد سهام کمک می کنند. Brogaard (استناد 2012) به طور مشابه می یابد که 68 ٪ از معاملات حداقل در یک طرف معامله HFT دارند و وی همچنین می یابد که نرخ مشارکت HFT برای سهام با قیمت های بالای سهم ، کلاه های بزرگ بازار ، پیشنهادات باریک - گسترش می یابد.، یا نوسانات کم ارزش سهام. وی یک مدل تأثیر قیمت دائمی وکتور خود را تخمین می زند و می یابد که تأمین کنندگان نقدینگی HFT با انتخاب نامطلوب کمتری نسبت به تأمین کنندگان نقدینگی غیر HFT روبرو هستند و نشان می دهد که آنها در تأمین نقدینگی تا حدودی قاطع هستند. Kirilenko و همکاران.. Benos and Sagade (استناد 2012) با استفاده از داده های عدالت در انگلستان ، تجزیه و تحلیل مشابهی را انجام می دهند. این مجموعه داده های مختلف بینش قابل توجهی در مورد رفتار کلی تجارت HFT ارائه می دهد.
یکی از اهداف مهم یادگیری استراتژی های معاملاتی معامله گران این است که بتوانیم شرکت کنندگان در بازار را دسته بندی و شناسایی کنیم و بتوانیم تأثیرات آنها را در رابطه با موضوعات مهم اقتصادی مانند توصیف های متعدد فرآیندهای شکل گیری قیمت، نقدینگی بازار و جریان سفارش درک کنیم. و غیره. ما ادعا می کنیم که درک پیشرفته از پیامدهای اقتصادی این استراتژی های معاملاتی الگوریتمی مختلف، شواهد کمی از ارزش را برای سیاست گذاران بازار و تنظیم کننده هایی که به دنبال حفظ شفافیت، انصاف و سلامت کلی در بازارهای مالی هستند، به همراه خواهد داشت.
به طور خاص ، معامله گران استراتژی های مختلف معاملاتی را مستقر می کنند که در آن هر استراتژی دارای یک گزاره ارزش منحصر به فرد تحت شرایط خاص بازار است. به عبارت دیگر ، ما می توانیم این مشکل را به عنوان یک مشکل تصمیم پی در پی در شرایط مختلف ارائه دهیم. بازرگانان قصد دارند تصمیمات خود را اضافه کاری بهینه کنند و در نتیجه پاداش خود را در شرایط مختلف بازار به حداکثر برسانند. ما از لحاظ نظری می توانیم از توابع پاداش استفاده کنیم تا سیستم ارزشی را که در استراتژی های مختلف تجارت مختلف محصور شده اند ، نشان دهند. می توان سیاست های جدید را بر اساس کارکردهای پاداش آموخته شده به دست آورد و آنها را در یک محیط جدید به کار برد تا یک روند جدید خودمختار را اداره کند. این فرایند به عنوان یادگیری پاداش تحت چارچوب یادگیری معکوس تقویت شده تعریف می شود (NG and Russel Citation 2000 ، Abbeel and Ng Citation 2004 ، Ramachandran and Amir Citation 2007). به عنوان مثال ، یک استراتژی ساده نگهدارنده یا کرکل برای خرید یک واحد ، معامله گر باید تصمیم بگیرد که چه موقع سفارش را صادر کند و چه زمانی سفارش را بر اساس شرایط بازار لغو کند ، که احتمالاً ممکن است به عنوان یک فرآیند تصادفی مشخص شود. با این حال ، گزاره ارزش برای معامله گر خرید یک واحد از امنیت با کمترین قیمت ممکن است. این می تواند از چند طریق تحقق یابد. می توان آن را به عنوان یک تابع پاداش توصیف کرد وقتی سیستم در یک وضعیت خاص قرار دارد ، معامله گر همیشه به دنبال پاداش ثابت است. این مفهوم گزاره ارزش ، معامله گر را سوق می دهد تا با توجه به شرایط بازار اقدامات مربوطه را انجام دهد. این در نهایت سیاست ها یا استراتژی های معامله گر را تشکیل می دهد. بنابراین ، یک استراتژی تحت یک گزاره ارزش خاص می تواند به طور مداوم در الگوریتم ها برنامه ریزی شود تا به هدف خود از خرید یک واحد به صورت بهینه برسد. در نتیجه ، استراتژی های توسعه یافته تحت چارچوب های ارزش خاص می توانند در یک محیط متفاوت مشاهده ، آموخته و حتی تکثیر شوند (مانند یک بازار مالی شبیه سازی شده که در آن می توان تأثیر این استراتژی ها را به راحتی ارزیابی کرد). همانطور که توسط یانگ و همکاران ثبت شده است.(استناد 2012) ، هایز و همکاران.(استناد 2012) و Paddrik و همکاران.(استناد 2012) ، استراتژی های الگوریتمی دستکاری یا مختل کننده را می توان توسط اپراتورهای بازار و تنظیم کننده ها برای جلوگیری از شیوه های تجارت ناعادلانه مورد مطالعه و نظارت قرار داد. علاوه بر این ، شیوه های تجارت جدید الگوریتمی در حال ظهور می تواند ارزیابی شود و مقررات و سیاست های جدید برای حفظ سلامت کلی بازارهای مالی قابل ارزیابی است.
در این مطالعه ، ما رفتار معاملاتی شرکت کنندگان در بازار مختلف را با راه حل یک فرآیند تصمیم معکوس مارکوف (MDP) الگوبرداری می کنیم. ما سعی می کنیم توصیف کنیم که چگونه معامله گران قادر به انجام اقدامات در یک محیط بسیار نامشخص هستند تا به اهداف بازگشت در افق های مختلف برسند. این کار را می توان با استفاده از برنامه نویسی پویا (DP) و یادگیری تقویت (RL) بر اساس MDP حل کرد. این مدل ترجیحات و انتظارات معامله گران از متغیرهای حالت نامشخص را تشکیل می دهد. در یک تنظیم کلی مدل سازی MDP ، ما این متغیرها را در دو فضا شرح می دهیم: فضای حالت و فضای عمل. از دیدگاه تصمیم گیری در مورد تجارت ، ما می توانیم با استفاده از توابع پاداش که به حالت و عمل بستگی دارد ، عوامل یادگیری را پارامتر کنیم. ما پویایی بازار را با توجه به اعتقادات ذهنی عوامل یادگیری در نظر می گیریم. نمایندگان DP/RL را از طریق چرخه حس ، آزمایش و یادگیری انجام می دهند. اول ، نمایندگان اطلاعات حالت را از ورودی حسی بدست می آورند. بر اساس وضعیت فعلی ، دانش و اهداف ، نمایندگان بهترین اقدام را پیدا کرده و انتخاب می کنند. با دریافت بازخورد جدید ، نمایندگان یاد می گیرند دانش خود را با هدف حداکثر رساندن پاداش مورد انتظار تجمعی خود به روز کنند. در فضای مشکل با ارزش گسسته و فضای عمل ، روشهای DP و RL از تکنیک های مشابهی استفاده می کنند که شامل الگوریتم های تکرار سیاست و تکرار ارزش (Sutton and Barto Citation 1998 ، Bertsekas Citation 2007) برای حل مشکلات MDP است. فرمالیسم برای حل مشکلات رو به جلو RL اغلب به رویکردهای مبتنی بر مدل و بدون مدل تقسیم می شود (Sutton and Barto Citation 1998 ، Daw et al. Citation 2005).
همانطور که توسط Abbeel و Ng (استناد 2004) تحت چارچوب یادگیری تقویت معکوس (IRL) قاب بندی شده است ، کل زمینه یادگیری تقویت بر اساس پیش فرض پایه گذاری شده است که عملکرد پاداش به جای سیاست ، موجزترین ، قوی ترین و قابل انتقال استکاربا این حال ، عملکرد پاداش اغلب برای برخی از وظایف در دنیای واقعی دشوار است ، بنابراین ممکن است مشکلات زیر بوجود بیاید: (1) ما هیچ تجربه ای برای مقابله با مشکل نداریم.(2) ما تجربه داریم اما نمی توانیم عملکرد پاداش را صریحاً تفسیر کنیم.(3) مشکلی که ما حل می کنیم ممکن است در تعامل با تصمیم گیرندگان مخالف باشد که تمام تلاش خود را برای مخفی نگه داشتن عملکرد پاداش انجام می دهند. به جای دسترسی به عملکرد پاداش واقعی ، مشاهده رفتار برخی از عوامل دیگر (معلم/متخصص) برای تعیین نحوه حل مشکل آسان تر است. از این رو ، ما انگیزه ای برای یادگیری از مشاهدات داریم. رویکردهای فنی برای یادگیری از مشاهدات به طور کلی در دو دسته گسترده Ratliff و همکاران قرار می گیرند.(استناد 2009). دسته اول ، به نام یادگیری تقلید ، تلاش می کند تا از یادگیری نظارت شده برای پیش بینی اقدامات مستقیم از مشاهدات ویژگی های محیط استفاده کند ، که در محیط بسیار نامشخص غیرقابل تحمل و آسیب پذیر است. دسته دوم مربوط به نحوه یادگیری عملکرد پاداش است که اهداف و ترجیحات عامل را در MDP مشخص می کند (NG و Russel Citation 2000).
IRL برای اولین بار در ادبیات یادگیری ماشین توسط NG و Russel (استناد 2000) در تدوین آن به عنوان یک مشکل بهینه سازی برای به حداکثر رساندن مجموع اختلافات بین کیفیت عمل بهینه و کیفیت عملکرد بعدی معرفی شد. الگوریتم های دیگر بر اساس این تقریب خطی از عملکرد پاداش ، در یادگیری کارآموزی توسعه یافته یا یکپارچه شده اند. ایده اصلی یادگیری کارآموزی با استفاده از IRL ، جستجوی راه حل های مختلط در فضایی از سیاست های آموخته با این هدف است که انتظار ویژگی تجمعی نزدیک به متخصص است (Abbeel and Ng Citation 2004 ، Syed et al. Citation 2008).
الگوریتم های دیگر نیز تحت چارچوب IRL توسعه یافته اند. یک رویکرد نظری بازی برای یادگیری کارآموزی با استفاده از IRL در زمینه یک بازی با مبلغ صفر دو نفره ایجاد شده است که در آن کارآموز یک سیاست را انتخاب می کند و محیط یک عملکرد پاداش را انتخاب می کند (Syed and Schapire Citation 2008). الگوریتم دیگر برای IRL ، تطبیق سیاست است ، که در آن عملکرد ضرر مجازات انحرافات از سیاست متخصص را مجازات می کند که با تنظیم پارامترهای توابع پاداش به حداقل می رسد (Neu و Szepesvari Citation 2007). حداکثر IRL آنتروپی در زمینه مدل سازی رفتارهای ناوبری و رانندگی در دنیای واقعی ارائه شده است (Ziebart et al. Citation 2008). الگوریتم های یادگیری کارآموزی با استفاده از IRL در واقع هدف بازیابی عملکرد پاداش نیست بلکه در عوض فقط به خط مشی بهینه مربوط می شوند. Ramachandran و Amir IRL را از منظر بیزی در نظر می گیرند بدون اینکه فرض تقریب خطی عملکرد پاداش را داشته باشند (Ramachandran and Amir Citation 2007). مدل آنها مشاهدات متخصص را به عنوان شواهدی که برای به دست آوردن توزیع خلفی بیش از پاداش با استفاده از زنجیره مارکوف مونت کارلو استفاده می شود ، تفسیر می کند. آثار نظری اخیر در مورد IRL مانند چارچوب MDP قابل حل خطی (Dvijotham and Todorov Catitation 2004) ، یادگیری بوت استرپ (بولریا و چایب استناد 2010) و ساخت ویژگی ها (لوین و همکاران استناد 2010) ، همچنین عملکرد یادگیری را بهبود بخشیده اندبشرIRL همچنین با موفقیت در بسیاری از مشکلات دنیای واقعی ، مانند کنترل اتوماتیک پرواز هلیکوپتر (Abbeel و همکاران استناد 2010) و کنترل حرکت یک سیستم انیمیشن در گرافیک رایانه (لی و زوران استناد 2010) استفاده شده است.
ما یک مدل IRL (GPIRL) مبتنی بر فرآیند گاوسی را که توسط QIAO و Beling (استناد 2011) پیشنهاد شده است ، برای یادگیری رفتارهای تجاری در شرایط مختلف بازار استفاده می کنیم. در این GPirl ، یک پیش از گاوسی بر عملکرد پاداش اختصاص داده می شود و عملکرد پاداش به عنوان یک فرآیند گاوسی رفتار می شود. این رویکرد شبیه به Ramachandran و Amir است (استناد 2007) ، که نمونه های عمل دولت را از نمایندگان به عنوان شواهدی که برای به روزرسانی یک مقدار قبلی در عملکرد پاداش ، تحت یک چارچوب بیزی استفاده می شود ، مشاهده می کنند. راه حل (Ramachandran and Amir Citation 2007) به بهینه سازی غیر Convex با استفاده از شبیه سازی زنجیره مارکوف مونت کارلو بستگی دارد. علاوه بر این ، ماهیت نادرست مشکل یادگیری معکوس نیز مشکلاتی را ایجاد می کند. توابع پاداش چندگانه ممکن است همان خط مشی بهینه را به همراه داشته باشد ، و با توجه به عملکرد پاداش واقعی ، ممکن است در یک حالت واحد مشاهدات متعدد وجود داشته باشد. مدل GPIRL با استفاده از نمودارهای استنباط بیزی و اولویت ، به ماهیت بد این مشکل رسیدگی می کند. در اینجا ، ما با چالش مدل سازی اقدام معامله گران به عنوان سیاست های غیر قطعی روبرو هستیم. به طور کلی ، سیاست های نماینده از مارکووی قطعی تا وابسته به تاریخ تصادفی ، بسته به نحوه عملکرد معامله گران اطلاعات گذشته و نحوه انتخاب معامله گران ، متغیر است. با توجه به عدم اطمینان از محیط و خطای تصادفی اندازه گیری در مشاهدات ، یک سیاست قطعی به احتمال زیاد می تواند به عنوان یک غیر تعیین کننده تلقی شود. مدل سازی عملکرد پاداش معامله گران با استفاده از یک فرآیند گاوسی برای رسیدگی به این مسائل مناسب است. یکی از اصلی ترین ویژگی های این رویکرد این است که نه تنها یک دیدگاه احتمالی را نشان می دهد بلکه از نظر محاسباتی نیز قابل ردیابی است.
ما یک فضای ویژگی کاملاً متفاوت را پیشنهاد می کنیم که با استنباط پارامترهای کلیدی یک مدل بهینه سازی پی در پی ساخته می شود که ما به عنوان یک جانشین برای فرآیند تصمیم گیری معامله گران می گیریم. ما عملکرد پاداش (یا عینی) را برای این فرایند از مشاهده اقدامات معاملاتی با استفاده از یک فرآیند از یادگیری ماشین که به عنوان یادگیری تقویت معکوس (IRL) شناخته می شود ، استنباط می کنیم.
پلتفرم معاملاتی فارکس...
ما را در سایت پلتفرم معاملاتی فارکس دنبال می کنید
برچسب :
نویسنده : مرجان محتشم
بازدید : <-PostHit->
تاريخ : دوشنبه
23 مرداد
1402 ساعت: 12:40