یادگیری آماری برای تجارت کلان شامل آموزش مدل ، اعتبار سنجی مدل و آزمایش روش یادگیری است. یک گردش کار ساده [1] فرم و پارامترهای مدل های معاملاتی را تعیین می کند ، [2] بهترین این مدل ها را بر اساس عملکرد خارج از نمونه انتخاب می کند ، و [3] ارزش روش یادگیری مستقر را بر اساس بیشتر ارزیابی می کندنتایج نمونهیک فناوری مناسب "گردش کار سته" است که بر اساس بسته های مرتب در R. وجود دارد. تمام اشیاء مرتبط را در یک جدول داده های واحد ، از جمله مدل ها و مجموعه داده های تو در تو ، ذخیره می کند و یادگیری آماری را از طریق برنامه نویسی عملکردی در آن جدول انجام می دهد. مراحل کلیدی [1] ایجاد مجموعه داده های نقطه به موقع است که اطلاعات موجود در یک تاریخ خاص را در گذشته نشان می دهد ، [2] تخمین انواع مدل های مختلف بر اساس مجموعه های آموزش اولیه قبل از هر نقطه در زمان ، [[3] ارزیابی این انواع مدل های مختلف بر اساس داده های اعتبار سنجی بعدی درست قبل از هر نقطه از زمان ، و [4] آزمایش روش یادگیری کلی بر اساس داده های آزمایش در هر نقطه از زمان.
این پست با خلاصه این سایت ها در مورد "روشهای کمی برای راندمان اطلاعات کلان" ، به ویژه بخش یادگیری آماری ارتباط دارد.
چرا تجارت کلان نیاز به یادگیری آماری دارد
یادگیری آماری به مجموعه ای از ابزارها برای مدل سازی و درک مجموعه داده های پیچیده اشاره داردبشریک گردش کار یادگیری آماری برای استراتژی های تجارت کلان ، دنباله ای از محاسبات مبتنی بر داده های گذشته است که اطلاعات معنی داری را برای تصمیمات تجاری اختیاری و منظم تولید می کند. اصطلاح "دنباله" نشان می دهد که ترتیب زمانی محاسبه بسیار مهم است. اگر گردش کار بسیار خودکار باشد ، به یک گردش کار یادگیری ماشین تبدیل می شود.
بر خلاف سایر زمینه های یادگیری آماری ، بیشتر استراتژی های تجارت کلان مبتنی بر مجموعه داده های محدود است ، به ویژه اگر به داده های کلان اقتصادی واقعی در چرخه های تجاری ، روند تورم ، ترازنامه های اقتصادی و موارد دیگر نیاز داشته باشند. بنابراین ، دانش در مورد بازارها ، درک اقتصاد کلان و درک خوبی از نظریه ریاضی اغلب از علم داده مهمتر است. با این حال،یادگیری آماری هنوز کارکردهای مهمی دارد ، به ویژه برای [1] مشخص کردن فرم و پارامترهای یک مدل معاملاتی ، [2] انتخاب کلاس مدل گسترده برای استراتژی تجارت ، و [3] بررسی اینکه چگونه روشهای یادگیری در مشخص کردن و انتخاب مدل ها مستقر شده استانجام می داددر تولید ارزش تجارت.
سه کارکرد یادگیری آماری برای استراتژی های معاملاتی با مراحل کلاسیک در یک گردش کار یادگیری آماری مطابقت دارد:آموزش مدل ، اعتبار سنجی مدل و آزمایش روشبشراین سه مرحله باید بر اساس مجموعه داده های مستقل باشد. نکته مهم این است که یک گردش کار یادگیری آماری به تطبیق فرایند سرمایه گذاری به طور مداوم با اطلاعات جدید ، که اغلب سریعتر و هموار از مداخله انسان است ، کمک می کند.
مبانی گردش کار سته مرتب برای r
Tidyverse مجموعه ای از بسته های R طراحی شده برای علوم داده استبشرهمه بسته ها یک فلسفه طراحی اساسی ، دستور زبان و ساختار داده را به اشتراک می گذارند. روشهای اساسی اصلی Tidyverse برای تجسم ، مدل سازی ، تحول ، مرتب سازی و واردات در کتاب آنلاین "R برای علم داده" توسط گرت گرولموند و هادلی ویکام (مشاهده اینجا) توضیح داده شده است.
گردش کار ستونی ستونی روشی برای استفاده از یادگیری ماشین در Tidyverse استبشرایجاد گردش کار تو در تو در تو در تو را آسان می کند و اجازه می دهد تا تمام اشیاء مرتبط را در یک قاب داده واحد نگه دارید. مبنای این گردش کار Tibble ، نوعی قاب داده است که برای برنامه های علوم داده بهینه شده است. یکی از ویژگی های یک Tibble این است که سلول های آن نه تنها حاوی اشیاء ساده مانند اعداد ، منطقی یا رشته ها هستند ، بلکه لیست ها و اشیاء پیچیده ای را نیز دارند که به صورت لیست ذخیره می شوند. این موارد شامل سایر فریم ها و مدل های داده است. ستون هایی که چنین اشیاء لیستی را ذخیره می کنند ، ستون های لیست نامیده می شوند. اگر یک قاب داده قاب داده دیگری را در سلول های خود ذخیره کند ، آن را یک قاب داده تو در تو نامیده می شود.

ستونهای لیست اجازه کار با بسیاری از مدل ها و مجموعه داده ها را در داخل یک Tibble از طریق برنامه نویسی کاربردی انجام می دهندبشرعملکردی تابعی است که عملکردهای دیگر را به عنوان آرگومان می گیرد. Tidyverse عملکردهای بسته "Purr" را ترجیح می دهد تا توابع را در لیست مجموعه های داده یا لیست مدل ها اعمال کند. به طور خلاصه ، گردش کار لیست رنگ از Tidyverse در سه مرحله کار می کند: [1] ساختار یک ستون با ستون های لیست مناسب ، [2] با استفاده از `purrr :: map ()` ، با ستون های لیست کار می کند.`purrr :: map2 ()` یا توابع مشابه ، و [3] برخی از ستونهای لیست حاصل را با استفاده از `tidyr :: uest ()` یا مستقیم استفاده از توابع نقشه خاص خروجی ، مانند `purrr :: map_dbl () ساده کنید.`


دراطلاعات ذخیره شده در اشیاء مدل در R می تواند برای انجام تجزیه و تحلیل یا محاسبات بعدی مانند پیش بینی ها استفاده شودبشربسته "Broom" توابع را ارائه می دهد که اطلاعات کلیدی در مورد اشیاء آماری را در تیببل های مرتب استخراج می کند. سه کارکرد به ویژه مفید است: [1] `جارو :: tidy ()` عملکرد اطلاعات مربوط به اجزای یک مدل ، مانند برآورد ضریب و آمار t ، [2] `جارو :: نگاه ()` عملکرد را استخراج می کند. یک تیبل را دقیقاً با یک ردیف خلاصه مدل ، به طور معمول خوبی از اقدامات مناسب ، مقادیر p برای آزمایش فرضیه در باقیمانده ها ، یا اطلاعات همگرایی مدل ، و [3] `جارو :: افزایش ()` یک شیء مدل می پذیرد و یک شیء مدل می پذیرد ویک مجموعه داده و یک قاب داده را با سری پاسخ ، توضیحی ، مجهز و باقیمانده باز می گرداند و می تواند داده های جدیدی را برای پیش بینی ها بگیرد.
گردش کار ستونی لیست به ویژه برای آن مفید استاعتبار سنجی متقابل ، یک روش آماری که به طور گسترده برای ارزیابی مهارت مدل های یادگیری ماشین استفاده می شودبشراعتبار سنجی متقاطع نیاز به جداسازی یک نمونه داده به سه بخش دارد ، یکی به منظور اتصالات مدل (نمونه آموزش اصلی) ، دیگری برای ارزیابی و انتخاب مدل (نمونه اعتبار سنجی) و دیگری برای ارزیابی روش گسترده (نمونه آزمایش). کامپوزیت داده های اصلی آموزش و داده های اعتبار سنجی در این پست نمونه آموزش گسترده ای نامیده می شود.
داده های آموزش گسترده به طور معمول برای انتخاب مناسب ترین مدل استفاده می شودبشربرای این منظور مجموعه داده های آموزش گسترده باید به یک مجموعه آموزش اصلی و یک مجموعه اعتبار سنجی تقسیم شود. از مجموعه آموزش اصلی برای متناسب با مدل های مختلف استفاده می شود. از مجموعه اعتبار سنجی برای ارزیابی مدل های متناسب "خارج از نمونه" استفاده می شود. اعتبار سنجی با یک مجموعه مجزا امکان ارزیابی چگونگی انجام مدل های انجام شده از منظر آمار مختلف را فراهم می کند ، بدون اینکه توسط نمونه آموزش اصلی یا آلوده کردن نمونه آزمایش نهایی آلوده شود.
در یک مرحله آخر ، مدل "بهترین" انتخاب شده می تواند بر اساس داده های آزمون بدون مراقبت تاکنون ارزیابی شود.در اینجا آزمایش ارزیابی روش شناسی (مشخص کردن و انتخاب مدل ها) به جای یک مدل خاص استبشراین مرحله آخر دو مرحله دارد. اول ، بهترین مدل بر اساس داده های کامل آموزش گسترده تخمین زده می شود. سپس آمار عملکرد آن با استفاده از مدل تخمین زده شده در داده های آزمون حاصل می شود.نتیجه ضعیف در ارزیابی آزمون نهایی لزوماً به معنای این نیست که یک ایده استراتژی تجارت هیچ ارزشی ندارد.غالباً فقط نشان می دهد که کار بیشتری باید با تدوین نظریه اساسی انجام شود. همچنین ، تعداد آزمایش های ضعیف ممکن است به دلیل اعتبارسنجی نامعتبر باشد ، به عنوان مثال نادیده گرفتن خصوصیات سری زمانی مانند همپوشانی افق های جستجوگر یا آمار عملکرد نامناسب ، مانند همبستگی به جای دقت برای استراتژی هایی که سیگنال های آنها هیچ پیامدهای متناسب ندارند.
ساختار داده به موقع
داده های نقطه به زمان با تاریخ های خاص همراه هستند و دقیقاً مقادیر موجود در تاریخ مربوطه را دارند. آن ها هستندمانند عکسهای فوری از مجموعه های اطلاعاتی که در گذشته در دسترس بودند ، قبل از تجدید نظر بعدی یا تغییر در کنوانسیون هابشرداده های نقطه به موقع با داده های زنده مخالف هستند ، همانطور که توسط اکثر فروشندگان داده ارائه شده است و ممکن است حاوی تجدید نظر ، پسوندها و محاسبات مجدد باشد. برای هدف خاص شبیه سازی واقع بینانه پیش بینی های گذشته داده های نقطه به موقع آموزنده تر هستند. این درست است به خصوص اگر از داده های اقتصادی واقعی استفاده شود ، که اغلب در معرض تجدید نظر های بزرگ و مکرر قرار می گیرند.
داده های نقطه به موقع برای استراتژی های تجارت کلان به یک ساختار داده خاص نیاز دارند که در آن تاریخ کامل گذشته موجود (یعنی یک قاب داده) در هر تاریخ مربوطه ذخیره می شود. به راحتی ، می توان وضعیت داده های نقطه تاریخی به موقع را با استفاده از یک امتیاز در زمان به موقع خلاصه کرد. فریم های داده های سری زمانی معمولی یک شماره را در یک نقطه از زمان ضبط می کنند. Tibble Points-in Tibble تاریخچه کامل داده های موجود را در یک نقطه خاص از زمان ثبت می کند. مثال ساده زیر یک قاب داده های سری زمانی (XTS) را که در هر ماه ماه ذخیره شده است ، یک امتیاز در زمان را نشان می دهد.
dv. all

آموزش و اعتبار سنجی
اعتبار سنجی به این معنی است که ما از عملکرد پیش بینی خارج از نمونه (به جای تناسب در نمونه) به عنوان پایه ای برای انتخاب یک مدل پیش بینی استفاده می کنیم. این فرآیند می تواند به طور مشابه با یک روش یادگیری در نمونه گسترده تر اعمال شود ، جایی که فرم یا نوع مدل به صورت درون زا تعیین می شود. از این رو اعتبارسنجی پایه ای برای انتخاب مدل نقطه به موقع یا انتخاب روش گسترده تر است. در یک زمینه سری زمانی ، اعتبار سنجی متقاطع برای هر مجموعه داده به موقع با توجه به کلیه مدل ها/روش های مورد نظر انجام می شود.
برای اعتبارسنجی متقابل ، ابتدا توالی نورد از تقسیم اعتبارسنجی آموزش از مجموعه آموزش گسترده ایجاد می کند. برای هر مجموعه داده تاریخ یک دنباله تقسیم وجود خواهد داشت. عملکرد rsample :: rolling_origin () چنین شکاف هایی را برای نقاط داده ایجاد می کند که مقادیر متوالی هستند. براساس اصل کارآیی اطلاعات ، نمونه های اصلی آموزش باید تمام مشاهدات تاریخی تا تاریخ تقسیم باشد. نمونه اعتبارسنجی فقط باید یک تاریخ پس از تقسیم باشد. تاریخ قبل از تقسیم از حداقل پنجره اولیه تا تاریخ پیش فرض موجود می چرخد.
در مثال ساده زیر ، Tibble نقطه به زمان توسط یک ستون لیست از تیببل های تقسیم شده (tbl. sps) گسترش می یابد. هر Tibble تقسیم شده حاوی دنباله ای از شکاف ها است ، که در آن قسمت آموزش اصلی تقسیم از حداقل تا بزرگترین ممکن است. تاریخ بعدی ، دنباله تقسیمات مرتبط با تاریخ طولانی تر است ، مگر اینکه حداکثر تاریخ تعیین شده باشد.
tbl. Als ٪ جهش ( # ایجاد لیست تیببل های تقسیم اعتبار سنجی قطار: tbl. sps = نقشه (. x = xdm. irs ،~rolling_origin (. x ، اولیه = 72 ، ارزیابی = 1))) tbl. als tbl. als $ tbl. sps[[1]] # split tibble


بر اساس این تقسیمات ، نمونه های آموزش و اعتبار سنجی را می توان با توابع rsample :: training () و rsample :: تست () استخراج کرد. برای هر مجموعه داده به موقع ما یک "دنباله نورد" از مجموعه های آموزشی (tbn. t) و مجموعه های اعتبار سنجی (tbn. val) را مستقر می کنیم. میانگین عملکرد مدل ها در مجموعه های اعتبار سنجی پایه و اساس انتخاب مدل ترجیحی برای زمان مربوطه خواهد بود.
در زیر ما فرایند اعتبار سنجی را برای یک مجموعه داده به موقع نشان می دهیم. اول ، توالی مجموعه های آموزش و اعتبار سنجی به عنوان تیببل های پانل استخراج می شوند. سپس آموزش دو مدل پیش بینی مختلف بر روی دنباله مجموعه های آموزش نقشه برداری می شود. این یک مدل آموزش دیده یا مناسب برای هر تقسیم بر اساس داده های آموزشی مربوطه ایجاد می کند. Tibble تقسیم شده گسترده ، که فقط یک سلول در Tibble اصلی است ، اکنون گسترش یافته است که شامل مجموعه ها و مدل های داده است.
tbl. sps ٪ جهش ( # ایجاد ستون لیست با آموزش اصلی DF برای هر تقسیم: tbn. t = نقشه (تقسیم ،~as. tbl (stackpanel (آموزش (. x) ، cids = id. irs ، cats = cat. irs))) ، # ایجاد ستون لیست با اعتبار سنجی df برای هر تقسیم tbn. val = نقشه (تقسیم می شود ،~as. tbl (stackpanel (تست (. x) ، cids = id. irs ، cats = cat. irs))) ، mod1 = map (. x = tbn. t ،~LM (فرمول = as. formula ("IRS5_XR~bbr + res ") ، data = na. omit (. x)) ، mod2 = map (. x = tbn. t ،~LM (فرمول = as. formula ("IRS5_XR~Bbr + res + emg3ma ") ، data = na. omit (. x)))) tbl. sps

توالی متناسب از مدل های نامزد سپس برای پیش بینی بر اساس نمونه های اعتبار سنجی یک دوره استفاده می شود. سپس برای هر اعتبار سنجی عملکرد پیش بینی ها (در اینجا یک پیش بینی در هر مقطع یک پانل) در برابر مقادیر واقعی اندازه گیری می شود (در اینجا بازده می شود). در این حالت این به سادگی بر اساس نسبت ضربه مقطعی اندازه گیری می شود.
tbl. spp ٪ جهش ( # تمام پیش بینی های مقطعی مدل 1 را برای هر قطعه اعتبار سنجی محاسبه کنید: v. pred1 = map2 (. x = mod1 ، . y = tbn. val ،~پیش بینی (. x ، na. omit (. y))) ، # تمام پیش بینی های مقطعی مدل 2 را برای هر قطعه اعتبار سنجی محاسبه کنید: v. pred2 = map2 (. x = mod2 ، . y = tbn. val ،~پیش بینی (. x ، na. omit (. y)) ، # مقادیر مقطعی واقعی (بازده) را برای هر قطعه اعتبار سنجی استخراج کنید: v. actual = نقشه (tbn. val ،~na. omit (. x) $ irs5_xr) ، # نسبت ضربه مقطعی از مدل 1 برای هر قطعه اعتبار سنجی: hr1 = map2_dbl (. x = v. pred1 ، . y = v. actual ،~میانگین (علامت (. x) == علامت (. y))) ، # نسبت ضربه مقطعی از مدل 1 برای هر قطعه اعتبار سنجی: HR2 = MAP2_DBL (. x = v. pred2 ، . y = v. actual ،~میانگین (علامت (. x) == علامت (. y))) tbl. spp

تمام عملیات موجود در مجموعه داده های نقطه به زمان می تواند با استفاده از عملکردهای Purrr :: MAP ، بر روی Tibble Points انجام شود ، همانطور که در زیر برای یک مثال بسیار ساده نشان داده شده است. چنین کدی مختصر است اما به معنای حلقه های تو در تو است و می تواند برای اجرای آن زمان ببرد. برای به روزرسانی مجموعه داده ها ، نتایج گذشته باید ذخیره و بارگیری شود.
map_all ٪ جهش (tbn. t = نقشه (تقسیم ،~as. tbl (stackpanel (آموزش (. x) ، cids = id. irs ، cats = cat. irs))) ، tbn. val = نقشه (تقسیمات ،~as. tbl (stackpanel (تست (. x) ، cids = id. irs ، cats = cat. irs))) ، mod1 = map (. x = tbn. t ،~LM (فرمول = as. formula ("IRS5_XR~bbr + res ") ، data = na. omit (. x)) ، mod2 = map (. x = tbn. t ،~LM (فرمول = as. formula ("IRS5_XR~bbr + res + emg3ma ") ، data = na. omit (. x)) ، v. pred1 = map2 (. x = mod1 ، . y = tbn. val ،~پیش بینی (. x ، na. omit (. y)) ، v. pred2 = map2 (. x = mod2 ، . y = tbn. val ،~پیش بینی (. x ، na. omit (. y)) ، v. actual = map (tbn. val ،~na. omit (. x) $ irs5_xr) ، hr1 = map2_dbl (. x = v. pred1 ، . y = v. actual ،~میانگین (علامت (. x) == علامت (. y))) ، hr2 = map2_dbl (. x = v. pred2 ، . y = v. actual ،~mean(sign(.x) == sign(.y))) )>tbl. alx ٪ # Shorten df برای صرفه جویی در زمان اجرا جهش (tbl. sps = نقشه (. x = tbl. sps ، map_all) # هر عنصر ستون لیست (زمان فشرده) را گسترش می دهد) tbl. alx tbl. alx $ tbl. sps[[3]]

آزمایش کردن
آزمایش در اینجا به معنای ارزیابی عملکرد روش گسترده و هایپرپارامترها برای ساخت و سازهای پی در پی و انتخاب مدل ها است. درست در مورد آموزش و اعتبار سنجی مدل ، تقسیم به روش انتخاب/آموزش و آزمایش برای هر نقطه از زمان فقط از آخرین دوره برای آزمایش و تمام دوره های قبلی برای آموزش استفاده می کند. تفاوت ها این است که [1] اکنون یک دوره زمانی دیگر داریم که برای آزمایش رزرو شده است و [2] فقط مدل انتخاب شده بر اساس مجموعه داده های گسترده آموزش گسترده آموزش داده می شود.
انتخاب مدل معمولاً با توجه به میانگین عملکرد پیش بینی کلیه مجموعه های اعتبار سنجی قبل از آن نقطه از زمان انجام می شود. در مثال حاضر ، این به سادگی یک نسبت متوسط سطح مقطعی است. میانگین می تواند قبل از آخرین یا [2] مجموعه های اعتبار سنجی نهایی از تمام نقاط در زمان قبل از آخرین ، به طور متوسط یا [1] گرفته شود. اگر داده های اصلاح شده برای انتخاب مدل بهتر باشند و دومی در صورتی که داده های غیرقابل توصیف به عنوان مناسب تر دیده شوند ، مورد اولی است.
tbl. alt ٪ جهش ( # ایجاد شکاف برای آموزش نهایی/مجموعه تست تقسیم = نقشه (. x = xdm. irs ،~IRIAND_TIME_SPLIT (. x ، prop = (nrow (. x) - 1) / nrow (. x))) ، # تیببل آموزش پانل: tbn. t = map (. x = تقسیم ،~as. tbl (stackpanel (آموزش (. x) ، cids = id. irs ، cats = cat. irs))) ، # تست پانل تیببل ها: tbn. tst = نقشه (. x = تقسیم ،~as. tbl (stackpanel (تست (. x) ، cids = id. irs ، cats = cat. irs))) ، # عملکرد متوسط مدل 1: hr1 = map_dbl (. x = tbl. sps ،~میانگین (. x $ hr1 ، na. rm = t)) ، # عملکرد متوسط مدل 2: hr2 = map_dbl (. x = tbl. sps ،~میانگین (. x $ hr2 ، na. rm = t)) ، # اختلاف نسبت ضربه به عنوان پایه برای انتخاب مدل: HRD12 = HR1-HR2 ، # نقطه انتخاب مدل: mod = map2 (. x = tbn. t، . y = hrd12 ،~LM (فرمول = as. formula (ifelse (. y ، "IRS5_XR~bbr + res "،" irs5_xr~Bbr + res + emg3ma ")) ، data = na. omit (. x)) ، # بازده واقعی نمونه آزمون: v. acts = نقشه (. x = tbn. tst ،~. x $ irs5_xr) ، # بازده پیش بینی شده نمونه آزمایش: v. pred = map2 (. x = mod ، . y = tbn. tst ،~پیش بینی (. x ، . y)) ، # نسبت ضربه تست: HR = MAP2_DBL (. x = v. pred ، . y = v. acts ،~میانگین (علامت (. x) == علامت (. y) ، na. rm = t)))
Tibble نقطه به موقع اکنون برای هر تاریخ مجموعه آموزش گسترده (tbn. t) ، مجموعه آزمون (tbn. tst) ، میانگین نسبت ضربه مجموعه های اعتبار سنجی برای مدلهای 1 و 2 (HR1 ، HR2) ،تفاوت بین اینها به عنوان پایه برای انتخاب مدل (HRD12) ، مدل انتخاب شده (MOD) ، بردار بازده واقعی مجموعه آزمون (V. ACTS) ، بردار بازده پیش بینی شده از مجموعه آزمون (V. PRED) ونسبت ضربه مقطعی مجموعه آزمایش (HR). میانگین نسبت های HIT TEST در طول زمان ، پایه و اساس عادلانه ای از ارزیابی روش است.
tbl. alt میانگین (tbl. alt $ hr)
تجارت گزینه های دودویی در ایران...
ما را در سایت تجارت گزینه های دودویی در ایران دنبال می کنید
برچسب :
نویسنده : زینالعابدین مراغهای
بازدید : <-PostHit->
تاريخ : دوشنبه
2 مرداد
1402 ساعت: 15:53