روشهای نزول شیب برای شبکه های عصبی فازی نوع 2
Erdal Kayacan ، Mojtaba Ahmadieh Khanesar ، در شبکه های عصبی فازی برای برنامه های کنترل زمان واقعی ، 2016
5. 2. 5 الگوریتم GD با یک اصطلاح حرکت
یکی دیگر از راه حل های احتمالی برای کاهش خطر بی ثباتی ، استفاده از یک اصطلاح حرکت است. الگوریتم GD با اصطلاح حرکت به شرح زیر تعریف شده است:
(5. 26) Δ x (k) = x (k + 1) - x (k) = - α ∂ f (x (k)) ∂ x (k) + β Δ x (k - 1)
برای دیدن اینکه چگونه اصطلاح حرکت در الگوریتم آموزش تأثیر می گذارد ، تجزیه و تحلیل در اینجا انجام می شود. اگر در نظر بگیریم که X یک متغیر یک بعدی است ، می توانیم از z-transform Δ x (k) استفاده کنیم ، به طوری که معادله زیر مشتق شده است:
(5. 27) Δ x (z) = - α ∂ f (x (k)) ∂ x (k) + z - 1 β Δ x (z) (5. 28) Δ x (z) = - α ∂ f (x (k)) ∂ x (k) 1 - β z - 1
که در آن 1 1-β Z-1 به عنوان یک فیلتر کم گذر عمل می کند که فیلتر می شود-α ∂ f (x (k)) ∂ x (k) و نوسانات را در x (k) به طور قابل توجهی کاهش می دهد. علاوه بر این ، برای داشتن یک فیلتر پایدار ، مقدار β باید به عنوان 0 انتخاب شود<β <1.
بیشتر بخوانید URL: https://www. sciencedirect. com/science/article/pii/b9780128026878000050
مدل شبکه عصبی برای سیستم های مدیریت پسماندهای بیولوژیکی
پارامترهای داخلی شبکه و ارزیابی عملکرد
(18. 5) r = ∑ (x - x ¯) (y - y ¯) ∑ ((x - x ¯) 2) ∑ ((y - y ¯) 2)
اثرات پارامترهای شبکه داخلی مانند تعداد نورون ها در لایه پنهان (nH) ، تعداد آموزش (tc) ، میزان یادگیری (η) ، و اصطلاح حرکت (μ) در توانایی پیش بینی شبکه با استفاده از 2 K طراحی کامل فاکتوریل مورد بررسی قرار گرفت. ضریب تعیین (R 2) بین مقادیر آزمایش و پیش بینی شده به عنوان یک شاخص تخمین خطا برای ارزیابی صحت مدل ها استفاده شد. R 2 مربع ضریب همبستگی است که در Eq شرح داده شده است.(18. 5). پیکربندی شبکه با ارائه بهترین مقدار R 2 در مجموعه داده های تست برای پیش بینی پارامترهای عملکرد در مجموعه آزمون انتخاب شد ، جایی که و x و y مقادیر تجربی و پیش بینی شده مدل هستند و x ¯ و y ¯ میانگین ارزش آن هستندبه ترتیب نمونه ها.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780323855976000100
روشهای بهینه سازی اساسی برای یادگیری ماشین
Ranjana Dwivedi ، Vinay Kumar Srivastava ، در مدل سازی آماری در یادگیری ماشین ، 2023
12. 2. 3. 1 حرکت
روش حرکت [11] مبتنی بر مفهوم مکانیک است که اینرسی اشیاء را شبیه سازی می کند. این روش به SGD کمک می کند تا در جهت مناسب تسریع کند و نوسانات را در جهت انحنای بالا با ترکیب شیب ها با علائم متضاد تضعیف کند. Momentum تأثیر جهت به روز شده قبلی را در تکرار بعدی ذخیره می کند. این امر باعث می شود تا در جهت قبلی ادامه یابد. روش حرکت متغیر V را معرفی می کند که نمادی از جهت و سرعت حرکت پارامتر است. با در نظر گرفتن یک اصطلاح حرکت بین 0 تا 1 به همراه نزول شیب ، SGD را در جهت مربوطه تسریع می کند. اصطلاح حرکت با بروزرسانی قبلی ضرب می شود و یک عامل اصطکاک را ارائه می دهد. از نظر ریاضی ، V به صورت تدوین شده است
(12. 10) v t = γ v t - 1 - η ∇ θ f (θ)
اصطلاح γ V t - 1 ضریب اصطکاک را می دهد ، به افزایش بیشتر سرعت کمک می کند زیرا γ کمتر از 1 است. تغییر وزن می تواند بیان شود
(12. 11) Δ W T = γ Δ W T - 1 - η ∇ θ f (θ)
پارامتر به روز می شود
(12. 12) θ (l + 1) = θ (l) - v t
یک اصطلاح حرکت مناسب نقش مهمی در سرعت بخشیدن به همگرایی با نرخ یادگیری پایین دارد. مدت حرکت برای آن دسته از شیب ها که به موازات جهت قبلی هستند افزایش می یابد و بنابراین سرعت قبلی می تواند جستجو را سرعت بخشد. برای ابعادی که شیب آنها جهت را تغییر می دهد ، مدت حرکت به روزرسانی ها را کاهش می دهد و سرعت جستجو را کاهش می دهد. در طی فرایند آموزش ، لازم است از حداقل محلی دور شویم تا بتوانیم همگرایی سریعتر به دست آوریم [12]. اصطلاح حرکت در روش حرکت نیز نقش مهمی در کاهش نوسانات همگرایی دارد. انتخاب یک اصطلاح مناسب حرکت یک کار چالش برانگیز است. با اصطلاح کوچک حرکت ، دستیابی به سرعت همگرایی سریعتر دشوار است. برای اصطلاح بزرگ ، نکته اخیر ممکن است از ارزش بهینه خارج شود. در مطالعات مختلف تأیید شده است که ارزش مناسب اصطلاح حرکت 0. 9 است [1].
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780323917766000051
بهینه سازی محدب
Yuanming Shi ،. یونگ ژو ، در هوش مصنوعی Edge Edge ، 2022
3. 1. 6 روش شیب تسریع شده
نزول شیب بر بهبود هزینه در هر تکرار متمرکز است ، که ممکن است گاهی اوقات خیلی کوتاه بینانه باشد. بنابراین ما می توانیم از اطلاعات تاریخ (یعنی تکرار گذشته) سوء استفاده کنیم و بافر (مانند حرکت) اضافه کنیم تا یک مسیر صاف به دست بیایند.
ما مشکل بهینه سازی ساده زیر را در نظر می گیریم:
(3. 24) x ∈ R n f (x) را به حداقل برسانید ،
جایی که f (x) قابل تغییر است.
به روزرسانی روش توپ سنگین می تواند به صورت ارائه شود
(3. 25) x t + 1 = x t - η t ∇ f (x t) + θ t (x t - x t - 1) ،
جایی که θ t (x t - x t - 1) اصطلاح حرکت است ، که اینرسی را به "توپ" اضافه می کند (یعنی شامل یک اصطلاح حرکت) برای کاهش زیگزاگگینگ است.
علاوه بر این ، ایده نستروف بین به روزرسانی های شیب و برون یابی مناسب متناوب است ، جایی که هر تکرار تقریباً همان هزینه نزول شیب را می گیرد [4]. شایان ذکر است که این یک روش نزول نیست (یعنی F (x t + 1) ≤ f (x t) ممکن است نگه ندارد) و فرمول بروزرسانی را می توان به عنوان بیان کرد
(3. 26) x t + 1 = y t - η t ∇ f (y t) ، (3. 27) y t + 1 = x t + 1 + t t + 3 (x t + 1 - x t).
شایان ذکر است که ضریب حرکت Nesterov T T + 3 = 1 - 1 T برای دستیابی به عملکرد عالی مشخص شده است.
علاوه بر این ، برای مدل های کامپوزیت به عنوان مشکل (3. 20) ، الگوریتم سریع انقباض تکراری (FISTA) به عنوان توسعه یافته است
(3. 28) x t + 1 = prox η t h (y t - η t ∇ f (y t)) ، (3. 29) y t + 1 = x t + 1 + θ t - 1 θ t + 1 (x t + 1 - x t) ،
جایی که y 0 = x 0 ، θ 0 = 1 ، و θ t + 1 = 1 + 1 + 4 θ t 2 2 [5]. الگوریتم FISTA ضرایب حرکت را که در ابتدا توسط نستروف پیشنهاد شده است ، اتخاذ می کند.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780128238172000127
شبکه های عصبی حلقوی
3. 3. 3. 2 بهینه ساز
قانون به روزرسانی استاندارد Eq.(3. 22) به طور معمول با یک نسخه اصلاح شده جایگزین می شود. قوانین مختلف به روزرسانی بهینه ساز گفته می شود و بهینه سازهای متداول می توانند در شکل کلی زیر شرح داده شوند:
(3. 26) θ t + 1 = θ t - η m t s t ،
جایی که هر دو m t و s t برخی از کارکردها از شیب خطا در تمام مراحل زمان تاکنون هستند ∇ θ e 1 ،. بشربشر، ∇ θ e t. توجه داشته باشید که همچنین SGD اساسی را می توان با این شکل کلی با تنظیم m t = ∇ θ e t و s t = 1 توصیف کرد. فرمول برخی از بهینهای مشهور در جدول 3. 6 ارائه شده است ، که در آن تمام اصطلاحات β هاپرپارامترهای اضافی هستند و ϵ یک مقدار کوچک است که به طور معمول به ترتیب 10-8 تنظیم می شود تا از هرگونه تقسیم صفر جلوگیری شود.
جدول 3. 6. بهینه سازهای مشترک
| فرم عمومی: θ t + 1 = θ t - η m t s t |
| SGD | مگسحرف = ∇θاشمیهحرف | حرفحرف = 1 |
| SGD با حرکت | m t = β η m t - 1 + ∇ θ e t m t = m t | حرفحرف = 1 |
| حرکات | مگسحرف = ∇θاشمیهحرف | s t = ∑ i = 1 t ∇ θ 2 e i s t = s t + ϵ |
| rmsprop | مگسحرف = ∇θاشمیهحرف | s t = β s t - 1 + (1 - β) ∇ θ 2 e t s t = s t + ϵ |
| آدم | m t = β 1 m t - 1 + (1 - β 1) ∇ θ e t m ˆ t = m t 1 + β 1 t m t = m ˆ t | s t = β 2 s t - 1 + (1 - β 2) ∇ θ 2 e t s ˆ t = s t 1 + β 2 t s t = s ˆ t + ϵ |
بهینه سازان با یک اصطلاح M T اصلاح شده معمولاً از یک اصطلاح حرکت استفاده می کنند. به عنوان حرکت بدنی ، اصطلاح حرکت ، نزول شیب را به سمت جهت های غالب تسریع می کند و نوسانات را از جهات دیگر کاهش می دهد. SGD با حرکت [50] همچنان یکی از بهترین بهینه سازان برای CNN ها است ، در حالی که با تنظیم مناسب نرخ یادگیری در طول آموزش ترکیب می شود.
اصطلاح S T را می توان به عنوان یک عامل مقیاس گذاری برای نرخ یادگیری دانست. این امکان را برای داشتن نرخ یادگیری متفاوت برای پارامترهای مختلف و همچنین تنظیم خودکار نرخ یادگیری با ادامه آموزش فراهم می کند. یک ADAGRAD بهینه ساز تطبیقی اولیه ADAGRAD [14] مجموع مربع های تمام شیب ها را تا تکرار فعلی جمع می کند و از ریشه مربع خود برای تقسیم نرخ یادگیری اصلی استفاده می کند. از آنجا که تمام مقادیر مثبت هستند ، مبلغ در حال رشد است ، که در نهایت سرعت یادگیری را بسیار ناچیز می کند. این به طور موثری مانع از یادگیری بیشتر می شود. برای جلوگیری از این پدیده ، در RMSProp Optimizer [26] ، این مبلغ با میانگین متحرک نمایی جایگزین شد ، که وزن بیشتری به مقادیر اخیر می بخشد.
احتمالاً متداول ترین بهینه ساز برای CNN ها آدم است [35] ، که ایده حرکت و میزان یادگیری تطبیقی RMSProp را ترکیب می کند. با این حال ، در حالی که آدم تا حدودی نرخ یادگیری را به طور خودکار و بهتر از SGD با حرکت تطبیق می دهد ، هنگامی که از نرخ یادگیری ثابت استفاده می شود ، تنظیم دستی یادگیری در طول آموزش معمولی است (به بخش 3. 3. 5. 1 مراجعه کنید) - همچنین با آدم. نتایج متغیر هنگامی که با تکنیک های مختلف سازگاری نرخ یادگیری همراه است ، منجر به بحث و جدال [65،46] در مورد اینکه آیا نرخ یادگیری تطبیقی واقعاً کمک می کند یا فقط بار محاسباتی غیر ضروری را به همراه دارد و حتی به عملکرد آسیب می رساند.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b97803238571000087
انتشارات توصیه شده
نماد اطلاعات مجله مجله مجله مجله
طبقه بندی کننده های غیرخطی
Sergios Theodoridis ، Konstantinos Koutroumbas ، در تشخیص الگوی (چاپ چهارم) ، 2009
4. 7 تغییرات در موضوع backpropagation
هر دو نسخه از طرح backpropagation - دسته و حالت های الگوی - از ضرر کلیه روشهای ساخته شده در رویکرد نزول شیب: همگرایی آنها به عملکرد هزینه حداقل کند است. ضمیمه C در مورد این واقعیت بحث می کند که اگر مقادیر ویژه ماتریس هسیایی مربوطه گسترش زیادی داشته باشد ، این صفت برجسته تر می شود. در چنین مواردی ، تغییر شیب عملکرد هزینه بین مراحل تکرار پی در پی صاف نیست بلکه نوسان است و منجر به همگرایی کند می شود. یکی از راه های غلبه بر این مشکل استفاده از یک اصطلاح حرکت است که رفتار نوسان را صاف می کند و همگرایی را سرعت می بخشد. الگوریتم backpropagation با اصطلاح حرکت شکل می گیرد
(4. 24) Δ W J r (جدید) = α Δ W J r (قدیمی) - μ ∑ i n Δ J r (i) y r - 1 (i) (4. 25) W J R (جدید) = W J R (قدیمی) + Δ W J R (جدید)
در مقایسه با (4. 4) ، می بینیم که بردار تصحیح Δ W rjنه تنها به اصطلاح شیب بلکه به ارزش آن در مرحله تکرار قبلی نیز بستگی دارد. α ثابت عامل حرکت نامیده می شود و در عمل بین 0. 1 تا 0. 8 انتخاب می شود. برای دیدن تأثیر فاکتور حرکت ، اجازه دهید اصطلاح تصحیح را برای تعدادی از مراحل تکرار پی در پی بررسی کنیم. در مرحله تکرار ما
(4. 26) Δ W J R (t) = α Δ W J R (T - 1) - μ G (t)
جایی که آخرین اصطلاح شیب را نشان می دهد. برای کل مراحل تکرار پی در پی ما به دست می آوریم
(4. 27) Δ W J r (t) = - μ ∑ t = 0 t - 1 α t g (t - t) + α t Δ w j r (0) Δ W J R (T) ≃ - μ (1 + α + α 2 + α 3 +…) G = - μ 1 - α G
به عبارت دیگر ، در چنین مواردی تأثیر اصطلاح حرکت ، افزایش مؤثر یادگیری است. در عمل ، پیشرفت در سرعت همگرا توسط یک عامل 2 یا حتی بیشتر گزارش شده است [SILV 90].
تنوع اکتشافی از تکنیک قبلی استفاده از یک مقدار تطبیقی برای فاکتور یادگیری μ ، بسته به مقادیر عملکرد هزینه در مراحل تکرار پی در پی است. یک روش ممکن به شرح زیر است: بگذارید J (t) ارزش هزینه در مرحله تکرار باشد. اگر j (t)iبشراگر از طرف دیگر ، مقدار جدید هزینه از فاکتور C بزرگتر از قدیمی است ، سپس نرخ یادگیری را با یک عامل r کاهش می دهدdبشردر غیر این صورت از همان مقدار استفاده کنید. خلاصه
j (t) j (t - 1)<1 , μ ( t ) = r i μ ( t − 1 )
J ( t ) J ( t − 1 )>c ، μ (t) = r d μ (t - 1) 1 ≤ j (t) j (t - 1) ≤ c ، μ (t) = μ (t - 1)
مقادیر معمولی پارامترهایی که در عمل اتخاذ شده اند r هستندi= 1. 05 ، rd= 0. 7 ، C = 1. 04. برای مراحل تکرار که در آن هزینه افزایش می یابد ، ممکن است نه تنها کاهش نرخ یادگیری بلکه برای تعیین اصطلاح حرکت برابر با 0 سودمند باشد. دیگران نشان می دهند که به روزرسانی وزنه برداری در این مرحله انجام نمی شود.
استراتژی دیگر برای به روزرسانی فاکتور یادگیری μ در قانون به اصطلاح Delta-Delta و در قانون اصلاح آن Delta-Bar-Delta [JACO 88] دنبال می شود. ایده در اینجا استفاده از یک عامل یادگیری متفاوت برای هر وزن و افزایش ضریب یادگیری خاص است اگر شیب عملکرد هزینه با توجه به وزن مربوطه در دو مرحله تکرار پی در پی یک علامت یکسان داشته باشد. برعکس ، اگر علامت تغییر کند ، این نشانه ای از نوسان احتمالی است و باید ضریب یادگیری کاهش یابد. تعدادی از تکنیک های جایگزین برای سرعت بخشیدن به همگرایی نیز پیشنهاد شده است. در [CICH 93] بررسی گسترده تری از چنین تکنیک هایی ارائه شده است.
گزینه دیگر برای همگرایی سریعتر این است که خودمان را از منطقی تبار شیب و اتخاذ طرح های جستجوی جایگزین ، معمولاً با هزینه افزایش پیچیدگی ، رهایی دهیم. تعدادی از این تکنیک های الگوریتمی در ادبیات مرتبط ظاهر شده اند. به عنوان مثال ، [Kram 89 ، Ba 92 ، Joha 92] طرح های الگوریتمی را بر اساس الگوریتم شیب کونژوگه ارائه می دهد.[بات 92 ، ریکو 88 ، انبار 92 ، WATR 88] طرح هایی از خانواده نیوتن ارائه می دهد.[PALM 91 ، Sing 89] الگوریتم ها را بر اساس رویکرد فیلتر Kalman پیشنهاد دهید. و [BISH 95] طرحی مبتنی بر الگوریتم Levenberg-Marquardt. در بسیاری از این الگوریتم ها ، عناصر ماتریس Hessian باید محاسبه شوند ، یعنی مشتقات دوم هزینه با توجه به وزنه ها
∂ 2 J ∂ W J K Q ∂ W N M r
محاسبات ماتریس هسی با اتخاذ ، یک بار دیگر مفهوم backpropagation انجام می شود (همچنین به مشکلات 4. 12 ، 4. 13 مراجعه کنید). اطلاعات بیشتر در مورد این موضوعات را می توان در [هایک 99 ، زورا 92] یافت.
یک طرح محبوب که کاملاً مبتنی بر روش نیوتن است ، طرح QuickProp [FAHL 90] است. این یک روش اکتشافی است و وزن ها را مانند آنها به صورت شبه مستقل درمان می کند. سپس سطح خطا ، به عنوان تابعی از هر وزن ، توسط یک چند جمله ای درجه دوم تقریب می یابد. اگر این حداقل با مقدار معقول باشد ، دومی به عنوان وزن جدید برای تکرارها استفاده می شود. در غیر این صورت تعدادی از اکتشافات استفاده می شود. یک شکل معمول از الگوریتم ، برای وزن در لایه های مختلف ،
(4. 28) Δ W I J (t) =<α i j ( t ) Δ w i j ( t − 1 ) , if Δ w i j ( t − 1 ) ≠ 0 μ ∂ J ∂ w i j , if Δ w i j ( t − 1 ) = 0
(4. 29) α i j (t) = min<∂ J ∂ w i j ( t ) ∂ J ∂ w i j ( t − 1 ) − ∂ J ∂ w i j ( t ) , α max>
با مقادیر معمولی متغیرهای درگیر 0. 01 ≤ μ 0. 6 ، αحداکثر1. 75 ≈ [CICH 93]. یک الگوریتم مشابه روح با QuickProp در [RID 93] پیشنهاد شده است. گزارش شده است که به همان سرعت QuickProp است و به پایداری پارامترها نیاز به تنظیم کمتری دارد.
بیشتر بخوانید URL: https://www. sciencedirect. com/science/article/pii/b9781597492720500062
تجزیه و تحلیل چند متغیره از داده ها در علم حسی
Knut Kvaal ، Jean A. McEwan ، در مدیریت داده ها در علم و فناوری ، 1996
4. 2. 2 رویکرد به تجزیه و تحلیل داده ها
تصمیم به استفاده از نمرات مؤلفه اصلی به عنوان ورودی به شبکه باید توسط آزمایش و خطا انجام شود. در این روش ابتدا از داده های خام استفاده شد ، سپس از اجزای اصلی به عنوان متغیرهای ورودی به شبکه استفاده شد. باید یک مدل شبکه با حداقل همان درجه RMS داشته باشد. به عنوان PCRاز تعداد بهینه نمرات از PCR به عنوان تعداد ورودی نمره به شبکه ما استفاده شد. همچنین توصیه می شود تعداد ورودی های نمره و تعداد نورون های موجود در لایه پنهان برای یافتن یک مدل شبکه بهینه بهینه سازی شود.
هنگامی که مدل شبکه ساخته می شود ، برخی از پارامترها باید تهیه شوند. ثابت یادگیری. این میزان یادگیری و اصطلاح حرکت خواهد بود. این شبکه سعی خواهد کرد نرخ یادگیری بهینه را پیدا کند. به منظور دستیابی به شرایط بهینه قبل از قرار دادن مدل شبکه عصبی ، می توان طرحی را برای مقایسه عملکرد سطوح مختلف نرخ یادگیری و نرخ حرکت مختلف ساخته شد. همانطور که در بخش 2 ذکر شد ، همچنین امکان استفاده از نرخ یادگیری سازگار با خود وجود دارد. همچنین می توان یادگیری را بر اساس ثابت های یادگیری خود سازگار کرد. در این رویکرد ، آموزش یک مدل شبکه و به حداقل رساندن خطای پیش بینی آسان تر است زیرا نیازی به توجه زیادی به ارزشهای شروع ثابتهای یادگیری و قدرت فرآیند یادگیری نداریم.
هنگام ساخت مدل شبکه ، باید تعداد خروجی های همزمان در نظر گرفته شود. در رویکرد ما ، شبکه ای برای پیش بینی تمام ویژگی های حسی در همان زمان جستجو خواهد شد. به طور کلی پیش بینی چندین ویژگی در همان زمان دشوارتر از پیش بینی فقط یک ویژگی است. این مربوط به یک سطح خطای پیچیده تر است ، زیرا برخی از ویژگی ها ممکن است توسط NIR به خوبی مدل نشوند. هنگام آموزش شبکه ، آزمایش را در بازه زمانی انجام دهید و هنگامی که RMSEP در یک بهینه قرار دارد برای جلوگیری از تناسب بیش از حد متوقف شود.
بیشتر بخوانید URL: https://www. sciencedirect. com/science/article/pii/s0922348796800281
حملات مخالف جعبه سیاه
3. 4 حمله انتقال
به طور کلی ، حمله انتقال به معنای تولید نمونه های مخالف از یک مدل منبع برای حمله به یک مدل هدف است. این به طور معمول با تنظیم "بدون جعبه" مطابقت دارد ، جایی که یک مهاجم هیچ اطلاعاتی در مورد مدل هدف ندارد و یک مدل پیش ساخته دیگر را به عنوان منبع برای تولید نمونه های مخالف می گیرد. اگرچه این مدل ها می توانند بسیار متفاوت باشند ، برخی از نمونه های مخالف می توانند از یک مدل به مدل دیگر منتقل شوند (Papeot et al. ، 2016 ؛ Liu et al. ، 2017b) ، و چندین تلاش انجام شده است ، به طور تجربی ، برای مطالعه نحوه تولید بیشترنمونه های مخالف قابل انتقال. به عنوان مثال ، دونگ و همکاران.(2018) با ادغام اصطلاح حرکت در فرآیند تکراری ، قابلیت انتقال را تقویت کرد. تکنیک های دیگر مانند افزایش داده ها (Xie et al. ، 2019) ، بهره برداری از شیب اتصال SKIP (وو و همکاران ، 2020a) ، همچنین در حملات قابل انتقال بیشتر نقش دارند. یک مطالعه انتقال پذیری حمله در مقیاس بزرگ در بین 18 مدل Imagenet پیش ساخته توسط سو و همکاران انجام شده است.(2018). به جای استفاده از مدلهای جانشین پیش ساخته ، همچنین می توان "مدل متا-سوروگات" را بر اساس مجموعه ای از مدلهای جانشین پیش ساخته ، که در آن مدل متا-سوروگات می تواند نمونه های مخالف قابل انتقال تری ایجاد کند ، ساخت. این کار را می توان با یک چارچوب یادگیری متا انجام داد ، همانطور که توسط شین و همکاران پیشنهاد شده است.(2021).
در تنظیمات حمله جعبه سیاه با برچسب نرم ، Papeot و همکاران.(2017) پیشنهاد می کند که یک مدل جایگزین را با استفاده از نمایش داده های مدل تکراری ، انجام حملات جعبه سفید بر روی مدل جایگزین ، آموزش دهید و از قابلیت انتقال نمونه های مخالف برای حمله به مدل هدف استفاده کنید. با این حال ، آموزش یک جانشین نماینده برای یک طبقه بندی کننده پیشرفته به دلیل قوانین طبقه بندی پیچیده و غیرخطی مدل یادگیری ماشین (به عنوان مثال ، شبکه های عصبی) و ابعاد بالای مجموعه داده های اساسی ، چالش برانگیز است. در صورتی که نمونه های مخالف برای مدل جایگزین ضعیف به مدل هدف منتقل شود ، عملکرد حملات جعبه سیاه می تواند به شدت تخریب شود.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780128240205000120
کمیت عدم اطمینان در اینترنت از میدان نبرد
2. 3. 4. 2 SGD با حرکت
مشکل دیگر SGD استاندارد این است که مقیاس بندی فضای پارامتر را در نظر نمی گیرد (که به اطلاعات مرتبه دوم نیاز دارد). یک موقعیت خاص که در آن این مشکل وجود دارد، زمانی است که تابع هدف دارای منحنی های سطح بسیار باریکی است. در اینجا، یک روش نزولی گرادیان استاندارد تمایل به زیگزاگی به جلو و عقب دارد و تقریباً عمود بر بهینه حرکت می کند. یک راه حل متداول در حالت قطعی، استفاده از شیب نزول با تکانه است، که یک اضافه ساده و در عین حال مفید به مرحله نزول دارد. نسخه تصادفی این است:
w k + 1 = w k − α k ∇ F ( w k , ξ k ) + β ( w k − w k − 1 ) که در آن آخرین جمله ترم تکانه است.
همانطور که از نام آن پیداست، این الگوریتم با ایده فیزیکی اینرسی، به عنوان مثال، یک توپ در حال غلتیدن از تپه ایجاد شده است. ممکن است منطقی باشد که طول مرحله قبلی را از این طریق در جهت جستجوی بعدی بگنجانیم. به این معنا، الگوریتم تمام فواصل گام های قبلی را به شکل میانگین در حال فروپاشی نمایی «به یاد می آورد». Momentum به SGD کمک می کند تا در دره های باریک گیر نکند و برای آموزش شبکه های عصبی محبوب است. متأسفانه، همگرایی برای حرکت به خوبی درک نشده است. کران بالایی برای یک هدف محدب و غیر هموار توسط یانگ، لین و لی (2016) به شکل زیر ارائه شده است:
E [ f ( x - k ) - f ( x ⁎ ) ] ≤ β ε 0 ( 1 - β ) ( k + 1 ) + ( 1 - β ) ( 0 x ) 2 2 C ( k + 1 ) + C( L 2 + δ 2 ) 2 ( 1 - β ) k + 1
در اینجا توجه داشته باشید که خطا بر حسب میانگین تکرار x - k = 1 / k ∑ i = 1 k x i داده می شود. برای مسائل این کلاس نرخ همگرایی بهینه O ( 1 / k ) است که این الگوریتم به آن دست می یابد.
تجارت گزینه های دودویی در ایران...
ما را در سایت تجارت گزینه های دودویی در ایران دنبال می کنید
برچسب :
نویسنده : زینالعابدین مراغهای
بازدید : <-PostHit->
تاريخ : جمعه
20 مرداد
1402 ساعت: 15:40