محمد دانش
کنترل حرکت ربات دوپا یکی از مسئلههای چالشبرانگیز در زمینه کنترل و رباتیک میباشد. روشهای کلاسیک مدل-محور برای حل این مسئله به طراحی مسیر و همچنین یک سیکل تکرارشونده به نام گیت برای پاهای ربات میپردازند، سپس یک کنترلکننده برای ربات طراحی میشود. هر چند روشهای کلاسیک مدل-محور ربات را مجبور به تکرار یک الگو به صورت دقیق میکند، ولی معمولا نیاز به فرضهای سادهساز و مدل دقیق دارد. روشهای یادگیری تقویتی عمیق که الهام گرفته از مغز انسان است یک رویکرد مقاوم و تطبیقپذیر جهت کنترل و تصمیمگیری ارائه میدهد.
این پژوهش به بررسی پیشرفتهای اخیر یادگیری تقویتی عمیق و کاربرد آن در کنترل هوشمند حرکت ربات میپردازد. استفاده شبکههای عصبی مصنوعی در این روش کارایی آن را در مسئلههای کنترلی بسیار افزایش داده است. در این پژوهش از الگوریتم بهینهسازی سیاست مجاورتی که یک روش یادگیری تقویتی عمیق بدون-مدل است جهت آموزش ربات دوپای محیط Walker-2d جیم در شبیهساز MuJoCo استفاده میشود. طراحی کنترلکننده به صورت پایان به پایان میباشد، به این معنی که کنترلکننده، کل فرایند دریافت دادههای حسگری تا تولید فرمانهای گشتاور را خودش به تنهایی و بدون نیاز به سیستم دیگری انجام میدهد. در این پژوهش اقدام به آموزش ربات دوپا روی زمینهایی با شیبهای مختلف میشود. برای انجام این آموزش بنا به لزوم، تابع پاداش محیط به منظور ایجاد انگیزه در عامل برای راه رفتن در جهت موازی با جهت زمین شیبدار اصلاح میشود. علاوه بر آن، شرط تمام شدن اجرای محیط جهت قادر ساختن ربات به ادامه اجرا در صورت افزایش یا کاهش ارتفاع ناشی از راه رفتن بر روی سطح شیبدار تغییر داده میشود. دلیل دیگر این اصلاح، وابستگی تابع پاداش به شرط اجرا میباشد، به صورتی که در هر گام زمانی که شرط اتمام اجرا نقض نشود و ربات زنده بماند پاداش مثبتی دریافت میکند. این پژوهش نشاندهنده پتانسیل بالای الگوریتمهای یادگیری تقویتی عمیق جهت کنترل هوشمند حرکت ربات و تطبیقپذیری بالای آن در محیطهایی با شیبهای مختلف است.آزمایش دیگری روی ربات آموزش دیده روی یک محیط شیبدار با شیب معین انجام میشود تا قوام آن برای راه رفتن روی زمین با شیبهای دیگر ارزیابی شود. نتایج این آزمایش نشان میدهد که بر خلاف انتظار، ربات هنوز تا حدودی قادر به راه رفتن است. همچنین آزمایشی نیز جهت تحلیل و گزارش دادههای گشتاور و دادههای حالت همچون سرعت و موقعیت ربات انجام میشود.

