رفتن به محتوای اصلی
x
یادگیری تقویتی عمیق ربات دوپا جهت راه رفتن روی سطح شیب دار با استفاده از بهینه سازی سیاست مجاورتی
تاریخ دفاع
مقطع تحصیلی
كارشناسی ارشد
گروه آموزشی
طراحی و جامدات
استاد

محمد دانش

دانشکده
مهندسی مكانیك

کنترل حرکت ربات دوپا یکی از مسئله‌های چالش‌برانگیز در زمینه کنترل و رباتیک می‌باشد. روش‌های کلاسیک مدل-محور برای حل این مسئله به طراحی مسیر و همچنین یک سیکل تکرارشونده به نام گیت برای پاهای ربات می‌پردازند، سپس یک کنترل‌کننده برای ربات طراحی می‌شود. هر چند روش‌های کلاسیک مدل-محور ربات را مجبور به تکرار یک الگو به صورت دقیق می‌کند، ولی معمولا نیاز به فرض‌های ساده‌ساز و مدل دقیق دارد. روش‌های یادگیری تقویتی عمیق که الهام گرفته از مغز انسان است یک رویکرد مقاوم و تطبیق‌پذیر جهت کنترل و تصمیم‌گیری ارائه می‌دهد.

  این پژوهش به بررسی پیشرفت‌های اخیر یادگیری تقویتی عمیق و کاربرد آن در کنترل هوشمند حرکت ربات می‌پردازد. استفاده شبکه‌های عصبی مصنوعی در این روش کارایی آن را در مسئله‌های کنترلی بسیار افزایش داده است. در این پژوهش از الگوریتم بهینه‌سازی سیاست مجاورتی که یک روش یادگیری تقویتی عمیق بدون-مدل است جهت آموزش ربات دوپای محیط Walker-2d جیم در شبیه‌ساز MuJoCo استفاده می‌شود.  طراحی کنترل‌کننده به صورت پایان به پایان می‌باشد، به این معنی که کنترل‌کننده، کل فرایند دریافت داده‌های حسگری تا تولید فرمان‌های گشتاور را خودش به تنهایی و بدون نیاز به سیستم دیگری انجام می‌دهد. در این پژوهش اقدام به آموزش ربات دوپا روی زمین‌هایی با شیب‌های مختلف می‌شود. برای انجام این آموزش بنا به لزوم، تابع پاداش محیط به منظور ایجاد انگیزه در عامل برای راه رفتن در جهت موازی با جهت زمین شیب‌دار اصلاح می‌شود. علاوه بر آن، شرط تمام شدن اجرای محیط جهت قادر ساختن ربات به ادامه اجرا در صورت افزایش یا کاهش ارتفاع ناشی از راه رفتن بر روی سطح شیب‌دار تغییر داده می‌شود. دلیل دیگر این اصلاح، وابستگی تابع پاداش به شرط اجرا می‌باشد، به صورتی که در هر گام زمانی که شرط اتمام اجرا نقض نشود و ربات زنده بماند پاداش مثبتی دریافت می‌کند. این پژوهش نشان‌دهنده پتانسیل بالای الگوریتم‌های یادگیری تقویتی عمیق جهت کنترل هوشمند حرکت ربات و تطبیق‌پذیری بالای آن در محیط‌هایی با شیب‌های مختلف است.آزمایش دیگری روی ربات آموزش دیده روی یک محیط شیب‌دار با شیب معین انجام می‌شود تا قوام آن برای راه رفتن روی زمین با شیب‌های دیگر ارزیابی شود. نتایج این آزمایش نشان می‌دهد که بر خلاف انتظار، ربات هنوز تا حدودی قادر به راه رفتن است. همچنین آزمایشی نیز جهت تحلیل و گزارش داده‌های گشتاور و داده‌های حالت همچون سرعت و موقعیت ربات انجام می‌شود.

تحت نظارت وف ایرانی