فريد شيخ الاسلام
سیستم های چندعاملی به دلیل کاربردهای گسترده در رباتیک، شبکه های حسگر، حمل ونقل هوشمند و سیستم های توزیع شده، از اهمیت ویژه ای برخوردارند. یکی از چالش های کلیدی در این سیستم ها، طراحی روش های کنترلی است که بتوانند اجماع و همکاری عامل ها را در حضور دینامیک های غیرخطی ناشناخته و اغتشاش تضمین کنند. دستیابی به این هدف مستلزم چارچوب هایی است که پایداری، دقت و سرعت همگرایی را در کنار بهینگی تضمین کنند.
این پژوهش یک چارچوب مفهومی برای حل مسئله اجماع (آرایش بندی مبتنی بر اجماع) در سیستم های چندعاملی با دینامیک های غیرخطی ناشناخته با استفاده از کنترل کننده مد لغزشی تقریبا بهینه مبتنی بر یادگیری تقویتی ارائه می دهد. دینامیک عامل ها همراه با عدم قطعیت و اغتشاش های نامحدود و نامنطبق در نظر گرفته شده است. یک تخمین زن زمان-ثابت معرفی شده است که دینامیک های نامعین و اغتشاش ها را برای هر عامل در زمان مشخصی تخمین می زند. این تخمین زن تنها به حد بالای مشتق نامعینی و اغتشاش نیاز دارد.
در این پژوهش سه استراتژی کنترلی پیشنهاد شده است. استراتژی اول: طراحی یک کنترل کننده که ترکیبی از کنترل کننده مد لغزشی تطبیقی و کنترل کننده بهینه است. قانون تطبیق در کنترل کننده مد لغزشی کران خطای تخمین زن زمان-ثابت را تخمین می زند. این فرآیند در نهایت منجر به همگرایی به سطح لغزش شده و دینامیک عامل ها را به یک دینامیک خطی تبدیل می کند. این امر امکان حل مسئله اجماع خطی را با استفاده از یک کنترل کننده بهینه تطبیقی مبتنی بر یادگیری تقویتی و روش منتقد-کنشگر فراهم می کند. استراتژی دوم: بهبود کنترل کننده مد لغزشی تطبیقی به یک کنترل کننده مد لغزشی زمان-ثابت که زمان رسیدن به سطح لغزش را صرف نظر از شرایط اولیه عامل ها کاهش می دهد و در نتیجه آن، زمان همگرایی خطای اجماع به صفر کاهش می یابد. استراتژی سوم: ارتقای تخمین زن دو استراتژی قبل به تخمین زن زمان ثابت تطبیقی که نیازی به هیچ اطلاعاتی از نامعینی و اغتشاش ندارد و علاوه بر تخمین دینامیک های نامعین و اغتشاش ها در زمان مشخص، حد بالای مشتق آن ها را نیز تخمین می زند. کنترل کننده این استراتژی، همان کنترل کننده استراتژی دوم است. اثبات همگرایی این کنترل کننده و تخمین زن به صورت زمان ثابت به یک مجموعه مانده قابل تنظیم تضمین می شود که به صورت مجانبی در آن مجموعه به صفر همگرا می شود. در ادامه با در نظر گرفتن اشباع در ورودی کنترلی هر عامل و نامشخص بودن ورودی های کنترلی عامل های همسایه مسئله آرایش بندی در شرایطی با محدودیت بیشتر بررسی و کنترل کننده تلفیقی متناسب با شرایط اصلاح می شود. موفقیت هر سه استراتژی از طریق شبیه سازی روی مدل های ریاضی و کاربردی تایید شده است و با اثبات های نظری همخوانی دارد.

