محققان دانشگاه ادینبورگ چارچوب سلسله مراتبی مبتنی بر یادگیری تقویت عمیق (RL) را ایجاد کرده اند که می تواند استراتژیهای مختلفی را برای کنترل تعادل انسانوئید به دست آورد. چارچوب آنها ، در مقاله ای که از قبل روی arXiv چاپ شده و در کنفرانس بین المللی Robotics Humanoid 2017 ارائه شده است ، می تواند رفتارهای متعادل کننده تر از انسان را نسبت به کنترل کننده های معمولی انجام دهد.
در هنگام ایستادن یا راه رفتن ، انسان به صورت ذاتی و مؤثر از تعدادی تکنیک برای کنترل کم تحرک استفاده می کند که به آنها کمک می کند تعادل خود را حفظ کنند. اینها شامل کج شدن پنجه و نورد پاشنه است که باعث ایجاد ترخیص پا بهتر از پا می شوند. تکرار رفتارهای مشابه در روبات های انسان نما می تواند قابلیت های حرکتی و حرکتی آنها را تا حد زیادی بهبود بخشد.
دکتر ژیبین لی ، مدرس رباتیک و کنترل در دانشگاه ادینبورگ ، که مطالعه را انجام داده است ، گفت: "تحقیقات ما به استفاده از RL عمیق برای حل حرکات پویا روبات های انسان نما متمرکز شده است." "در گذشته ، تحرک عمدتاً با استفاده از رویکردهای تحلیلی معمولی انجام می شد. مدل مبتنی بر آن محدود است زیرا به تلاش و دانش انسانی نیاز دارند و برای اجرای آنلاین نیاز به قدرت محاسباتی بالایی دارند."
نیاز به تلاش کمتر انسانی و تنظیم دستی ، تکنیک های یادگیری ماشین می تواند منجر به توسعه کنترل کننده های موثرتر و خاص تر از رویکردهای مهندسی سنتی شود. یک مزیت دیگر استفاده از RL این است که محاسبه برای این ابزارها نیز می تواند بصورت آفلاین برون سپاری شود ، در نتیجه عملکرد آنلاین سریعتر برای سیستم های کنترل ابعادی بالا مانند ربات های انسان نما به وجود می آید.
یک ربات شبیه سازی شده والکیری در حالت کج شدن پا و پاشنه. اعتبار: یانگ ، کومورا و لی
"با توجه به الگوریتم های RL عمیق بسیار قدرتمند ، تعداد فزاینده ای از تحقیقات تحقیقاتی با استفاده از RL عمیق برای حل وظایف کنترل شروع کرده اند ، زیرا پیشرفت اخیر در الگوریتم های RL عمیق طراحی شده برای دامنه عمل مداوم ، امکان اعمال وظایف کنترل یادگیری تقویتی را فراهم کرده است. دکتر لی توضیح می دهد که پویایی پیچیده ای را شامل می شود. "هدف اصلی تحقیق ما کشف امکانات استفاده از یادگیری تقویتی عمیق برای دستیابی به سیاستهای کنترل همه کاره قابل مقایسه یا بهتر از رویکردهای تحلیلی در حالی که کمتر از تلاشهای انسانی استفاده می شود."
چارچوبی که توسط دکتر لی با همکاری دکتر تاکو کومورا و دکتری تهیه شده است. دانش آموز Chuanyu یانگ ، با استفاده از RL عمیق برای دستیابی به سیاست های کنترل سطح بالا. به طور مداوم با بازخورد از وضعیت روبات ، این زوایا زاویه های مفصل مورد نظر را در فرکانس پایین تری امکان پذیر می کنند.
"در كنترل سطح پایین ، متناسب و مشتقات (PD) از كنترل كننده ها با فرکانس كنترل بسیار بالاتر استفاده می شود تا حرکات مفصل پایدار را تضمین كند." دانشجوی Chuanyu گفت. "ورودی ها برای کنترل کننده PD با سطح پایین زاویه های مفصل مورد نظر تولید شده توسط شبکه عصبی با سطح بالا هستند و خروجی ها گشتاور مورد نظر برای موتورهای مشترک هستند."
محققان عملکرد الگوریتم خود را آزمایش کرده و به نتایج بسیار امیدوارکننده ای دست یافتند. آنها دریافتند كه انتقال دانش انسان از روشهای مهندسی كنترل به طراحی پاداش برای الگوریتم های RL ، استراتژی های كنترل تعادل را ایجاد می كند كه شباهت هایی با آنچه در انسان استفاده شده است. علاوه بر این ، هرچه الگوریتم های RL از طریق یک فرایند آزمایشی و خطا بهبود می یابند ، به طور خودکار با شرایط جدید تطبیق می یابند ، چارچوب آنها نیاز به تنظیم کمی دستی یا سایر مداخلات مهندسین انسانی دارد.
ویژگی های حالت دوقطبی یانگ ، کومورا و لی
دکتر لی گفت: "مطالعه ما نشان می دهد که یادگیری تقویت عمیق می تواند ابزاری قدرتمند برای تولید نتایج متعادل سازگار با یک کنترلر انسانی طراحی شده با تلاش تنظیم دستی کمتر و زمان کوتاه تر باشد." " الگوریتم یادگیری تقویتی عمیق که ما توسعه دادیم حتی قادر به یادگیری رفتارهای شبیه انسان مانند کج شدن انگشتان پا یا پاشنه پا است که اکثر روشهای مهندسی قادر به انجام آن نیستند."
دکتر لی و همکارانش اکنون در حال کار بر روی مطالعه خود هستند که RL را برای یک ربات تمام بدن Valkyrie در یک شبیه سازی 3 بعدی اعمال می کند. در این تلاش تحقیقاتی جدید ، آنها توانستند استراتژی های متعادل کننده شباهت انسان با راه رفتن و سایر کارهای تحرک را تعمیم دهند.
دکتر لی گفت: "سرانجام ، ما می خواهیم این چارچوب سلسله مراتبی از تلفیق یادگیری ماشین و کنترل ربات را در ربات های انسان نما واقعی و همچنین سایر سکوهای روباتیک اعمال کنیم."
http://socialmediastore.net/story5674218/پمپ-وکیوم-آبی