Loading...
Guidance and Control of Multi-Agent Free Flying Robots Using Deep Reinforcement Learning
Delavar, Ali | 2025
170
Viewed
- Type of Document: M.Sc. Thesis
- Language: Farsi
- Document No: 58663 (45)
- University: Sharif University of Technology
- Department: Management and Economics
- Advisor(s): Kiani, Maryam
- Abstract:
- Free-flying robots are critical for supporting human efforts during space missions. Recent advancements in multi-agent robotics, enabled by Multi-Agent Deep Reinforce- ment Learning (MADRL), have further enhanced the efficiency and autonomy of these systems. Multi-agent actor-critic methods with Centralized Training and Decentralized Execution (CTDE) enables robots for decentralized coordination in a continuous action space by addressing the problems of non-stationary and credit assignment in multi- agent environments. Notably, Multi-Agent Proximal Policy Optimization (MAPPO) has demonstrated superior performance compared to other methods in these environ- ments. Integrating the attention layer inside the actor-critic’s network architecture mitigates the partial observability issue in multi-agent settings and enhances the colli- sion avoidance with other agents and obstacles. These innovations are transforming how autonomous multi-agents perform tasks, enabling high-reliability operations inside and outside spacecraft. This Thesis employs MAPPO integrated with the attention mech- anism for motion planning and collision avoidance of homogeneous free-flying robots in 3d space
- Keywords:
- Deep Reinforcement Learning ; Attention Mechanism ; Multi-Agent Reinforcement Learning ; Proximal Policy Optimization Algorithm ; Multi-Agent Robotics ; Free-Flying Robots ; Centralized Training and Decentralized Execution (CTDE)
-
محتواي کتاب
- view
- مقدمه
- تعریف مسئله
- اهمیت موضوع
- اهداف پژوهش
- ساختار پایاننامه
- مدلسازی دینامیکی و چهارچوب حل
- مدل دینامیکی سامانه
- مبانی یادگیریتقویتی
- فرایند تصمیمگیری مارکوف
- برنامه ریزی پویا
- روش مونت كارلو
- یادگیری TD
- اکتشاف در برابر بهرهبرداری و سیاست ‑حریصانه
- مبانی یادگیری ماشین و شبکهعصبی
- مدل خطی و تابع زیان
- بهینهسازی پارامترها
- شبکههای عصبی و توابع فعالسازی
- معماریهای پرکاربرد در یادگیری عمیق
- یادگیریتقویتیعمیق
- رویکرد مبتنی بر ارزش
- رویکرد گرادیان سیاست
- رویکرد بازیگر-منتقد
- الگوریتم PPO
- یادگیریتقویتیعمیق چندعامله
- پارادایمهای یادگیری در محیط چندعامله
- طراحی پاداش و حل مسئله تخصیص اعتبار
- گسترش PPO به MAPPO
- کارهای پیشین
- رباتهای پروازآزاد
- مدلسازی دینامیکی
- روشهای کنترل و هدایت در مسائل چندعاملی
- روشهای کلاسیک مبتنی بر مدل
- روشهای مبتنی بر اجماع و کنترل توزیعشده
- روشهای رفتاری و الهامگرفته از طبیعت
- گذار به روشهای نوین
- یادگیری تقویتی عمیق
- مشاهده ناقص در محیطهای چندعاملی
- تخصیص اعتبار در محیطهای چندعاملی
- جمعبندی و رویکرد پیشنهادی
- رباتهای پروازآزاد
- شبیهسازی و تحلیل نتایج
- صورتبندی مسئله
- فضای مشاهدات
- فضای عمل
- ارزیابی کارایی لایه توجه
- تحلیل ابرپارامترها
- اندازه دستهها
- ضریب برش
- تعداد دورههای آموزش
- طول دنباله مشاهدات
- تأثیر ابرپارامترها بر مقیاسپذیری
- تحلیل مسیر حرکت عاملها
- صورتبندی مسئله
- نتیجه گیری و کارهای آینده
- جمعبندی و نتیجهگیری
- کارهای آینده
- استفاده از مدلهای زبانی بزرگ برای برنامهریزی وظایف
- ادغام ورودیهای بصری با استفاده از شبکههای عصبی کانولوشنی
- شتابدهی فرآیند آموزش با استفاده از یادگیری تقلیدی
- گسترش به سناریوهای پیچیدهتر و واقعگرایانهتر
- مراجع
