Loading...

Guidance and Control of Multi-Agent Free Flying Robots Using Deep Reinforcement Learning

Delavar, Ali | 2025

170 Viewed
  1. Type of Document: M.Sc. Thesis
  2. Language: Farsi
  3. Document No: 58663 (45)
  4. University: Sharif University of Technology
  5. Department: Management and Economics
  6. Advisor(s): Kiani, Maryam
  7. Abstract:
  8. Free-flying robots are critical for supporting human efforts during space missions. Recent advancements in multi-agent robotics, enabled by Multi-Agent Deep Reinforce- ment Learning (MADRL), have further enhanced the efficiency and autonomy of these systems. Multi-agent actor-critic methods with Centralized Training and Decentralized Execution (CTDE) enables robots for decentralized coordination in a continuous action space by addressing the problems of non-stationary and credit assignment in multi- agent environments. Notably, Multi-Agent Proximal Policy Optimization (MAPPO) has demonstrated superior performance compared to other methods in these environ- ments. Integrating the attention layer inside the actor-critic’s network architecture mitigates the partial observability issue in multi-agent settings and enhances the colli- sion avoidance with other agents and obstacles. These innovations are transforming how autonomous multi-agents perform tasks, enabling high-reliability operations inside and outside spacecraft. This Thesis employs MAPPO integrated with the attention mech- anism for motion planning and collision avoidance of homogeneous free-flying robots in 3d space
  9. Keywords:
  10. Deep Reinforcement Learning ; Attention Mechanism ; Multi-Agent Reinforcement Learning ; Proximal Policy Optimization Algorithm ; Multi-Agent Robotics ; Free-Flying Robots ; Centralized Training and Decentralized Execution (CTDE)

 Digital Object List

 Bookmark

  • مقدمه
    • تعریف مسئله
    • اهمیت موضوع
    • اهداف پژوهش
    • ساختار پایان‌نامه
  • مدلسازی دینامیکی و چهارچوب حل
    • مدل دینامیکی سامانه
    • مبانی یادگیری‌تقویتی
      • فرایند تصمیم‌گیری مارکوف
      • برنامه ریزی پویا
      • روش مونت كارلو
      • یادگیری TD
      • اکتشاف در برابر بهره‌برداری و سیاست ‑حریصانه
    • مبانی یادگیری ماشین و شبکه‌عصبی
      • مدل خطی و تابع زیان
      • بهینه‌سازی پارامترها
      • شبکه‌های عصبی و توابع فعال‌سازی
      • معماری‌های پرکاربرد در یادگیری عمیق
    • یادگیری‌تقویتی‌عمیق
      • رویکرد مبتنی بر ارزش
      • رویکرد گرادیان سیاست
      • رویکرد بازیگر-منتقد
      • الگوریتم PPO
    • یادگیری‌تقویتی‌عمیق چندعامله
      • پارادایم‌های یادگیری در محیط چندعامله
      • طراحی پاداش و حل مسئله تخصیص اعتبار
      • گسترش PPO به MAPPO
  • کارهای پیشین
    • ربات‌های پروازآزاد
      • مدلسازی دینامیکی
    • روش‌های کنترل و هدایت در مسائل چندعاملی
      • روش‌های کلاسیک مبتنی بر مدل
      • روش‌های مبتنی بر اجماع و کنترل توزیع‌شده
      • روش‌های رفتاری و الهام‌گرفته از طبیعت
      • گذار به روش‌های نوین
      • یادگیری تقویتی عمیق
      • مشاهده ناقص در محیط‌های چندعاملی
      • تخصیص اعتبار در محیط‌های چندعاملی
      • جمع‌بندی و رویکرد پیشنهادی
  • شبیه‌سازی و تحلیل نتایج
    • صورت‌بندی مسئله
      • فضای مشاهدات
      • فضای عمل
    • ارزیابی کارایی لایه توجه
    • تحلیل ابرپارامترها
      • اندازه دسته‌ها
      • ضریب برش
      • تعداد دوره‌های آموزش
      • طول دنباله مشاهدات
      • تأثیر ابرپارامترها بر مقیاس‌پذیری
    • تحلیل مسیر حرکت عامل‌ها
  • نتیجه گیری و کارهای آینده
    • جمع‌بندی و نتیجه‌گیری
    • کارهای آینده
      • استفاده از مدل‌های زبانی بزرگ برای برنامه‌ریزی وظایف
      • ادغام ورودی‌های بصری با استفاده از شبکه‌های عصبی کانولوشنی
      • شتاب‌دهی فرآیند آموزش با استفاده از یادگیری تقلیدی
      • گسترش به سناریوهای پیچیده‌تر و واقع‌گرایانه‌تر
  • مراجع
...see more