مروری نظاممند بر یادگیری تقویتی عمیق در زمانبندی و انتقال وظایف در محیطهای ابری، مه و لبه
کلمات کلیدی:
یادگیری تقویتی عمیق, زمانبندی وظایف, رایانش مه, رایانش لبهچکیده
با افزایش سریع تولید داده در کاربردهای هوشمند، نیاز به پاسخدهی بلادرنگ و مدیریت تقاضاهای پیچیده در سیستمهای اینترنت اشیا شدت یافته است. در این میان، محیطهای رایانش ابری، مه و لبه بهعنوان زیرساختهایی با قابلیت توسعهپذیری و سازگاری، نقش مهمی در اجرای وظایف محاسباتی ایفا میکنند. مسئلهی زمانبندی و انتقال تطبیقی وظایف، بهویژه در شرایط ناهمگون و پویا، به یک چالش پژوهشی کلیدی تبدیل شده است. روشهای سنتی، به دلیل ماهیت ایستا و وابستگی به مدلهای ثابت، در مواجهه با تغییرات محیطی کارآمد نیستند. در سالهای اخیر، الگوریتمهای یادگیری تقویتی عمیق بهعنوان رویکردی دادهمحور و انطباقپذیر برای حل این مسئله، مورد توجه فزایندهای قرار گرفته است. این مقاله مروری با نگاهی نظاممند به جدیدترین مطالعات، به بررسی کاربرد یادگیری تقویتی عمیق در زمانبندی و انتقال وظایف در محیطهای ترکیبی ابری-مه-لبه میپردازد. مقالات منتخب از نظر نوع الگوریتم یادگیری (مانند DDQN، Rainbow DQN، DQN)، معماری سیستم (متمرکز، توزیعشده، سلسلهمراتبی)، اهداف بهینهسازی (مانند کاهش زمان اجرا، مصرف انرژی، نرخ نقض مهلت زمانی) و نوع دادههای ارزیابی (شبیهسازیشده یا واقعی مانند Google Workload و دادههای ترافیکی) طبقهبندی شدهاند. نتایج این مرور نشان میدهد که یادگیری تقویتی عمیق، بهویژه در شرایط متغیر و با محدودیتهای بلادرنگ، موجب بهبود عملکرد در معیارهایی نظیر تأخیر، مصرف انرژی و تخصیص منابع میگردد. در پایان، چالشهای باز و مسیرهای آینده برای توسعه راهکارهای تطبیقی و مقیاسپذیر ارائه میشود.