سال 1405، دوره 13، شماره 51، صفحات 71-78
یک چارچوب یادگیری تقویتی عمیق چندعامله مبتنی بر توجه متقابل و یادگیری فدرال برای بهینهسازی پایدار و حفظ حریم خصوصی در شهر هوشمند
KNO-1301-5106 20.1001.1.23223723.1405.13.1.6.5
نویسندگان:یاسر نگهداری،موسی مجرد
کلمات کلیدی:
یادگیری تقویتی عمیق چندعامله، توجه متقابل، یادگیری فدرال، حریم خصوصی تفاضلی، شهر هوشمند
چکیده:
در عصر شهرهای هوشمند، انبوهی از دادههای توزیعشده، گرههای تصمیمگیرنده متعدد و نیاز به واکنش بلادرنگ، چالشهای اساسی برای روشهای یادگیری متمرکز سنتی ایجاد کرده است. این روشها با مشکلاتی نظیر تأخیر ارتباطی بالا، نقض حریم خصوصی دادههای شهروندان، مقیاسناپذیری و وابستگی به گره مرکزی مواجه هستند. برای رفع این چالشها، در این پژوهش یک چارچوب یادگیری تقویتی عمیق چندعامله مبتنی بر توجه متقابل و یادگیری فدرال ارائه میشود. روش پیشنهادی شامل پنج مرحله اصلی است: (1) جمعآوری و پیشپردازش دادههای توزیعشده شهری، (2) طراحی معماری چندعامله با مکانیزم توجه متقابل برای هماهنگی میان عاملها، (3) آموزش محلی با یادگیری تقویتی عمیق در هر گره مستقل، (4) بهروزرسانی فدرال مدل مرکزی با اعمال حریم خصوصی تفاضلی بر گرادیانها، و (5) ارزیابی و اجرای بلادرنگ در محیط شهری. مکانیزم توجه متقابل به هر عامل اجازه میدهد تا اهمیت نسبی سایر عاملها را در تصمیمگیری خود لحاظ کند، در حالی که یادگیری فدرال امکان بهروزرسانی مدل مرکزی را بدون اشتراکگذاری دادههای خام فراهم میسازد. حریم خصوصی تفاضلی نیز با افزودن نویز کنترلشده به گرادیانها، از نشت اطلاعات حساس جلوگیری میکند. ارزیابی روش پیشنهادی با سه روش برتر سالهای ۲۰۲۵-۲۰۲۶ (RT-FedFlow، FDT و ROCO) بر حسب شش معیار عملکردی انجام شده است. نتایج نشان میدهد روش پیشنهادی نسبت به بهترین روش رقیب (ROCO) به ترتیب بهبود 5.0% در دقت، 4.3% در Precision، 5.1% در Recall، 4.7% در F1-Score، 15.3% در MAE و 24.2% در MSE دست یافته است. میانگین کلی بهبود روش پیشنهادی 9.4% و در معیارهای خطای پیشبینی 19.8% میباشد. این نتایج حاکی از آن است که چارچوب پیشنهادی با ترکیب مؤلفههای توجه متقابل، یادگیری فدرال و حریم خصوصی تفاضلی، راهکاری کارآمد، مقیاسپذیر و امن برای بهینهسازی پایدار در کاربردهای متنوع شهر هوشمند از جمله مدیریت ترافیک، شبکه انرژی و پاسخگویی اضطراری ارائه میدهد.