پژوهشگران دانشکدگان فنی دانشگاه تهران با ارائه روشی کاملاً توزیعشده در حوزه یادگیری تقویتی چندعامله، امکان آموزش و تصمیمگیری مستقل عاملهای هوشمند را بدون نیاز به کنترلکننده مرکزی فراهم کردند؛ دستاوردی که میتواند مسیر توسعه سامانههای هوشمند در حوزههایی مانند رباتیک، شبکههای هوشمند انرژی، حملونقل، خودروهای خودران و اقتصاد محاسباتی را هموارتر کند.
به گزارش دیدهبان علم ایران، این مقاله با عنوان «A Distributed Primal-Dual Method for Constrained Multi-Agent Reinforcement Learning With General Parameterization» به قلم علی کاهه، دانشآموخته رتبه نخست کارشناسی ارشد مهندسی برق دانشگاه تهران و حامد کبریایی، استاد دانشکدگان فنی دانشگاه تهران، در سال ۲۰۲۶ در نشریه معتبر IEEE Transactions on Automatic Control منتشر شده است. این مجله با شاخص اعتبار علمی SJR=3.929، در جدیدترین رتبهبندی پایگاه استنادی SCImago، جایگاه نخست را در میان ۳۸۲ نشریه بینالمللی حوزه سیستم و کنترل به خود اختصاص داده است.
این پژوهش به یکی از چالشهای مهم هوش مصنوعی، یعنی یادگیری تقویتی چندعامله مقید (Constrained Multi-Agent Reinforcement Learning) میپردازد. در بسیاری از سامانههای هوشمند، چندین عامل باید بهطور همزمان و مستقل تصمیمگیری کنند و در عین حال محدودیتها و اهداف مشترک سیستم را نیز رعایت کنند.
به گفته پژوهشگران، اغلب روشهای موجود برای آموزش این عاملها به یک کنترلکننده مرکزی وابستهاند؛ موضوعی که استفاده از آنها را در سامانههای بزرگ و پیچیده با محدودیت مواجه میکند. روش پیشنهادی دانشگاه تهران این مشکل را برطرف کرده و امکان یادگیری کاملاً توزیعشده را فراهم میکند؛ بهگونهای که هر عامل تنها با استفاده از اطلاعات محلی خود و ارتباط با عاملهای همسایه، قادر به آموزش و تصمیمگیری خواهد بود.
این روش بر پایه الگوریتم Primal-Dual و معماری Actor-Critic طراحی شده و به عاملهای هوشمند اجازه میدهد ضمن رعایت محدودیتهای مشترک سیستم، فرآیند یادگیری را بهصورت برخط (Online) و مستقل انجام دهند. پژوهشگران همچنین از نظر نظری نشان دادهاند که ضرایب لاگرانژ میان عاملها به اجماع رسیده و الگوریتم پیشنهادی به یک نقطه تعادل همگرا میشود.
از دیگر ویژگیهای این پژوهش، امکان استفاده از سیاستهای پارامتری عمومی در محیطهای دارای فضای حالت بزرگ است؛ قابلیتی که کاربرد آن را در مسائل پیچیده دنیای واقعی افزایش میدهد. عملکرد این الگوریتم نیز در یک مدل مشارکتی و پویای بازی اقتصادی کورنو (Cournot) ارزیابی شده و نتایج، کارایی روش پیشنهادی را در محیطهای پیچیده و تصادفی تأیید کرده است.
یادگیری تقویتی چندعامله یکی از شاخههای پیشرفته هوش مصنوعی است که در توسعه فناوریهایی مانند رباتهای خودمختار، شبکههای هوشمند برق، مدیریت ترافیک شهری، خودروهای خودران و مدلسازی بازارهای اقتصادی نقش کلیدی دارد. پژوهشگران معتقدند توسعه روشهای توزیعشده و مقیاسپذیر در این حوزه میتواند زمینهساز نسل جدید سامانههای هوشمند خودمختار باشد.
انتهای پیام