- دیده بان علم ایران – Iran Science Watch - https://didehbanelmiran.ir -

دستاورد پژوهشگران ایرانی برای توسعه نسل جدید سامانه‌های هوشمند چندعاملی

پژوهشگران دانشکدگان فنی دانشگاه تهران با ارائه روشی کاملاً توزیع‌شده در حوزه یادگیری تقویتی چندعامله، امکان آموزش و تصمیم‌گیری مستقل عامل‌های هوشمند را بدون نیاز به کنترل‌کننده مرکزی فراهم کردند؛ دستاوردی که می‌تواند مسیر توسعه سامانه‌های هوشمند در حوزه‌هایی مانند رباتیک، شبکه‌های هوشمند انرژی، حمل‌ونقل، خودروهای خودران و اقتصاد محاسباتی را هموارتر کند.

به گزارش دیده‌بان علم ایران، این مقاله با عنوان «A Distributed Primal-Dual Method for Constrained Multi-Agent Reinforcement Learning With General Parameterization» به قلم علی کاهه، دانش‌آموخته رتبه نخست کارشناسی ارشد مهندسی برق دانشگاه تهران و حامد کبریایی، استاد دانشکدگان فنی دانشگاه تهران، در سال ۲۰۲۶ در نشریه معتبر IEEE Transactions on Automatic Control منتشر شده است. این مجله با شاخص اعتبار علمی SJR=3.929، در جدیدترین رتبه‌بندی پایگاه استنادی SCImago، جایگاه نخست را در میان ۳۸۲ نشریه بین‌المللی حوزه سیستم و کنترل به خود اختصاص داده است.

این پژوهش به یکی از چالش‌های مهم هوش مصنوعی، یعنی یادگیری تقویتی چندعامله مقید (Constrained Multi-Agent Reinforcement Learning) می‌پردازد. در بسیاری از سامانه‌های هوشمند، چندین عامل باید به‌طور هم‌زمان و مستقل تصمیم‌گیری کنند و در عین حال محدودیت‌ها و اهداف مشترک سیستم را نیز رعایت کنند.

به گفته پژوهشگران، اغلب روش‌های موجود برای آموزش این عامل‌ها به یک کنترل‌کننده مرکزی وابسته‌اند؛ موضوعی که استفاده از آن‌ها را در سامانه‌های بزرگ و پیچیده با محدودیت مواجه می‌کند. روش پیشنهادی دانشگاه تهران این مشکل را برطرف کرده و امکان یادگیری کاملاً توزیع‌شده را فراهم می‌کند؛ به‌گونه‌ای که هر عامل تنها با استفاده از اطلاعات محلی خود و ارتباط با عامل‌های همسایه، قادر به آموزش و تصمیم‌گیری خواهد بود.

این روش بر پایه الگوریتم Primal-Dual و معماری Actor-Critic طراحی شده و به عامل‌های هوشمند اجازه می‌دهد ضمن رعایت محدودیت‌های مشترک سیستم، فرآیند یادگیری را به‌صورت برخط (Online) و مستقل انجام دهند. پژوهشگران همچنین از نظر نظری نشان داده‌اند که ضرایب لاگرانژ میان عامل‌ها به اجماع رسیده و الگوریتم پیشنهادی به یک نقطه تعادل همگرا می‌شود.

از دیگر ویژگی‌های این پژوهش، امکان استفاده از سیاست‌های پارامتری عمومی در محیط‌های دارای فضای حالت بزرگ است؛ قابلیتی که کاربرد آن را در مسائل پیچیده دنیای واقعی افزایش می‌دهد. عملکرد این الگوریتم نیز در یک مدل مشارکتی و پویای بازی اقتصادی کورنو (Cournot) ارزیابی شده و نتایج، کارایی روش پیشنهادی را در محیط‌های پیچیده و تصادفی تأیید کرده است.

یادگیری تقویتی چندعامله یکی از شاخه‌های پیشرفته هوش مصنوعی است که در توسعه فناوری‌هایی مانند ربات‌های خودمختار، شبکه‌های هوشمند برق، مدیریت ترافیک شهری، خودروهای خودران و مدل‌سازی بازارهای اقتصادی نقش کلیدی دارد. پژوهشگران معتقدند توسعه روش‌های توزیع‌شده و مقیاس‌پذیر در این حوزه می‌تواند زمینه‌ساز نسل جدید سامانه‌های هوشمند خودمختار باشد.

انتهای پیام