نسخهٔ تفصیلی پروپوزال برای ارائه به استاد راهنما
عنوان فارسی #
یادگیری تقویتی فدرال برای خودروهای خودران متصل: یک قاعدهٔ تجمیع آگاه از ایمنی و سختی (SGDA) تحت اختلالات ناهمگن
عنوان انگلیسی #
Federated Reinforcement Learning for Connected Autonomous Vehicles: A Safety-Gated, Difficulty-Aware Aggregation Rule (SGDA) under Heterogeneous Disturbances
دانشگاه آزاد اسلامی – واحد گرگان
۱چکیدهٔ تفصیلی #
هدف این پژوهش، طراحی یک روش یادگیری تقویتی فدرال برای خودروهای خودران متصل است که در شرایط ناهمگن، فقط به میانگینگیری سادهٔ مدلهای محلی اکتفا نکند و هنگام تجمیع، هم «سختی واقعی محیط هر کلاینت» و هم «ریسک ایمنی بهروزرسانی محلی» را در نظر بگیرد. در سناریوی مورد مطالعه، هر کلاینت نمایندهٔ یک منطقه یا توزیع رانندگی متفاوت است و یک خودروی خودران ego را در شبیهساز MetaDrive آموزش میدهد. خودروهای پیرامونی توسط مدل واکنشی و قاعدهمحور IDM کنترل میشوند و جزو عاملهای یادگیرنده نیستند. دادهٔ خام مسیر، حالت و ادراک در محل کلاینت باقی میماند و سرور فقط پارامترهای مدل و شمارشها و شاخصهای محدود موردنیاز برای تجمیع را دریافت میکند.
مسئلهٔ اصلی از اینجا ایجاد میشود که در یادگیری فدرال متعارف، بهویژه FedAvg، سهم هر کلاینت معمولاً با تعداد نمونه یا حجم بهروزرسانی محلی تعیین میشود. این قاعده میان دو حالت متفاوت تمایز قائل نمیشود: ممکن است یک کلاینت بهدلیل رانندگی در محیط واقعاً دشوار، نرخ موفقیت پایینتری داشته باشد ولی سیاست آن نسبت به همان سطح سختی بسیار مناسب باشد؛ در مقابل، ممکن است کلاینت دیگری در محیط آسان نرخ ظاهراً خوبی ثبت کند اما نسبت به ظرفیت همان محیط عملکرد ضعیف یا ناایمن داشته باشد. مقایسهٔ نرخهای خام در چنین شرایطی میتواند کلاینت دشوار اما شایسته را تنبیه و کلاینت آسان اما کمکیفیت را تقویت کند.
برای رفع این مسئله، روش پیشنهادی با نام SGDA-R از دو سازوکار مکمل و جدا از هم استفاده میکند. سازوکار اول، «امتیازدهی باقیماندهای آگاه از سختی» است. ابتدا سختی عینی هر سناریو با شاخص SDS از چهار مؤلفهٔ اختلال عملگر، ترافیک، هندسه و ریسک معنایی محاسبه میشود. سپس سرور بر روی یک مجموعهٔ مستقل، مقدار مورد انتظار موفقیت، برخورد و نقض ایمنی را در سطوح مختلف سختی برازش میکند. عملکرد هر کلاینت با مقدار مورد انتظار در همان سطح سختی مقایسه میشود، نه با یک آستانهٔ یکسان برای همه. سازوکار دوم، «گیت ایمنی مستقل از سختی» است. این گیت اجازه نمیدهد دشواربودن محیط به توجیهی برای مشارکت پررنگ یک بهروزرسانی با ریسک برخورد بیشازحد تبدیل شود. بنابراین سختی فقط برای منصفانهترکردن رتبهبندی نسبی استفاده میشود، درحالیکه گارد برخورد مستقل باقی میماند.
در هر راند، پس از آموزش محلی، سیاستی که قرار است آپلود شود منجمد میشود و روی ۲۵ اپیزود تازه و جدا از دادهٔ گرادیان ارزیابی میگردد. از شمارشهای خام، کران پایین ویلسون برای نرخ موفقیت و کران بالای ویلسون برای نرخ برخورد و نرخ نقض ساخته میشود تا تصمیم تجمیع به یک نرخ خام و پرنوسان وابسته نباشد. امتیاز باقیماندهای، گیت برخورد و سهم پایهٔ کلاینت با هم وزن نهایی را میسازند. یک کنترلگر آنتروپی نیز مانع تمرکز افراطی وزن روی تعداد بسیار کمی از کلاینتها میشود.
از آنجا که میانگینگیری پارامترهای شبکههای سیاست ممکن است حتی با وجود مدلهای محلی مناسب، یک مدل جهانی ضعیف یا ناایمن تولید کند، هر نامزد تجمیع پیش از انتشار در لایهٔ ServerOps با rollout تازه ارزیابی میشود. اگر نامزد SGDA گاردهای پاداش، هزینهٔ جامع ناایمنی و لایهٔ سخت را پاس کند، پذیرفته میشود. در غیر این صورت، نامزد FedAvg بهعنوان fallback جداگانه ارزیابی میشود و اگر آن هم مردود باشد، سرور به مدل قبلی بازمیگردد. پس از fine-tuning مشترک نیز ارزیابی اجباری تکرار میشود و شکست آن باعث بازگشت به نامزد پذیرفتهشدهٔ پیش از fine-tuning خواهد شد.
برای جداسازی اثر اجزای روش، بازوهای اصلی بهصورت پروتکلهمتا طراحی شدهاند: FedAvg+PPO+ServerOps کنترل اصلی است؛ SGDA+PPO+ServerOps اثر خالص قاعدهٔ تجمیع را نشان میدهد؛ FedAvg+LPPO-Lag+ServerOps اثر یادگیرندهٔ ایمن محلی را جدا میکند؛ و SGDA+LPPO-Lag+ServerOps سامانهٔ کامل پیشنهادی است. دو ابلیشن تماممقیاس نیز بهترتیب گیت ایمنی و تعدیل سختی را حذف میکنند. ادعای اصلی فقط زمانی تأیید میشود که نرخ برخورد روش پیشنهادی کمتر باشد و همزمان نرخ موفقیت و نرخ جامع اپیزود ناایمن نسبت به کنترل، افت مادی نداشته باشند. به این ترتیب کاهش برخورد به بهای افزایش خروج از جاده یا نقض فاصلهٔ ایمن، موفقیت محسوب نخواهد شد.
۲بیان مسئله #
خودروی خودران باید چند هدف را بهصورت همزمان محقق کند: مسیر را کامل کند، از برخورد جلوگیری کند، از محدودهٔ جاده خارج نشود، فاصله و زمان برخورد ایمن را حفظ کند و تحت تغییرات ترافیک و خطای عملگر نیز پایدار بماند. یادگیری تقویتی میتواند یک سیاست کنترلی را مستقیماً از تعامل با محیط بیاموزد، اما عملکرد سیاست به توزیع سناریوهای آموزش وابسته است. سیاستی که در یک جادهٔ ساده و ترافیک سبک موفق است، ممکن است با افزایش تراکم، پیچیدگی هندسه، بایاس فرمان یا اختلال زمانهمبستهٔ عملگر دچار افت شدید شود.
در معماری متمرکز، دادههای همهٔ خودروها برای آموزش یک مدل مشترک به سرور منتقل میشوند. این کار از نظر حجم داده، حریم خصوصی و مالکیت اطلاعات عملیاتی مطلوب نیست. یادگیری فدرال امکان میدهد هر کلاینت مدل را با داده و تعامل محلی بهروزرسانی کند و فقط پارامتر یا گرادیان را برای سرور بفرستد. بااینحال، فدرالبودن بهتنهایی مسئلهٔ ناهمگنی را حل نمیکند. در واقع، ناهمگنی محیطی در FRL شدیدتر از یادگیری نظارتشده است، زیرا هر سیاست با محیط خودش تعامل میکند و کیفیت دادهٔ حاصل نیز به خود سیاست وابسته است.
FedAvg فرض میکند وزندهی بر اساس سهم داده یا گام محلی تقریب مناسبی برای هدف جهانی است. این فرض وقتی همهٔ کلاینتها شرایط نزدیک به هم دارند قابل قبولتر است، اما در این پژوهش کلاینتها عمداً از نظر اختلال، ترافیک و هندسه متفاوتاند. در چنین وضعی، سه مشکل رخ میدهد:
- نرخ موفقیت پایین الزاماً به معنای مدل بد نیست؛ ممکن است سناریو بسیار دشوار باشد.
- نرخ موفقیت بالا الزاماً به معنای مدل خوب نیست؛ ممکن است سناریو بسیار آسان باشد.
- حتی اگر دشواری را در امتیاز لحاظ کنیم، نباید بهروزرسانی با ریسک برخورد بسیار بالا فقط بهدلیل دشواربودن محیط سهم زیادی بگیرد.
بنابراین سؤال اصلی این است که چگونه میتوان شایستگی هر مدل محلی را «نسبت به سطح سختی خودش» سنجید، بدون آنکه ایمنی مطلق به یک مفهوم کاملاً نسبی تبدیل شود. پاسخ پیشنهادی این پژوهش، تفکیک دو نقش است: SDS و امتیاز باقیماندهای برای مقایسهٔ منصفانه، و گیت برخورد برای مهار مستقل ریسک.
۳ضرورت و اهمیت پژوهش #
اهمیت علمی پژوهش در این است که سه حوزه را به هم متصل میکند: یادگیری تقویتی فدرال در محیطهای ناهمگن، یادگیری تقویتی ایمن، و تصمیمگیری قابل حسابرسی در سمت سرور. بسیاری از روشهای فدرال روی همگرایی یا ناهمگنی داده تمرکز دارند، اما در کاربرد خودرو کافی نیست که میانگین پاداش افزایش یابد؛ باید روشن باشد آیا برخورد، خروج از جاده یا نقض فاصلهٔ ایمن نیز کاهش یافته است.
اهمیت عملی پژوهش نیز از ناهمگنی طبیعی ناوگان ناشی میشود. خودروها در مناطق مختلف با جاده، ترافیک و کیفیت عملگر یکسان روبهرو نیستند. اگر سرور بدون درک این تفاوتها مدلها را ترکیب کند، ممکن است اطلاعات مفید مناطق سخت را از دست بدهد یا یک بهروزرسانی محلی پرریسک را وارد مدل جهانی کند. SGDA تلاش میکند میان استفاده از تنوع محیطی و کنترل ریسک توازن ایجاد کند.
این پایاننامه ادعا نمیکند که صرفاً با عدم ارسال دادهٔ خام، حریم خصوصی کامل حاصل میشود. حملات استنتاجی از روی بهروزرسانی مدل همچنان ممکناند و Secure Aggregation یا Differential Privacy برای استقرار واقعی لازم خواهند بود. همچنین روش پیشنهادی استاندارد حقوقی ایمنی یا تضمین رسمی عدم برخورد ارائه نمیدهد؛ هدف، طراحی و اعتبارسنجی تجربی یک قاعدهٔ تجمیع ریسکآگاه در شبیهساز است.
۴شکاف پژوهشی و ایدهٔ اصلی #
روشهای متعارف مانند FedAvg، FedProx و FedNova عمدتاً اختلاف توزیع داده یا تعداد گام محلی را مدیریت میکنند. روشهای Safe RL مانند رویکردهای لاگرانژی، ایمنی را در سطح آموزش یک عامل محلی دنبال میکنند. برخی روشهای انتخاب کلاینت نیز از پاداش، همگرایی یا کیفیت بهروزرسانی برای گزینش استفاده میکنند. بااینحال، در مسئلهٔ حاضر هنوز یک نیاز مشخص باقی میماند: قاعدهای که کیفیت مدل محلی را نسبت به سختی عینی سناریو بسنجد، ریسک سطحبالا را جداگانه محدود کند و مدل تجمیعشده را پیش از انتشار دوباره آزمایش نماید.
نوآوری مورد ادعا «ابداع نخستین FRL خودرویی» یا «ابداع primal–dual فدرال» نیست. سهم اصلی، طراحی و ارزیابی این ترکیب در یک پروتکل واحد و قابل ابلیشن است:
- SDS عینی و مستقل از پیامد آموزش؛
- باقیماندهگیری عملکرد در سطح سختی مشابه؛
- گیت نرم برخورد که مستقل از SDS عمل میکند؛
- کنترل آنتروپی برای جلوگیری از فروپاشی وزنها؛
- ServerOps با زنجیرهٔ ACCEPT/FALLBACK/REVERT؛
- آموزش محلی LPPO-Lag برای کنترل تجربی هزینه؛
- و ثبت توضیحپذیری پسینی وزنها بدون دخالت در تصمیمگیری.
۵اهداف پژوهش #
۵-۱. هدف اصلی #
طراحی و اعتبارسنجی تجربی SGDA-R برای کاهش نرخ برخورد در یادگیری تقویتی فدرال خودروهای خودران متصل، بهگونهای که نرخ موفقیت و نرخ جامع اپیزود ناایمن نسبت به کنترل پروتکلهمتای FedAvg دچار افت مادی نشوند.
۵-۲. اهداف فرعی #
- تعریف یک امتیاز سختی چهاربعدی برای سناریوهای رانندگی بدون استفاده از نرخ موفقیت، برخورد یا پاداش.
- طراحی امتیاز باقیماندهای که عملکرد هر کلاینت را با انتظار همان سطح سختی مقایسه کند.
- طراحی گیت نرم برخورد برای جلوگیری از اثرگذاری بیشازحد بهروزرسانیهای پرخطر.
- استفاده از کرانهای ویلسون برای لحاظکردن عدمقطعیت نرخهای حاصل از نمونهٔ محدود.
- بررسی مکملبودن SGDA در سطح سرور و LPPO-Lag در سطح کلاینت.
- طراحی ServerOps برای ارزیابی نامزد تجمیعشده پیش از انتشار.
- تفکیک اثر SGDA، LPPO-Lag، گیت، SDS، ServerOps و fine-tuning با مقایسههای کنترلشده.
- سنجش تعمیم روش در شرایط ID و OOD.
- اعتبارسنجی مستقل SDS بهعنوان شاخص سختی کارایی و ایمنی.
- فراهمکردن لاگهای قابل بازپخش برای توضیح وزن هر کلاینت و تصمیم نهایی سرور.
۶پرسشها و فرضیههای پژوهش #
۶-۱. پرسشهای اصلی #
RQ1. آیا سامانهٔ کامل SGDA+LPPO-Lag+ServerOps نسبت به FedAvg+PPO+ServerOps نرخ برخورد کمتری ایجاد میکند، بدون آنکه نرخ موفقیت یا نرخ جامع ناایمنی افت مادی داشته باشد؟
RQ2. چه مقدار از اثر مشاهدهشده واقعاً به قاعدهٔ تجمیع SGDA مربوط است و چه مقدار از LPPO-Lag یا ServerOps ناشی میشود؟
RQ3. آیا گیت برخورد واقعاً ضروری است، یا امتیاز باقیماندهای بهتنهایی نتیجهٔ مشابهی ایجاد میکند؟
RQ4. آیا تعدیل سختی با SDS واقعاً اطلاعات مفیدی به تجمیع میافزاید، یا یک امتیاز بدون سختی نیز کافی است؟
RQ5. آیا SDS روی سناریوهایی که در برازش آن استفاده نشدهاند، با کاهش موفقیت و افزایش ناایمنی رابطهٔ جهتدار دارد؟
RQ6. آیا روش پیشنهادی در اختلالات خارج از توزیع نیز نسبت به کنترل اصلی بهتر یا دستکم غیرحقیر باقی میماند؟
۶-۲. فرضیهها #
H1 — اثر سامانهٔ کامل در ID: بازوی E6 باید نسبت به E1′ نرخ برخورد پایینتری داشته باشد؛ همزمان نرخ موفقیت با حاشیهٔ ۰٫۰۳ و نرخ C^{ind} با حاشیهٔ ۰٫۰۵ غیرحقیر بمانند. هر سه شرط باید با هم برقرار باشند.
H1b — اثر خالص SGDA زیر PPO: بازوی E5 باید نسبت به E1′ همان آزمون سهجزئی را پاس کند. علاوه بر آن، نرخ پذیرش مستقیم نامزد SGDA پس از warm-up باید دستکم ۰٫۶۰ باشد تا نتیجه به خود نامزد SGDA نسبت داده شود، نه به fallback یا revert غالب.
H2 — تعمیم OOD: در Moderate-OOD، نرخ موفقیت E6 نسبت به E1′ باید برتر باشد. در Severe-OOD، نرخ موفقیت باید با حاشیهٔ ۰٫۰۳ غیرحقیر بماند. C^{ind} در هر دو سطح Moderate و Severe باید با حاشیهٔ ۰٫۰۵ غیرحقیر باشد. افت ID به OOD در داخل هر روش صرفاً توصیفی است و مبنای ادعای علی نیست.
H3 — اعتبار SDS: روی ۱۷ پیکربندی مستقل، SDS باید با SR رابطهٔ منفی و با C^{ind} رابطهٔ مثبت داشته باشد. چهار مؤلفهٔ اصلی نیز باید جهت مورد انتظار را نشان دهند و مدل چهاربعدی برای پیشبینی C^{ind} از مدل اختلالتنها بهتر و برای SR دستکم غیرحقیر باشد.
H4 — اثر fine-tuning: فقط در صورت اجرای بازوی E7 در مقیاس کامل آزموده میشود. انتظار میرود fine-tuning نرخ برخورد را کاهش دهد، بدون افت مادی SR و C^{ind}. در غیر این صورت این فرضیه حذف میشود و ادعایی دربارهٔ اثر مستقل fine-tuning مطرح نخواهد شد.
H5 — اثر LPPO-Lag زیر SGDA: E6 نسبت به E5 باید نرخ ناایمنی بدون برخورد V را کاهش دهد، مشروط بر عدمحقارت SR و C^{ind}.
۷محیط، کلاینتها و ناهمگنی سناریو #
محیط اصلی MetaDrive و تنظیم آن تک-ego است. هر کلاینت یک خودروی خودران را با سیاست یادگرفتهشده کنترل میکند. خودروهای اطراف با مدل واکنشی IDM حرکت میکنند؛ بنابراین عبارت «خودروهای متصل» در این پژوهش به معماری اشتراک مدل میان کلاینتها اشاره دارد، نه آموزش همزمان چند خودروی ego در یک صحنه.
تعداد کلاینتها K=16 است. همهٔ کلاینتها معماری شبکه، فضای مشاهده و فضای عمل یکسان دارند و از یک warm-start مشترک و قفلشده شروع میکنند. فضای عمل پیوسته شامل فرمان و شتاب/ترمز است. ناهمگنی از شش منشأ ساخته میشود: بایاس پایدار عملگر، شدت اختلال OU، شوک گذرا، تراکم ترافیک، پیچیدگی هندسی و ریسک معنایی سناریو.
اختلال فقط روی فرمان نرمالشدهٔ عملگر در آموزش اعمال میشود:
در این رابطه، b_i بایاس ثابت کلاینت، xi(i,t) فرایند Ornstein–Uhlenbeck و z(i,t) شوک گذراست. OU یک تنشآزمون زمانهمبسته برای فرمان عملگر است و نباید بهعنوان مدل کامل باد، اصطکاک یا نیروی فیزیکی بیرونی معرفی شود. نویز مشاهده و کاهش اصطکاک در آموزش اصلی وارد نمیشوند و فقط برای آزمون OOD نگه داشته میشوند تا تعمیم واقعیتر سنجیده شود.
پروتکل اصلی شامل T=100 راند فدرال است. در هر راند هر کلاینت E=25 تکرار محلی انجام میدهد. منظور از تکرار محلی «اپیزود» نیست؛ هر تکرار شامل ۲۰۴۸ گام محیط و ۱۰ epoch بهروزرسانی PPO روی batch گردآوریشده است. یکسانبودن این قرارداد برای بازوهای مقایسهشونده ضروری است تا اختلاف نتیجه از روش ناشی شود، نه از آموزش بیشتر یک بازو.
۸تعریف پیامدهای ایمنی و دلیل استفاده از C^{ind} #
برای آنکه کاهش یک نوع شکست با افزایش نوع دیگری پنهان نشود، رخدادهای ناایمن در هر اپیزود بهصورت ناپوشا تعریف میشوند:
- CR: اپیزود دارای برخورد؛
- OR: خروج از جاده، مشروط به اینکه برخورد رخ نداده باشد؛
- V_prox: نقض بحرانی فاصله یا TTC، مشروط به اینکه برخورد و خروج از جاده رخ نداده باشد؛
- V = OR + V_prox؛
- C^{ind} = CR + OR + V_prox، یعنی شاخص دودویی «اپیزود ناایمن»؛
- C^{sum}: هزینهٔ درجهبندیشده برای CVaR و تحلیل تشخیصی، نه متغیر اصلی PASS یا فرضیهها.
ناپوشابودن دستهها مهم است، زیرا یک اپیزود نباید همزمان در چند نرخ اصلی دوبارهشماری شود. C^{ind} نیز به این دلیل استفاده میشود که صرفاً کمشدن CR کافی نیست. ممکن است سیاست با رانندگی بسیار محافظهکارانه برخورد را کم کند اما خروج از جاده یا نقض فاصله را افزایش دهد. در این حالت ادعای بهبود ایمنی کلی قابل قبول نیست.
بااینحال، C^{ind} بهتنهایی نیز نوع شکست را نشان نمیدهد. به همین علت CR، OR و V_prox جداگانه گزارش میشوند. اگر برآورد نقطهای اختلاف هر مؤلفهٔ «روش منهای کنترل» به ۰٫۰۵ یا بیشتر برسد، پرچم FAILURE_REDISTRIBUTION ثبت میشود. این پرچم نشان میدهد احتمالاً شکست از یک طبقه به طبقهٔ دیگر منتقل شده است، حتی اگر مجموع C^{ind} ظاهراً قابل قبول باشد.
۹امتیاز سختی سناریو (SDS): تعریف، منطق و اعتبارسنجی #
۹-۱. چرا به SDS نیاز داریم؟ #
اگر دو کلاینت نرخ موفقیت ۰٫۷ داشته باشند ولی یکی در جادهٔ ساده و دیگری در ترافیک متراکم و هندسهٔ دشوار آموزش دیده باشد، یکساندانستن آنها منصفانه نیست. همچنین مقایسهٔ نرخ برخورد ۰٫۲ در یک سناریوی ساده با همان نرخ در یک سناریوی بسیار دشوار، کیفیت نسبی مدل را آشکار نمیکند. SDS یک محور مشترک برای توصیف دشواری سناریو فراهم میکند تا عملکرد نسبت به انتظار همان سطح سختی سنجیده شود.
۹-۲. تعریف SDS #
فرم اصلی شاخص چنین است:
مؤلفهها عبارتاند از:
- D^dist: شدت اختلال عملگر؛ شامل بایاس، شدت OU و شوک گذرا.
- D^traf: سختی ناشی از تراکم و تعامل ترافیکی.
- D^geo: دشواری هندسهٔ مسیر، مانند انحنا و ساختار جاده.
- D^sem: ریسک معنایی سناریو، مانند موقعیتهایی که به تصمیم کنترلی حساستر نیاز دارند.
هر ویژگی با کرانهای از پیش تعیینشده به بازهٔ [0,1] نگاشت و سپس مؤلفهها با وزن برابر ترکیب میشوند. وزن برابر انتخاب شده است تا پیش از دیدن نتایج اصلی، یک مؤلفه بهطور دلخواه غالب نشود. دو مؤلفهٔ kin و perc فقط در نسخهٔ ثانویهٔ D^6 و تلهمتری بررسی میشوند و وارد وزندهی اصلی SGDA نمیشوند.
۹-۳. چرا پیامدهای آموزش وارد SDS نمیشوند؟ #
SR، CR، V و reward در ساخت SDS استفاده نمیشوند. اگر نرخ برخورد یا موفقیت وارد تعریف سختی شود، استدلال روش دوری خواهد شد: ابتدا از نتیجهٔ مدل سختی را میسازیم و سپس همان نتیجه را با سختی توضیح میدهیم. در این طرح، SDS فقط از مشخصات سناریو و محیط میآید. به همین دلیل میتوان مستقل از سیاست دربارهٔ سختی صحبت کرد.
۹-۴. محدودیت SDS #
یک عدد اسکالر نمیتواند تمام تفاوت نوع سختی را حفظ کند. دو سناریو ممکن است D یکسان داشته باشند، اما یکی عمدتاً بهدلیل ترافیک و دیگری بهدلیل اختلال عملگر دشوار باشد. به همین دلیل، علاوه بر D کل، مؤلفههای چهارگانه جداگانه تحلیل میشوند و مدل چهاربعدی با مدل «اختلالتنها» مقایسه میشود. SDS در این پایاننامه یک متریک شبیهساز است؛ دسترسی یک سرور واقعی به همهٔ پارامترهای آن اثبات نمیشود.
۹-۵. چگونه SDS را تأیید میکنیم؟ #
اعتبار SDS با نتیجهٔ خود SGDA سنجیده نمیشود، زیرا این کار وابستگی ایجاد میکند. برای آزمون H3، سیاست E1 یعنی FedAvg+PPO بدون ServerOps منجمد میشود و روی مجموعهٔ مستقل G_H3-out با ۱۷ پیکربندی جدید اجرا میگردد. برای هر seed و هر پیکربندی ۱۰۰ اپیزود ارزیابی انجام میشود.
آزمونهای اعتبار عبارتاند از:
- H3a: شیب D→SR باید منفی و شیب D→C^{ind} مثبت باشد؛ هر دو شرط بهصورت IUT لازماند.
- H3b: هر یک از چهار مؤلفهٔ اصلی باید برای SR و C^{ind} جهت مورد انتظار را نشان دهد.
- H3c: با اعتبارسنجی leave-one-configuration-out، مدل چهاربعدی باید در پیشبینی C^{ind} از مدل اختلالتنها RMSE کمتری داشته باشد و برای پیشبینی SR با حاشیهٔ ۰٫۰۱ غیرحقیر باشد.
- H3c′: ارزش افزودهٔ kin و perc فقط بهصورت ثانویه بررسی میشود.
اگر SDS فقط با SR یا reward ارتباط داشته باشد اما با C^{ind} ارتباط مثبت و پایدار نشان ندهد، آن را «شاخص سختی کارایی» مینامیم، نه شاخص معتبر سختی ایمنی. اگر حتی روابط جهتدار نیز برقرار نباشند، SDS صرفاً یک heuristic مهندسی تلقی میشود و ادعای اعتبار سازهای آن رد خواهد شد.
۱۰روش پیشنهادی SGDA-R: منطق کلی #
SGDA مخفف Safety-Gated Difficulty-Aware Aggregation است. ایدهٔ آن این نیست که سختی را مستقیماً به وزن بیشتر تبدیل کند. در واقع، یک کلاینت فقط بهدلیل دشواربودن نباید پاداش بگیرد. روش میپرسد: «این کلاینت با توجه به سختی محیطش، بهتر یا بدتر از انتظار عمل کرده است؟» سپس جداگانه میپرسد: «آیا کران بالای ریسک برخورد آن از سقف کالیبره عبور کرده است؟» پاسخ سؤال اول امتیاز نسبی را میسازد و پاسخ سؤال دوم گیت ایمنی را.
وزن نهایی سه عامل دارد:
- p_i: سهم پایهٔ کلاینت؛
- g_i: گیت ایمنی برخورد؛
- exp(beta × score_i^R): شایستگی نسبی آگاه از سختی.
بنابراین روش نه یک حذف سخت کلاینت است و نه یک رتبهبندی صرف بر اساس پاداش. در ادامه، تمام مراحل و دلیل وجود هر مرحله توضیح داده میشود.
۱۱مرحلهٔ اول SGDA: ارزیابی تازهٔ سیاست محلی #
پس از پایان آموزش محلی هر راند، همان سیاستی که قرار است آپلود شود منجمد میگردد و در پیکربندی محلی کلاینت روی ۲۵ اپیزود تازه اجرا میشود. این جریان local-score از اپیزودهای آموزش جداست.
دلیل جداسازی این است که دادهٔ آموزش با سیاستی که در طول rollout تغییر میکند تولید شده و از نظر آماری یک نمونهٔ ثابت و مناسب برای سنجش نرخ نیست. اگر نرخهای آموزش مستقیماً وارد وزندهی شوند، کلاینتی که در بخشی از راند خوششانس بوده یا رفتار اکتشافی متفاوتی داشته است ممکن است وزن نامتناسب بگیرد. ارزیابی سیاست منجمد، نرخها را زیر یک سیاست ثابت میسازد و امکان استفادهٔ معنادار از کرانهای دوجملهای را فراهم میکند.
از این rollout سه شمارش اصلی استخراج میشود: تعداد موفقیتها، تعداد برخوردها و تعداد نقضهای بدون برخورد. صورت و مخرج خام ذخیره میشوند تا بعداً محاسبهٔ نرخ و کران قابل ممیزی باشد. این مجموعه Test یا Validation نهایی نیست، زیرا خروجی آن مستقیماً تصمیم تجمیع را کنترل میکند.
۱۲مرحلهٔ دوم SGDA: کرانهای ویلسون و عدمقطعیت #
با ۲۵ اپیزود، تفاوت یک یا دو رخداد میتواند نرخ را بهطور محسوس تغییر دهد. استفادهٔ مستقیم از نرخ خام ممکن است کلاینت خوششانس را تقویت یا کلاینت بدشانس را تنبیه کند. برای محافظهکاری از کرانهای ویلسون استفاده میشود:
برای موفقیت، کران پایین مصرف میشود؛ یعنی روش به شواهد محافظهکارانهٔ موفقیت تکیه میکند. برای برخورد و نقض، کران بالا مصرف میشود؛ یعنی احتمال ریسک دستکم گرفته نمیشود. کران ویلسون روی شمارش خام همان راند ساخته میشود، نه روی EMA نرخها. اعمال بازهٔ دوجملهای روی میانگین وزنی چند راند با مخرج اسمی، پوشش آماری روشنی ندارد.
EMA بعداً روی باقیماندهها و حاشیهٔ گیت اعمال میشود تا نوسان تصمیم کاهش یابد. در هر بازبرازش منحنیهای مرجع، EMA reset میشود تا باقیماندههای ساختهشده نسبت به دو مرجع متفاوت با هم مخلوط نشوند.
۱۳مرحلهٔ سوم SGDA: ساخت منحنی انتظار برحسب سختی #
سرور یک مجموعهٔ مستقل به نام G_fit با ۱۷ پیکربندی دارد. این مجموعه برای آزمون نهایی نیست و فقط دو نقش دارد: برازش رابطهٔ مورد انتظار میان سختی و پیامدها، و کالیبراسیون سقف گیت. روی این مجموعه سه منحنی محدودشده برازش میشود:
- SR_hat^L(D): با افزایش سختی باید نایفزاینده باشد؛
- CR_hat^U(D): با افزایش سختی باید ناکاهشی باشد؛
- V_hat^U(D): با افزایش سختی باید ناکاهشی باشد.
قید جهت از منطق مسئله میآید: دشوارترشدن سناریو نباید در منحنی مرجع بهطور مصنوعی موفقیت مورد انتظار را بیشتر یا ریسک را کمتر نشان دهد. بازبرازش در cadence از پیش ثبتشده انجام میشود و G_fit با G_H3-out و Test همپوشانی ندارد.
این منحنیها برای پیشبینی دقیق علمی آینده طراحی نشدهاند؛ نقش آنها ساخت یک مرجع منصفانه برای مقایسهٔ کلاینتهاست. برای مثال، CR برابر ۰٫۳ ممکن است در سختی پایین بدتر از انتظار و در سختی بالا بهتر از انتظار باشد. SGDA این تفاوت را با باقیمانده نشان میدهد.
۱۴مرحلهٔ چهارم SGDA: امتیاز باقیماندهای #
برای هر کلاینت سه باقیمانده ساخته میشود:
تفسیر آنها ساده است:
- e_i^S مثبت یعنی کلاینت از نظر موفقیت بهتر از انتظار همان سطح سختی عمل کرده است.
- e_i^C مثبت یعنی برخورد آن بیشتر از انتظار همان سطح سختی است و باید جریمه شود.
- e_i^V مثبت یعنی نقضهای بدون برخورد آن بیشتر از انتظار است و باید جریمه شود.
پس از هموارسازی، امتیاز نهایی چنین است:
اگر کلاینت دقیقاً مطابق انتظار سطح سختی خودش عمل کند، امتیاز تقریباً صفر میشود. اگر موفقیت بهتر و ریسک کمتر از انتظار باشد، امتیاز مثبت میگیرد. این سازوکار کلاینت دشوار را صرفاً بهدلیل دشواربودن تقویت نمیکند؛ فقط کیفیت نسبی آن را آشکار میسازد.
چرا CR و V هر دو در score هستند؟ چون تمرکز فقط بر برخورد ممکن است سیاستی تولید کند که بهجای برخورد، بیشتر از جاده خارج شود یا فاصلهٔ بحرانی ایجاد کند. واردکردن V در امتیاز و گزارش جداگانهٔ مؤلفهها، جابهجایی شکست را دشوارتر میکند.
۱۵مرحلهٔ پنجم SGDA: گیت ایمنی مستقل از سختی #
امتیاز باقیماندهای بهتنهایی کافی نیست. فرض کنید یک کلاینت در محیط بسیار دشوار، نرخ برخوردی بهتر از انتظار همان محیط دارد، اما سطح مطلق ریسک آن هنوز بسیار بالاست. اگر فقط score استفاده شود، این کلاینت میتواند وزن زیادی بگیرد. برای جلوگیری از این وضعیت، گیت برخورد مستقل از D تعریف میشود:
اگر کران بالای برخورد پایینتر از سقف باشد، g نزدیک یک است. اگر روی سقف باشد، سهم متوسط میشود و اگر بالاتر از سقف باشد، وزن بهصورت نرم کاهش مییابد. کف g_min=10^-3 مانع صفرشدن کامل وزن است.
سقف از G_fit کالیبره میشود. در شروع:
و در بازبرازشها:
برای ۱۷ مقدار، چندک ۰٫۹ با قرارداد nearest-rank برابر مقدار شانزدهم پس از مرتبسازی است. c_hard یک سقف منجمد ضدرانش است تا اگر کل سامانه بدتر شد، آستانهٔ مجاز همراه آن بیحد شل نشود. این مقدار استاندارد قانونی یا تضمین مطلق ایمنی نیست؛ یک سقف نسبی و کالیبراسیونمحور در همین آزمایش است.
چرا گیت نرم است؟ حذف سخت ممکن است اطلاعات مفید کلاینتهای دشوار را ناگهان کنار بگذارد و تنوع را کاهش دهد. گیت نرم، سهم را کاهش میدهد ولی مسیر مشارکت را کاملاً نمیبندد. اینکه این طراحی واقعاً مفید است با ابلیشن E8 بررسی میشود؛ در E8 گیت حذف و g_i=1 قرار داده میشود، درحالیکه سایر اجزا ثابت میمانند.
۱۶مرحلهٔ ششم SGDA: وزندهی و کنترل آنتروپی #
وزن نهایی کلاینت بهصورت زیر است:
و مدل تجمیعشده از میانگین وزندار پارامترهای محلی ساخته میشود:
p_i سهم پایه، g_i گارد برخورد و جملهٔ نمایی رتبهبندی نسبی است. beta شدت تمرکز بر score را کنترل میکند. اگر beta به صفر میل کند و همهٔ g_i به یک نزدیک باشند، روش به وزن پایه و در بودجهٔ محلی برابر به FedAvg یکنواخت نزدیک میشود.
خطر جملهٔ نمایی این است که یک یا دو کلاینت وزن تقریباً کامل بگیرند. این وضعیت میتواند تنوع فدرال را از بین ببرد و مدل را نسبت به نویز یک کلاینت حساس کند. بنابراین آنتروپی بردار وزن محاسبه میشود:
حداقل آنتروپی H_min = 0.5 log(K) است. اگر آنتروپی کمتر باشد، beta نصف میشود و وزنها دوباره محاسبه میشوند. اگر حتی در beta_min فروپاشی رفع نشود، نامزد SGDA آن راند کنار گذاشته و WEIGHT_COLLAPSE ثبت میشود.
در این حالت وزن همان نامزد مستقیماً به p_i reset نمیشود، زیرا چنین کاری گیت را دور میزند و یک مدل با برچسب SGDA میسازد که در واقع FedAvg است. بهجای آن، نامزد FedAvg مستقل ساخته میشود و فقط از مسیر fallback و پس از ارزیابی تازه میتواند پذیرفته شود. این تفکیک برای انتساب علمی نتیجه ضروری است.
۱۷مرحلهٔ هفتم: ServerOps و کنترل انتشار مدل #
خوببودن وزنهای محلی تضمین نمیکند میانگین پارامترهای شبکه نیز خوب باشد. شبکههای عصبی غیرخطیاند و میانگینگیری دو سیاست مناسب میتواند سیاستی ضعیف تولید کند. به همین علت، مدل تجمیعشده مستقیماً منتشر نمیشود.
ServerOps نامزد را روی rollout تازه و مستقل ارزیابی میکند. برای کاهش واریانس مقایسه، مدل جدید و مدل مرجع با Common Random Numbers و شرایط محیطی زوجشده سنجیده میشوند. PASS سه جزء همیشهفعال دارد:
- گارد پاداش: افت پاداش از تلورانس از پیش قفلشده بیشتر نباشد.
- گارد C^{ind}: نرخ جامع اپیزود ناایمن بیش از تلورانس مجاز بدتر نشود.
- گارد لایهٔ سخت: هزینهٔ لایهٔ سخت باید شرط محافظتی مستقل را پاس کند.
ترتیب تصمیم دقیقاً چنین است:
- اگر نامزد SGDA پاس شود: ACCEPT_SGDA؛
- اگر رد شود: نامزد جداگانهٔ FedAvg ساخته و ارزیابی میشود؛
- اگر FedAvg پاس شود: FALLBACK_FEDAVG؛
- اگر آن هم رد شود: REVERT و ادامه با theta_t قبلی.
این زنجیره دو کار انجام میدهد: از انتشار یک مدل تجمیعشدهٔ آشکارا بد جلوگیری میکند و در عین حال نشان میدهد پیشرفت نهایی واقعاً از کدام نامزد آمده است. نرخ ACCEPT، FALLBACK و REVERT برای همهٔ بازوها گزارش میشود.
برای انتساب اثر به SGDA یک معیار سلامت عملیاتی نیز داریم. اگر در بازوی SGDA پس از warm-up، نرخ ACCEPT مستقیم کمتر از ۰٫۶۰ باشد، حتی در صورت خوببودن مدل نهایی نمیتوان گفت خود نامزد SGDA عامل اصلی بوده است؛ تفسیر محدود میشود به «سامانهای با fallback/revert غالب».
۱۸مرحلهٔ هشتم: fine-tuning مشترک و بازارزیابی اجباری #
میانگین پارامترهای سیاست ممکن است ناسازگاری کوتاهمدت ایجاد کند. پس از انتخاب نامزد قابل قبول، یک fine-tuning مشترک و محدود روی مجموعهٔ مستقل سرور انجام میشود. هدف، سازگارکردن سیاست تجمیعشده و کاهش آسیب ناشی از میانگینگیری پارامترهاست، نه انتخاب مدل با Test.
fine-tuning برای بازوهای پروتکلهمتا با قرارداد یکسان اجرا میشود. مهمتر اینکه مدل fine-tune شده دوباره همان گاردهای ارزیابی را طی میکند. اگر مدل پس از fine-tuning مردود شود، FT_ROLLBACK ثبت و مدل پذیرفتهشدهٔ قبل از fine-tuning منتشر میشود. بنابراین fine-tuning هیچگاه مجوز دورزدن ServerOps نیست.
اثر مستقل fine-tuning فقط با مقایسهٔ E6 و E7 قابل ادعاست و E7 باید در مقیاس کامل اجرا شود. اگر چنین بازویی اجرا نشود، fine-tuning بخشی از پروتکل سامانه باقی میماند اما دربارهٔ سهم علی آن ادعای جداگانه مطرح نمیشود.
۱۹آموزش محلی LPPO-Lag و نقش آن در ایمنی #
SGDA در سمت سرور تعیین میکند کدام بهروزرسانی محلی چه سهمی در مدل جهانی داشته باشد. اما بهتر است هر کلاینت نیز هنگام آموزش، هزینهٔ ایمنی را مستقیماً در نظر بگیرد. برای این منظور در بازوی کامل از LPPO-Lag استفاده میشود.
تابع actor بهصورت یک surrogate پاداش–هزینه است:
و متغیر دوگان محلی با توجه به عبور هزینه از حد هدف بهروزرسانی میشود:
lambda_local ← Projection_[0,lambda_max](lambda_local + eta_lambda × (C_bar^{ind} - d_safe))
دو critic جدا برای پاداش و هزینه و دو advantage جدا نگهداری میشوند. وقتی هزینه از d_safe بیشتر شود، lambda_local افزایش مییابد و جریمهٔ ایمنی در بهروزرسانی actor پررنگتر میشود؛ در شرایط ایمنتر، فشار جریمه کاهش مییابد.
LPPO-Lag و SGDA جایگزین یکدیگر نیستند. LPPO-Lag رفتار هر سیاست محلی را کنترل میکند، درحالیکه SGDA خطر انتقال یک بهروزرسانی نامناسب به مدل جهانی را مدیریت میکند. مکملبودن آنها با دو مقایسه بررسی میشود: E2′−E1′ اثر LPPO-Lag زیر FedAvg و E6−E5 اثر آن زیر SGDA را نشان میدهد.
این روش تضمین صوری feasibility ندارد، زیرا cost critic تنزیلیافته و قید اپیزودی دقیقاً یک کمیت نیستند. اگر بیش از نیمی از کلاینتها در lambda_max اشباع شوند، روش در گزارش «پنالتی تطبیقی» نامیده میشود، نه الگوریتمی با قید تضمینشده.
۲۰الگوریتم کامل یک راند فدرال #
برای روشنشدن جریان اجرایی، یک راند کامل بهترتیب زیر انجام میشود:
- در راندهای بازبرازش، theta_t روی ۱۷ پیکربندی G_fit ارزیابی میشود و منحنیهای انتظار و c_max بهروزرسانی میگردند.
- سرور مدل جهانی theta_t را برای ۱۶ کلاینت ارسال میکند.
- هر کلاینت با PPO یا LPPO-Lag، مطابق بازوی آزمایش، ۲۵ تکرار محلی انجام میدهد.
- سیاست محلی نهایی theta_(t,i) منجمد میشود.
- هر کلاینت سیاست منجمد را روی ۲۵ اپیزود local-score تازه اجرا میکند.
- شمارش خام موفقیت، برخورد، خروج از جاده و نقض فاصله برای سرور ارسال میشود.
- سرور کران پایین SR و کران بالای CR و V را با ویلسون محاسبه میکند.
- D_i از پیکربندی عینی سناریوی کلاینت خوانده میشود.
- نرخهای محافظهکارانه با منحنی انتظار همان D_i مقایسه و باقیماندهها ساخته میشوند.
- score_i^R و گیت g_i مستقل از سختی محاسبه میشوند.
- وزنها ساخته و کنترل آنتروپی اجرا میشود. در فروپاشی حلنشده، نامزد SGDA کنار گذاشته میشود.
- theta_agg با وزنهای نهایی ساخته میشود.
- ServerOps نامزد SGDA را روی rollout تازه و زوجشده ارزیابی میکند.
- در صورت رد، نامزد FedAvg جداگانه ارزیابی میشود؛ در صورت رد هر دو، مدل قبلی حفظ میشود.
- نامزد پذیرفتهشده fine-tune و سپس دوباره ارزیابی میشود.
- در صورت شکست fine-tuning، مدل پیش از fine-tuning بازیابی میشود.
- مدل نهایی راند منتشر و تمام نرخها، کرانها، SDS، باقیماندهها، گیت، وزنها و برچسب تصمیم ثبت میشوند.
این زنجیره نشان میدهد SGDA فقط یک فرمول وزن نیست؛ یک پروتکل کامل تصمیمگیری و کنترل انتشار است. بااینحال، در تحلیل علمی اثر فرمول وزن، learner محلی و ServerOps جداگانه سنجیده میشوند تا نتیجه به یک بستهٔ مبهم نسبت داده نشود.
۲۱توضیحپذیری و قابلیت حسابرسی #
هدف توضیحپذیری در این پایاننامه پاسخ به این سؤال است: «چرا کلاینت i در راند t این وزن را گرفت و چرا مدل پذیرفته یا رد شد؟» برای هر کلاینت این موارد ثبت میشوند: شمارشهای خام، کرانهای ویلسون، چهار مؤلفهٔ SDS، منحنی مرجع فعال، باقیماندهها، score، حاشیهٔ برخورد، مقدار گیت، beta، وزن نهایی و نتیجهٔ ServerOps.
دو بازپخش پادواقعی تعریف میشود:
- Delta_gate: تفاوت بردار وزن واقعی با حالتی که برای همهٔ کلاینتها g=1 است؛
- Delta_D: تفاوت بردار وزن واقعی با تعریف N-full که تعدیل سختی را حذف میکند.
چون softmax و نرمالسازی غیرخطیاند، این دو اثر جمعپذیر نیستند. برای تجزیهٔ دقیق پیش از نرمالسازی از رابطهٔ زیر استفاده میشود:
log p_i + log g_i + beta × score_i^R - log Z
بازپخش باید وزنهای ثبتشده را با خطای بیشینهٔ حداکثر 10^-8 و خطای جمع حداکثر 10^-10 بازسازی کند. جهت اثر گیت و حذف سختی نیز با تستهای مصنوعی کنترل میشود. اجرای XAI روشن و خاموش باید hash یکسانی برای checkpointهای آموزشی تولید کند؛ یعنی XAI فقط logging پسینی است و هیچ بازخوردی به آموزش، وزن یا PASS ندارد. توضیح رفتار درونی سیاست، مانند Integrated Gradients، خارج از هسته و کار آینده است.
۲۲تفکیک دادهها و جلوگیری از نشت اطلاعات #
نقش دادهها و seedها از هم جدا میشود:
- Train: تولید دادهٔ گرادیان محلی؛
- local-score: سنجش سیاست محلی برای کنترل تجمیع؛
- Validation: تنظیمات مجاز پیش از قفل پروتکل؛
- SDS-dev: توسعهٔ تعریف شاخص سختی؛
- G_fit: برازش منحنی انتظار و کالیبراسیون گیت؛
- G_H3-out: اعتبار مستقل SDS؛
- acceptance: ارزیابی ServerOps؛
- fine-tuning: سازگارسازی محدود مدل پذیرفتهشده؛
- ID-test و OOD-test: ارزیابی نهایی پس از قفل checkpoint.
هیچ اپیزود Test در ساخت SDS، تعیین c_max، انتخاب checkpoint، PASS، fine-tuning یا تحلیل حساسیت استفاده نمیشود. مجموعههای Test فقط یکبار پس از قفل مدلها باز میشوند. همچنین بعد از مشاهدهٔ Test بازوی آزمایشی جدیدی برای بهبود نتیجه اضافه نمیشود.
سه پایلوت P0، P1 و P2 نقشهای اعتباری جداگانه دارند:
- P0 فقط محیط، زیرساخت، شدت اختلال و کفایت سیگنال را کالیبره میکند.
- P1 زنجیرهٔ یکپارچهٔ SGDA، LPPO-Lag، ServerOps، PASS، fallback/revert و XAI را میآزماید و تنظیمات مجاز را قفل میکند.
- P2 فقط اندازه اثر اولیه، کوواریانس، MDE، توان و انتخاب N را تغذیه میکند.
داده، seed و checkpoint پایلوتها وارد جدول نتایج اصلی نمیشوند.
۲۳بازوهای آزمایشی و دلیل وجود هر بازو #
E1 — FedAvg+PPO بدون ServerOps #
این بازو مرجع متعارف ادبیات و سیاست مستقل مورد استفاده برای اعتبار SDS است. E1 نشان میدهد سامانهٔ سادهٔ فدرال بدون کنترل انتشار چگونه عمل میکند. مقایسهٔ E1′ با E1 اثر ServerOps را نشان میدهد.
E1′ — FedAvg+PPO+ServerOps #
این بازو کنترل اصلی است. معماری، warm-start، بودجهٔ آموزش، rolloutهای سرور و fine-tuning آن با بازوهای اصلی همتاست، اما وزندهی FedAvg باقی میماند. وجود E1′ ضروری است، زیرا مقایسهٔ مستقیم E6 با E1 میتوانست بهاشتباه اثر ServerOps را به SGDA نسبت دهد.
E2′ — FedAvg+LPPO-Lag+ServerOps #
در این بازو فقط learner محلی از PPO به LPPO-Lag تغییر میکند. مقایسهٔ E2′ با E1′ نشان میدهد کنترل لاگرانژی محلی زیر تجمیع FedAvg چه اثری دارد. مقایسهٔ E6 با E2′ نیز اثر SGDA را در شرایطی میسنجد که هر دو بازو learner ایمن یکسان دارند.
E5 — SGDA+PPO+ServerOps #
این بازو برای انتساب اثر خالص قاعدهٔ تجمیع ساخته شده است. E5 و E1′ هر دو PPO و ServerOps یکسان دارند و فقط FedAvg در برابر SGDA تغییر میکند. بنابراین E5−E1′ مهمترین مقایسه برای پاسخ به سؤال «آیا خود روش من مؤثر است؟» محسوب میشود.
E6 — SGDA+LPPO-Lag+ServerOps #
این بازو سامانهٔ کامل پیشنهادی است و ترکیب کنترل محلی و تجمیع ریسکآگاه را میسنجد. مقایسهٔ E6 با E1′ مزیت کل سامانه و مقایسهٔ E6 با E5 سهم LPPO-Lag زیر SGDA را نشان میدهد.
E8 — E6 بدون گیت #
در این ابلیشن g_i=1 است و سایر اجزای E6 حفظ میشوند. اگر E6 از E8 ایمنتر باشد و SR را حفظ کند، نقش فعال گیت پشتیبانی میشود. اگر E8 همسطح یا بهتر باشد، ادعای مفیدبودن گیت تأیید نمیشود. اگر E8 بهتر باشد، تفسیر از پیش ثبتشده این است که سقف کالیبره ممکن است اطلاعات مفید کلاینتهای سخت را بیشازحد کموزن کرده باشد. نتیجه مجوز بازتنظیم پسینی c_max روی همان Test نیست.
E9′-N-full — SGDA بدون تعدیل سختی #
در این ابلیشن، تعریف امتیاز به شکلی بازنویسی میشود که مرجع سختی حذف گردد، اما کل بردار وزن دوباره محاسبه میشود. مقایسهٔ E6 با این بازو نشان میدهد آیا SDS و باقیماندهگیری واقعاً ارزش افزوده دارند. اگر N-full بهتر باشد یا H3 شکست بخورد، ادعای مفیدبودن تعدیل سختی حمایت نمیشود.
R2 — آموزش متمرکز همبودجه #
این مرجع الزامی نشان میدهد معماری فدرال نسبت به آموزش متمرکز با قرارداد آموزشی همتا در چه موقعیتی قرار دارد. R2 برای اثبات برتری فدرال طراحی نشده است؛ یک نقطهٔ زمینهای برای تفسیر فاصلهٔ عملکرد است.
R1 — آموزش محلی مستقل #
هر کلاینت بدون تجمیع آموزش میبیند. این مرجع توصیفی نشان میدهد اشتراک مدل چه مزیتی نسبت به استقلال کامل دارد، اما در خانوادهٔ فرضیهٔ اصلی قرار نمیگیرد.
E7 — بدون fine-tuning #
این بازو فقط در صورت اجرای کامل میتواند H4 را پشتیبانی کند. اجرای ناقص یا کمseed آن صرفاً توصیفی است.
۲۴نگاشت دقیق ادعاها به آزمایشها #
ادعای ۱: سامانهٔ کامل بهتر است #
مقایسه: E6 در برابر E1′ در ID.
شرط تأیید:
- CR روش پیشنهادی بهطور استنباطی کمتر باشد؛
- کران پایین اختلاف SR بالاتر از -0.03 باشد؛
- کران بالای اختلاف C^{ind} پایینتر از +0.05 باشد.
این یک آزمون Intersection–Union است و هر سه شرط باید برقرار باشند. اگر فقط CR کم شود ولی SR یا C^{ind} شرط را پاس نکند، H1 رد میشود.
ادعای ۲: خود SGDA مؤثر است #
مقایسه: E5 در برابر E1′.
شرط تأیید: همان آزمون سهجزئی H1، بهعلاوهٔ نرخ ACCEPT مستقیم SGDA دستکم ۰٫۶۰ پس از warm-up.
تفسیر شکست: اگر مدل نهایی خوب باشد اما ACCEPT پایین بماند، فقط میتوان از کارایی سامانهٔ دارای fallback/revert سخن گفت. اگر E5 برتری نداشته باشد، مزیت E6 را نمیتوان به خود SGDA نسبت داد.
ادعای ۳: LPPO-Lag مفید است #
مقایسههای مکمل:
- E2′ در برابر E1′: اثر LPPO-Lag زیر FedAvg؛
- E6 در برابر E5: اثر LPPO-Lag زیر SGDA.
برای H5 انتظار میرود V کاهش یابد و SR و C^{ind} غیرحقیر بمانند. اگر فقط یکی از دو زمینه نتیجهٔ مثبت بدهد، اثر LPPO-Lag وابسته به قاعدهٔ تجمیع گزارش میشود.
ادعای ۴: SGDA زیر learner ایمن نیز اثر دارد #
مقایسه: E6 در برابر E2′.
این مقایسه PPO را حذف نمیکند، بلکه هر دو بازو LPPO-Lag و ServerOps یکسان دارند و فقط تجمیع فرق میکند. نتیجه بهعنوان پشتیبان مکانیزمی SGDA زیر آموزش محلی ایمن گزارش میشود.
ادعای ۵: ServerOps ضروری است #
مقایسه: E1′ در برابر E1.
معیارها: نرخ مدلهای ناایمن منتشرشده، CR، C^{ind}، SR و فراوانی fallback/revert. اگر E1′ تفاوت معناداری نداشته باشد، ServerOps بهعنوان لایهٔ محافظ تجربی مفید تأیید نمیشود.
ادعای ۶: گیت ایمنی نقش واقعی دارد #
مقایسه: E6 در برابر E8.
شرط موفقیت مکانیزمی: کاهش C^{ind} یا CR با حفظ SR طبق IUT از پیش ثبتشده. عدم معناداری بهمعنای همارزی نیست. اگر E8 بهتر باشد، نتیجه علیه طراحی گیت در رژیم فعلی است.
ادعای ۷: تعدیل سختی مفید است #
مقایسه: E6 در برابر E9′-N-full، همراه با نتایج H3.
برای تأیید قوی، هم ابلیشن باید به نفع E6 باشد و هم SDS روی G_H3-out اعتبار جهتدار نشان دهد. اگر فقط یکی برقرار باشد، ادعا محدود میشود: ممکن است SDS پیشبینیکننده باشد ولی در تجمیع ارزش افزوده نداشته باشد، یا برعکس یک heuristic عملی باشد بدون اعتبار سازهای کافی.
ادعای ۸: fine-tuning مفید است #
مقایسه: E6 در برابر E7، فقط در صورت اجرای تماممقیاس E7.
بدون این بازو، فقط نرخ FT_ROLLBACK و تغییر قبل/بعد بهصورت توصیفی گزارش میشود و ادعای علی مطرح نمیگردد.
ادعای ۹: روش در OOD پایدار است #
مقایسه: E6 در برابر E1′ در همان سطح Moderate یا Severe.
این مقایسه بین روشها در یک سطح OOD انجام میشود. مقایسهٔ افت ID→OOD داخل E6 صرفاً توصیفی است، زیرا نمیتواند ثابت کند تنوع آموزش علت تعمیم بوده است.
۲۵ارزیابی ID و OOD #
آزمون ID روی پیکربندیهایی انجام میشود که از همان خانوادهٔ توزیع آموزشاند ولی seed و اپیزود مستقل دارند. برای هر seed، ۱۶ پیکربندی ID و برای هر پیکربندی ۵۰ اپیزود اجرا میشود؛ در مجموع ۸۰۰ اپیزود ID برای هر seed.
OOD در سه سطح Mild، Moderate و Severe تعریف میشود. محورهای تغییر شامل شدت یا نوع جدید اختلال عملگر، نویز مشاهده، کاهش اصطکاک و تغییر هندسه است. این متغیرها در آموزش اصلی وارد نشدهاند یا در ترکیب و شدت جدید ظاهر میشوند. برای ۹ پیکربندی اصلی OOD، ۵۰ اپیزود بهازای پیکربندی و seed اجرا میشود. Extreme در صورت اجرا فقط stress-test توصیفی است و وارد فرضیهٔ تأییدی نمیشود.
برای H2، Moderate و Severe اهمیت اصلی دارند. در Moderate انتظار برتری SR وجود دارد، اما در Severe بهدلیل سختی بالا شرط واقعبینانهتر عدمحقارت SR است. در هر دو سطح، C^{ind} نباید بیش از ۰٫۰۵ بدتر شود. CR، OR و V_prox نیز جداگانه گزارش میشوند تا ایمنی ظاهری ناشی از جابهجایی شکست نباشد.
۲۶معیارهای ارزیابی #
معیارهای کارایی:
- SR یا نرخ موفقیت؛
- پاداش اپیزودی؛
- زمان رسیدن؛
- طول مسیر؛
- تلاش کنترلی و نرمی فرمان.
معیارهای ایمنی:
- CR؛
- OR؛
- V_prox؛
- V؛
- C^{ind}؛
- CVaR هزینهٔ C^{sum} برای ریسک دنباله.
معیارهای فدرال و سامانه:
- بدترین CR میان کلاینتها؛
- صدک دهم SR میان کلاینتها؛
- آنتروپی وزن و K_eff؛
- نرخ ACCEPT، FALLBACK، REVERT و FT_ROLLBACK؛
- فراوانی WEIGHT_COLLAPSE؛
- payload ارتباطی و تعداد واقعی env-step؛
- خطای fidelity در بازپخش وزنها.
گزارش میانگین جهانی بهتنهایی کافی نیست. ممکن است میانگین بهتر شود ولی چند کلاینت سخت بهشدت آسیب ببینند. معیارهای بدترین کلاینت و صدک دهم برای آشکارکردن این موضوع اضافه شدهاند.
۲۷پروتکل آماری و معیار تصمیم #
واحد استنباط، seed کامل آموزش است؛ اپیزودها فقط نرخ هر پیکربندی را میسازند و بهعنوان نمونهٔ مستقل روشها تلقی نمیشوند. همهٔ مقایسههای اصلی با Common Random Numbers زوج میشوند تا هر دو روش تا حد امکان با تصادفیبودن بیرونی یکسان روبهرو شوند.
N کوچکترین مقدار از مجموعهٔ {10,15,20} است که در تحلیل توان Monte-Carlo پیش از E1، توان توأمان حداقل ۰٫۸ را فراهم کند. انتخاب N پس از دیدن نتیجهٔ Test یا افزایش میانهٔ اجرا مجاز نیست.
برای N≤20، آزمون علامتگردانی دقیق روی اختلافهای زوجی seed انجام میشود؛ همهٔ 2^N حالت علامت بررسی میشوند. bootstrap زوجی برای فاصلهٔ اطمینان و اندازه اثر بهکار میرود. نتیجه فقط با p-value گزارش نمیشود و CI، برآورد اختلاف و اندازه اثر نیز ارائه خواهد شد.
H1 و H1b آزمون سهمؤلفهای IUT هستند. H2 چهار مؤلفه دارد: SR و C^{ind} در Moderate و Severe. خانوادهٔ H1/H1b/H2 با Holm کنترل میشود. آزمونهای مکانیزمی، ابلیشن و SDS با BH-FDR در q=0.10 کنترل میشوند.
برای عدمحقارت، اختلاف بهصورت «روش پیشنهادی منهای کنترل» تعریف میشود. در SR، کران پایین CI90% باید بالاتر از -0.03 باشد. در C^{ind}، کران بالای CI90% باید پایینتر از +0.05 باشد. جهت علامتها پیش از اجرای هسته در طرح تحلیل ثبت میشود.
seed فقط در صورت خطای زیرساختی قابل اثبات، مانند خرابی فایل یا exception خارج از الگوریتم، نامعتبر است. واگرایی، پاداش پایین یا CR بالا دلیل حذف نیست. اجرای نامعتبر با همان شناسه از checkpoint سالم یا از ابتدا تکرار و رخداد ثبت میشود.
۲۸آزمونهای نرمافزاری و بازتولیدپذیری #
علاوه بر آزمایشهای علمی، صحت پیادهسازی نیز باید تأیید شود. آزمونهای واحد برای موارد زیر اجرا میشوند:
- محاسبهٔ هر چهار مؤلفه و بازهٔ SDS؛
- کران پایین و بالای ویلسون از شمارشهای شناختهشده؛
- جهت sigmoid گیت؛
- نرمالسازی softmax و جمع وزنها برابر یک؛
- کنترل آنتروپی و ثبت WEIGHT_COLLAPSE؛
- بهروزرسانی و projection متغیر دوگان؛
- ناپوشابودن CR، OR و V_prox و صحت C^{ind}؛
- بازسازی وزن از لاگ با تلورانس تعیینشده.
آزمونهای یکپارچه نیز چرخهٔ Flower، ارسال مدل، local-score، PASS، fallback، revert، fine-tuning rollback، checkpoint/resume و تکرارپذیری replay را پوشش میدهند. یک آزمون A/A برای ServerOps اجرا میشود تا نرخ رد کاذب و رفتار مقایسهٔ زوجشده بررسی گردد.
نسخهٔ کتابخانهها، معماری شبکه، warm-start، seed namespaceها، splitها، gridها، حاشیههای آماری و قواعد تصمیم پیش از هسته قفل و hash میشوند. PILOT_PLAN.md پیش از پایلوتها و ANALYSIS_PLAN.md پس از P2 و پیش از E1 با SHA-256 ثبت میشوند. تغییر پروتکل پس از شروع هسته یا نیازمند اجرای مجدد تمام بازوهای متأثر است یا آن مقایسه را از تأییدی به توصیفی تنزل میدهد.
۲۹نتیجهٔ مثبت و منفی چگونه تفسیر میشود؟ #
حالت ۱: H1 و H1b هر دو موفقاند #
در این حالت هم سامانهٔ کامل و هم SGDA زیر PPO شواهد مثبت دارند. اگر E8 و E9′-N-full نیز به نفع E6 باشند، میتوان گفت گیت و تعدیل سختی هر دو در نتیجه نقش داشتهاند.
حالت ۲: H1 موفق ولی H1b ناموفق است #
سامانهٔ کامل مفید است، اما اثر را نمیتوان به خود SGDA نسبت داد. احتمال دارد LPPO-Lag، fine-tuning یا ServerOps عامل اصلی باشد. در این حالت عنوان نتیجه باید «سامانهٔ ترکیبی» باشد، نه «برتری قاعدهٔ SGDA».
حالت ۳: H1b از نظر پیامد موفق ولی ACCEPT کمتر از ۰٫۶۰ است #
مدل نهایی ممکن است خوب باشد، اما fallback/revert سهم غالب داشتهاند. نتیجه بهصورت «سامانه با کنترل انتشار محافظهکار» گزارش میشود و انتساب مستقیم به نامزد SGDA محدود خواهد بود.
حالت ۴: E8 همسطح یا بهتر از E6 است #
نقش ایمنی گیت تأیید نمیشود. اگر E8 بهتر باشد، احتمال کموزنشدن بیشازحد اطلاعات مفید مطرح میشود. بازتنظیم پسینی گیت روی همان آزمون مجاز نیست.
حالت ۵: E9′-N-full بهتر است #
تعدیل سختی ارزش افزوده نشان نداده یا حتی مضر بوده است. اگر H3 در عین حال موفق باشد، SDS ممکن است یک توصیفگر معتبر باشد ولی استفادهٔ فعلی آن در وزندهی مناسب نباشد.
حالت ۶: H3 فقط برای SR موفق است #
SDS بهعنوان proxy سختی کارایی پذیرفته میشود، نه سختی ایمنی. در این حالت ادعای «آگاه از سختی ایمنی» محدود میگردد.
حالت ۷: CR کم میشود ولی OR یا V_prox افزایش مییابد #
کاهش برخورد بهتنهایی پیروزی نیست. C^{ind}، حاشیهٔ عدمحقارت و پرچم FAILURE_REDISTRIBUTION تعیین میکنند آیا شکست فقط جابهجا شده است.
حالت ۸: H2 شکست میخورد #
مزیت روش به توزیع ID محدود گزارش میشود. از نتایج داخلی یا تحلیل پسینی برای ادعای تعمیم OOD استفاده نخواهد شد.
این قواعد از پیش تعریف شدهاند تا نتیجهٔ منفی نیز علمی و قابل دفاع باشد و تفسیر پس از دیدن داده تغییر نکند.
۳۰تحلیل حساسیت #
تحلیل حساسیت روی Validation و تلهمتری آموزش انجام میشود، نه روی Test. پارامترهای اصلی شامل beta_max، alpha_EMA، c_max، z ویلسون، n_eval، cadence بازبرازش، g_min، epsilon_r، epsilon_c و مقدار fine-tuning هستند. برای وزنهای SDS نیز بازوزنی آفلاین بررسی میشود، اما وزنهای برابر روش اصلی پس از دیدن نتیجه تغییر نمیکنند.
هدف تحلیل حساسیت اثبات مقاومت مطلق نیست؛ فقط نشان میدهد رفتار روش چقدر به تنظیمات وابسته است. هیچ تنظیم حساسیت، نتیجهٔ H1 تا H5 را بازتعریف یا اجازهٔ انتخاب مدل با Test را ایجاد نمیکند.
۳۱دامنه و محدودیتها #
- دامنهٔ اصلی MetaDrive تک-ego است و نتیجه به کنترل چند-ego یا خودروی واقعی تعمیم مستقیم ندارد.
- خودروهای پیرامونی IDM و قاعدهمحورند؛ رفتار انسانی کامل را بازنمایی نمیکنند.
- OU فقط اختلال زمانهمبستهٔ فرمان عملگر است، نه مدل کامل باد یا دینامیک بیرونی.
- نویز حسگر و اصطکاک عمدتاً در OOD سنجیده میشوند و sim-to-real بررسی نمیشود.
- SDS یک متریک شبیهساز است و دسترسی سرور واقعی به همان ویژگیها تضمین نشده است.
- فروکاست سختی چندبعدی به یک عدد بخشی از ساختار سناریو را از بین میبرد.
- میانگینگیری پارامترهای PPO و وزندهی SGDA تضمین همگرایی نظری ندارند.
- LPPO-Lag تضمین رسمی برآوردهشدن قید ایمنی ارائه نمیدهد.
- c_hard یک سقف نسبی کالیبراسیون است، نه استاندارد قانونی یا خط قرمز مطلق.
- کلاینتها صادق و هممعماری فرض میشوند؛ حملات Byzantine، poisoning و latency واقعی خارج از هستهاند.
- عدم ارسال دادهٔ خام بهمعنای حریم خصوصی کامل نیست و Secure Aggregation/DP پیادهسازی نمیشود.
- Safety-Gymnasium فقط تکرار ثانویه و اختیاری است و مبنای دفاع اصلی نیست.
- نتیجه فقط دربارهٔ baselineها و دامنههای اجراشده معتبر است؛ عبارت «بهترین روش» به همهٔ روشهای ممکن تعمیم داده نمیشود.
- در صورت ترسیم جبههٔ ایمنی–کارایی، فقط از مجموعهٔ بازوهای اجراشده با عنوان non-dominated استفاده میشود و ادعای «Pareto frontier جهانی» مطرح نخواهد شد.
۳۲خروجیها و نتایج مورد انتظار #
انتظار میرود سامانهٔ E6 نسبت به E1′ نرخ برخورد کمتری داشته باشد و SR و C^{ind} را حفظ کند. انتظار دوم این است که E5−E1′ نشان دهد حداقل بخشی از این مزیت به خود SGDA مربوط است. E8 باید روشن کند گیت چقدر از ایمنی را توضیح میدهد و E9′-N-full باید ارزش تعدیل سختی را مشخص سازد. E2′ و E5 نیز سهم نسبی learner محلی و تجمیع سمت سرور را جدا میکنند.
خروجیهای پایاننامه شامل این موارد خواهد بود:
- مدل و کد SGDA-R و LPPO-Lag در چرخهٔ فدرال؛
- تعریف قفلشدهٔ SDS و تحلیل اعتبار آن؛
- جدول نتایج ID و OOD برای بازوهای اصلی؛
- مقایسهٔ CR، OR، V_prox و C^{ind}؛
- کنتراستهای پروتکلهمتا و ابلیشنهای گیت و سختی؛
- نرخهای ACCEPT/FALLBACK/REVERT/FT_ROLLBACK؛
- منحنیهای ایمنی–کارایی و معیارهای بدترین کلاینت؛
- گزارش آماری شامل اختلاف زوجی، CI، اندازه اثر و آزمونهای چندگانه؛
- لاگ کامل و بازپخشپذیر وزنهای تجمیع؛
- و تفسیر از پیش تعیینشده برای نتیجههای مثبت یا منفی.
ارزش علمی طرح فقط به مثبتشدن نتیجه وابسته نیست. اگر SGDA مزیت نشان ندهد، ابلیشنها مشخص میکنند مشکل از گیت، SDS، learner محلی یا کنترل انتشار بوده است. اگر SDS فقط کارایی را پیشبینی کند، دامنهٔ ادعا اصلاح میشود. این طراحی باعث میشود پایاننامه حتی در صورت رد بخشی از فرضیهها، یک ارزیابی روشن و قابل بازتولید از تجمیع آگاه از سختی و ایمنی در FRL ارائه کند.
۳۳جمعبندی برای ارائه به استاد #
مسئلهٔ پژوهش این است که FedAvg تفاوت «مدل ضعیف» و «محیط سخت» را نمیفهمد. راهحل پیشنهادی ابتدا سختی محیط را با SDS اندازه میگیرد، سپس عملکرد هر کلاینت را با انتظار همان سطح سختی مقایسه میکند. برای آنکه سختی بهانهٔ پذیرش ریسک بالا نشود، یک گیت برخورد مستقل اعمال میگردد. وزنها با کنترل آنتروپی ساخته میشوند و مدل حاصل قبل و بعد از fine-tuning در ServerOps آزمایش میشود.
تأیید روش فقط با بهترشدن یک عدد انجام نمیشود. E5−E1′ اثر خالص SGDA، E6−E1′ اثر سامانهٔ کامل، E2′−E1′ و E6−E5 اثر LPPO-Lag، E6−E8 نقش گیت و E6−E9′-N-full نقش سختی را مشخص میکنند. H3 نیز SDS را روی سناریوهای مستقل اعتبارسنجی میکند. ادعای اصلی زمانی پذیرفته میشود که برخورد کمتر، موفقیت غیرحقیر و C^{ind} غیرحقیر همزمان برقرار باشند. این ساختار دقیقاً نشان میدهد چرا هر جزء روش وجود دارد و با کدام آزمایش میتوان مفیدبودن یا شکست آن را تشخیص داد.
منابع منتخب #
شمارهها مطابق فهرست منابع نسخهٔ کامل پروپوزال ۱.۹ هستند.