رفتن به محتوای اصلی
x
تحلیل ترافیك شبكه برای تشخیص تهدیدات سایبری مبتنی بر یادگیری عمیق و انتخاب ویژگی
تاریخ دفاع
مقطع تحصیلی
كارشناسی ارشد
گروه آموزشی
مهندسی برق و كامپیوتر
استاد

علی فانیان

دانشکده
بین الملل

گسترش سریع شبکه های کامپیوتری و پیچیدگی روزافزون تهدیدات سایبری (نظیر بدافزارهای چندریختی و تهدیدات پیشرفته ی پایدار)، کارایی سامانه های سنتی تشخیص نفوذ مبتنی بر امضا را به شدت کاهش داده است. از سوی دیگر، روش های مبتنی بر ناهنجاری نیز با تولید نرخ بالای مثبت کاذب (10 تا 30 درصد)، منجر به چالش هایی چون خستگی از هشدار برای تحلیلگران می شوند. علی رغم انجام پژوهش های گسترده در زمینه معماری های ترکیبی یادگیری عمیق برای تشخیص نفوذ، خلأ پژوهشی قابل توجهی در مقایسه نظام مند روش های کاهش بعد احساس می شود؛ به طوری که تاکنون مطالعه ای به مقایسه دقیق انتخاب ویژگی مبتنی بر بهره اطلاعاتی (IG) و تحلیل مؤلفه های اصلی (PCA) در شرایط کاملا کنترل شده برای چارچوب CNN-LSTM نپرداخته است. در این پایان نامه، یک چارچوب هوشمند تشخیص تهدیدات سایبری مبتنی بر معماری ترکیبی CNN-LSTM پیشنهاد شده و بر روی مجموعه داده معیار CIC-IDS2017 (شامل بیش از 8/2میلیون رکورد جریان شبکه) مورد ارزیابی قرار گرفته است. این چارچوب از یک روند پیش پردازش شش مرحله ای و بدون نشت داده بهره می برد که شامل تکنیک هایی نظیر نرمال سازی و متوازن سازی کلاس ها با استفاده از الگوریتم SMOTE (اعمال شده صرفا روی داده های آموزش) است. به منظور ارزیابی، سه پیکربندی مختلف شامل: تمامی 78 ویژگی، 20 ویژگی برتر مبتنی بر IG و 20 مؤلفه حاصل از PCA، روی معماری یکسان CNN-LSTM آموزش داده شده و با یکدیگر مقایسه شدند. نتایج نشان داد که مدل مبتنی بر 20 ویژگی IG، بر روی مجموعه داده های آزمون مستقل، به دقت 64/98، معیار F1 برابر با 33/89، نرخ مثبت کاذب 08/4 و مقدار AUC-ROC معادل 9997/0دست یافته است. با این حال، مقایسه های صورت گرفته مشخص کرد که هر سه پیکربندی عملکردی تقریبا مشابه دارند و فرضیه برتری محسوس IG بر PCA تأیید نشد؛ بلکه تفاوت های جزئی مشاهده شده در معیار F1، عمدتا ناشی از خطای طبقه بندی در کلاس های نادر مانند Infiltration بوده است. افزون بر این، ارزیابی مدل مبنا مبتنی بر XGBoost نشان داد که این مدل با ثبت معیار F1 برابر با 36/98، عملکردی هم سطح و حتی بهتر از مدل یادگیری عمیق دارد. تحلیل عملکرد مدل در کلاس های مختلف، یک سلسله مراتب سه سطحی از دشواری تشخیص را نمایان ساخت؛ به گونه ای که شناسایی حملات حجمی تقریبا به حداکثر دقت ممکن رسید، اما تشخیص حملات نادر همچنان چالشی اساسی در تحلیل ترافیک شبکه به شمار می رود. در نهایت، تحلیل اثر حذف مؤلفه ها ثابت کرد که تکنیک SMOTE حیاتی ترین عامل در عملکرد مدل است؛ به طوری که حذف آن موجب افت 16 واحدی در معیار F1 می شود، درحالی که حذف لایه های CNN و LSTM تأثیر به مراتب کمتری (به ترتیب 1/5و 0/3 واحد افت) در پی داشت.

تحت نظارت وف ایرانی