تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها

تشخیص ناهنجاری به کسب‌وکارها کمک می‌کند تا با تحلیل حجم زیادی از داده‌ها، تشخیص الگوهای غیرعادی و شناسایی رفتارهای دور از انتظار (Outlier) که ممکن است نشان‌دهنده تقلب باشند، فعالیت‌های تقلب‌آمیز را شناسایی کنند.

تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها
22 دقیقه مطالعه
  • مدل‌های ترکیبی گاوسی (GMM): برای ساخت خوشه‌ها استفاده می‌شوند. GMM یک الگوریتم یادگیری ماشین بدون نظارت است که برای خوشه‌بندی داده‌های بدون برچسب استفاده می‌شود. به طور خاص، GMM یک طبقه‌بندی نرم از نقاط داده انجام می‌دهد، بنابراین اطلاعاتی در مورد اینکه کدام نقطه داده به کدام خوشه تعلق دارد، علاوه بر احتمال تعلق نقطه داده داده شده به هر یک از خوشه‌های ممکن، ارائه می‌دهد.
  • خودرمزگذارها (Autoencoders): رمزگذار خودکار یک شبکه عصبی با متغیرهای ورودی و خروجی یکسان است. وظیفه اصلی رمزگذارهای خودکار، یادگیری بازنمایی است: تنظیم یک رمزگذار و رمزگشا به عنوان شبکه‌های عصبی و یادگیری طرح رمزگذاری-رمزگشایی بهینه با استفاده از یک فرآیند بهینه‌سازی تکراری پس از هر تکرار، داده‌ها به خودرمزگذار داده می‌شود. سپس، ورودی تولید شده با داده‌های اولیه مقایسه شده و شبکه عصبی برای محاسبه تابع خطا (زیان) بر اساس وزن شبکه عصبی استفاده می‌شود.
  • هدف از استفاده از یک شبکه خودرمزگذار، ثبت همبستگی بین متغیرهای مختلف است. ابتدا، الگوریتم خودرمزگذار روی مجموعه داده‌ای که نقاط داده «عادی» را نشان می‌دهد، آموزش داده می‌شود. سپس، متغیرهای ورودی را فشرده و بازسازی می‌کند. مرحله بعدی کاهش ابعاد است که طی آن شبکه خودرمزگذار تعاملات بین متغیرهای مختلف و نقاط داده را یاد می‌گیرد و آنها را در مرحله خروجی به متغیرهای اصلی بازسازی می‌کند
  • خودرمزگذار ترکیبی گوسی (VAEGMM): ترکیبی از VAE و GMM که عملکرد فوق‌العاده‌ای در برآورد چگالی و خوشه‌بندی ارائه می‌دهد.
  • جنگل انزوا (Isolation Forest): الگوریتمی مبتنی بر درخت برای داده‌های با ابعاد بالا که داده‌های غیرعادی را با «ایزوله کردن» شناسایی می‌کند و نیازی به زمان‌پروفایلینگ ندارد.
  • بردار پشتیبان تک‌کلاسه (OneClassSVM): توسعه‌ای از الگوریتم SVM که مرزی بین داده‌های عادی و ناهنجار در غیاب داده‌های تقلب ایجاد می‌کند.
  • خوشه‌بندی فضایی مبتنی بر چگالی (DBSCAN): گروه‌بندی نقاط داده نزدیک به هم و شناسایی نقاط دورافتاده (Outliers) به عنوان ناهنجاری.

کشف کنید که چگونه تشخیص ناهنجاری مبتنی بر یادگیری ماشین (Machine Learning) به کسب‌وکارها کمک می‌کند تا از طریق کاربردهای دنیای واقعی و بینش‌های تخصصی، تقلب‌ها را به‌صورت پیشگیرانه شناسایی کنند، خسارت‌ها را کاهش دهند و امنیت عملیاتی را ارتقا بخشند.

کسب‌وکارها هر روز حجم عظیمی از داده‌ها را تولید می‌کنند که این امر شناسایی دستی فعالیت‌های مشکوک، مشکلات عملیاتی و ریسک‌های بالقوه را به طور فزاینده‌ای دشوار می‌سازد. سیستم‌های تشخیص ناهنجاری از الگوریتم‌های یادگیری ماشین برای تحلیل این داده‌ها و کشف الگوهای غیرعادی که ممکن است نشان‌دهنده تقلب یا سایر رویدادهای حیاتی باشند، استفاده می‌کنند.

در این مقاله، یاد خواهید گرفت که تشخیص ناهنجاری چگونه کار می‌کند، انواع اصلی الگوریتم‌های آن را بررسی می‌کنید و با مراحل کلیدی ساخت یک سیستم تشخیص ناهنجاری آشنا می‌شوید. همچنین به بررسی مطالعات موردی (Case Studies) واقعی خواهیم پرداخت که نشان می‌دهند چگونه یادگیری ماشین به کسب‌وکارها کمک کرده است تا تقلب‌ها را زودتر شناسایی کنند، خسارت‌ها را کاهش دهند و بهره‌وری عملیاتی را بهبود ببخشند.

تشخیص ناهنجاری چگونه به کسب‌وکارها در پیشگیری از تقلب کمک می‌کند؟

تشخیص ناهنجاری به کسب‌وکارها کمک می‌کند تا با تحلیل حجم زیادی از داده‌ها، تشخیص الگوهای غیرعادی و شناسایی رفتارهای دور از انتظار (Outlier) که ممکن است نشان‌دهنده تقلب باشند، فعالیت‌های تقلب‌آمیز را شناسایی کنند. با شناسایی زودهنگام فعالیت‌های مشکوک، سیستم‌های تشخیص ناهنجاری به سازمان‌ها اجازه می‌دهند تا از خسارت‌های بالقوه جلوگیری کرده و پیش از تشدید ریسک‌ها، به آن‌ها واکنش نشان دهند.

هر روز مقادیر عظیمی از داده‌ها تولید می‌شود. در سال ۲۰۲۵، حجم جهانی داده‌های ایجاد و مصرف‌شده به حدود ۱۸۱ زابایت رسید که تقریباً معادل ۱۸۱ میلیارد ترابایت است. از آنجا که کسب‌وکارها به دیجیتالی کردن عملیات خود ادامه می‌دهند، باید حجم داده‌های فزاینده‌تری را در سیستم‌ها و پلتفرم‌های مختلف پردازش و تحلیل کنند. در نتیجه، سازمان‌ها باید رویکردهای پیشرفته‌تری را برای مدیریت این داده‌ها، شناسایی ریسک‌ها و همگام شدن با رقابت بازار اتخاذ کنند تحول دیجیتال در کنار مزایای خود، ریسک‌هایی نیز به همراه دارد؛ به‌طوری‌که مدیریت حجم انبوه داده‌ها در سرورهای شرکت با ابزارهای پیشرفته تشخیص ناهنجاری می‌تواند چالش بزرگی باشد. فعالیت‌های تقلب‌آمیز این پتانسیل را دارند که کل سیستم را مختل کنند و این امر تنها زمانی قابل پیشگیری است که سیستمی برای تشخیص ناهنجاری‌ها وجود داشته باشد. بنابراین، ضروری است که سیاست‌های تشخیص تقلب در مرحله طراحی سیستم در نظر گرفته شوند تا پروفایل ریسک کلی کسب‌وکار تضعیف نشود.

خبر خوب این است که مکانیزم‌های دقیق تشخیص ناهنجاری می‌توانند برای محافظت از سازمان‌ها در برابر خسارت‌ها و آسیب‌های ناشی از تقلب ساخته شوند. از آنجا که صدها روش برای انجام تقلب وجود دارد، جمع‌آوری اطلاعات درباره تمام ناهنجاری‌های بالقوه در یک مجموعه داده از پیش کار بسیار دشواری است. با این حال، از آنجا که اکثریت اعمال کاربران عادی است، این اطلاعات قابل ثبت بوده و داده‌های پرت (Outliers) در داده‌ها قابل شناسایی هستند.

مهم‌ترین وظیفه سیستم تشخیص ناهنجاری، شناسایی فعالانه‌ی فعالیت‌های تقلب‌آمیز است تا بتوان به‌سرعت به آن‌ها واکنش نشان داد و از بروز خسارت برای شرکت جلوگیری کرد. در بخش بعدی این مقاله، نگاه عمیق‌تری به انواع الگوریتم‌های تشخیص ناهنجاری خواهیم انداخت و بررسی می‌کنیم که هرکدام در چه مواردی کاربرد دارند.

تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها

انواع تشخیص ناهنجاری

سه نوع الگوریتم تشخیص ناهنجاری وجود دارد: نظارت‌شده (Supervised)، نیمه‌نظارت‌شده (Semi-supervised) و نظارت‌نشده (Unsupervised). تمامی این الگوریتم‌ها تکنیک‌های یادگیری ماشینی هستند که در زمان نیاز به تشخیص تقلب در حجم عظیمی از داده‌ها (که احتمالاً برای انسان غیرممکن است) بسیار مؤثرند.

۱. تشخیص ناهنجاری نظارت‌شده (Supervised)

تکنیک‌های تشخیص ناهنجاری نظارت‌شده شامل آموزش یک طبقه‌بند (Classifier) روی یک مجموعه داده برچسب‌گذاری‌شده است که در آن داده‌ها به دو دسته «غیرعادی» و «عادی» برچسب‌گذاری شده‌اند. وقتی یک داده جدید ظاهر می‌شود، ابتدا باید طبقه‌بندی شود.

  • مزیت: تولید نتایج بسیار دقیق.
  • چالش: نیاز به جمع‌آوری مقادیر زیادی از نمونه‌های عادی و غیرعادی که به دلیل کمیاب بودن داده‌های ناهنجار، کاری پیچیده و دشوار است.

۲. برخلاف روش نظارت‌شده، در تشخیص ناهنجاری نظارت‌نشده (Unsupervised)

هیچ برچسب یا طبقه‌بندی از داده‌ها برای آموزش وجود ندارد. اساساً، روش نظارت‌نشده یک داده را اگر به طور قابل‌توجهی با بقیه داده‌ها متفاوت باشد، به عنوان ناهنجاری طبقه‌بندی می‌کند.

  • مزیت: عدم نیاز متخصصان داده به برچسب‌گذاری داده‌ها.
  • چالش: الگوریتم عملکرد خود را در طول زمان بهبود نمی‌دهد.

۳. تشخیص ناهنجاری نیمه‌نظارت‌شده (Semi-supervised)

از آنجا که برچسب‌گذاری داده‌ها معمولاً زمان‌بر و پرهزینه است، در بسیاری از موارد داده‌های برچسب‌نشده زیاد و داده‌های برچسب‌دار کمی وجود دارد. این روش ترکیبی از رویکردهای نظارت‌شده و نظارت‌نشده است؛ ابتدا به صورت نظارت‌نشده آموزش می‌بیند و سپس با تکنیک‌های نظارت‌شده تنظیم (Tune) می‌شود.

تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها

فرآیند تشخیص ناهنجاری

فرآیند تشخیص ناهنجاری شامل مراحل زیر است:

  1. تحلیل اکتشافی داده‌ها (EDA): تحقیق اولیه روی داده‌ها برای کشف الگوها و داده‌های پرت و درک روابط میان آن‌ها.
  2. پیش‌پردازش و پاکسازی داده‌ها: حذف ترکیبات غیرممکن، مقادیر خارج از محدوده و داده‌های گم‌شده برای تضمین کیفیت داده‌ها.
  3. غنی‌سازی داده‌ها (Data Enrichment): تکمیل داده‌های ناقص و الحاق اطلاعات مرتبط (مانند داده‌های منابع شخص ثالث).
  4. انتخاب الگوریتم‌های یادگیری ماشین: انتخاب مناسب‌ترین الگوریتم‌ها با توجه به پیچیدگی داده‌ها.
  5. آموزش مدل (Model Training): آموزش مدل بر اساس اهداف مشخص‌شده (با یا بدون برچسب).
  6. ارزیابی عملکرد مدل: بررسی دقت عملکرد مدل روی داده‌های جدید با روش‌هایی مانند Holdout و K-fold Cross-Validation.
تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها

الگوریتم‌های کلیدی در تشخیص ناهنجاری

مدل‌های ترکیبی گاوسی (GMM)

مدل‌های ترکیبی گاوسی (GMM) برای ساخت خوشه‌ها استفاده می‌شوند. GMM یک الگوریتم یادگیری ماشین بدون نظارت است که برای خوشه‌بندی داده‌های بدون برچسب به کار می‌رود. به طور خاص، GMM یک طبقه‌بندی نرم روی نقاط داده انجام می‌دهد؛ بدین ترتیب، علاوه بر مشخص کردن اینکه هر نقطه داده به کدام خوشه تعلق دارد، احتمالی را که آن نقطه داده ممکن است به هر یک از خوشه‌های احتمالی تعلق داشته باشد نیز ارائه می‌دهد.

اتوانکودرها (Autoencoders)

اتوانکودر یک شبکه عصبی است که متغیرهای ورودی و خروجی آن یکسان هستند. وظیفه اصلی اتوانکودرها، یادگیری بازنمایی (Representation Learning) است: تعیین یک انکودر (کدگذار) و دیکودر (کدگشا) به عنوان شبکه‌های عصبی، و یادگیری طرح بهینه کدگذاری و کدگشایی با استفاده از یک فرآیند بهینه‌سازی تکراری. پس از هر تکرار، داده‌ها به اتوانکودر تزریق می‌شوند. سپس، داده‌های تولید شده با داده‌های اولیه مقایسه شده و از شبکه عصبی برای محاسبه تابع خطا (Loss) بر اساس وزن‌های شبکه عصبی استفاده می‌شود.

هدف از استفاده از شبکه اتوانکودر، ثبت همبستگی میان متغیرهای مختلف است. ابتدا، الگوریتم اتوانکودر روی مجموعه‌داده‌ای که نمایانگر نقاط داده «عادی» است، آموزش داده می‌شود. سپس، متغیرهای ورودی را فشرده و بازسازی می‌کند. فاز بعدی، کاهش ابعاد است که طی آن، شبکه اتوانکودر تعاملات میان متغیرها و نقاط داده مختلف را می‌آموزد و آن‌ها را در مرحله خروجی به متغیرهای اصلی بازسازی می‌کند.

با انجام این فرآیند، می‌توان خطای رو به رشدی را در بازسازی نقاط داده ورودی توسط شبکه اتوانکودر مشاهده کرد. با پایش این خطا، یک دانشمند داده می‌تواند نشانه‌هایی از ناهنجاری‌ها (Anomaly) را در مجموعه‌داده به دست آورد.

مدل ترکیبی گاوسی با اتوانکودر واریاسیونی (VAEGMM)

مدل تشخیص ناهنجاری «مدل ترکیبی گاوسی با اتوانکودر واریاسیونی» (VAEGMM) از یک اتوانکودر واریاسیونی (VAE) برای فراهم کردن توزیع احتمال برای هر ویژگی استفاده می‌کند. پیش از هر چیز، بیایید عمیق‌تر بررسی کنیم که یک اتوانکودر واریاسیونی چه کاری انجام می‌دهد.

اتوانکودرهای واریاسیونی به گونه‌ای ساخته شده‌اند که یک توزیع آماری (محدوده‌ای از مقادیر ممکن) تولید کنند که بازنمایی داده‌ها را به شکلی پیوسته و دقیق تضمین کند. اتوانکودرهای واریاسیونی به جای ساخت یک انکودر معمولی که یک مقدار منفرد برای بازنمایی هر نقطه داده خروجی می‌دهد، یک توزیع احتمال برای هر نقطه داده نمایش می‌دهند. این روش‌شناسی، بهترین گزینه برای تشخیص ناهنجاری است.

مدل VAEGMM از مزایای همزمانِ مدل ترکیبی گاوسی و اتوانکودرهای واریاسیونی بهره می‌برد و برای بهبود عملکرد خوشه‌بندی بدون نظارت استفاده می‌شود.

بنابراین به زبان ساده: ابتدا اتوانکودر یک بازنمایی پنهان (Latent Representation) از داده‌ها تولید می‌کند؛ سپس، این بازنمایی برای انجام تخمین چگالی به GMM خورانده می‌شود.

الگوریتم VAEGMM به شکل قابل‌توجهی از تکنیک‌های متداول تشخیص ناهنجاری پیشی می‌گیرد.

جنگل ایزوله‌سازی (Isolation Forest)

جنگل ایزوله‌سازی یک الگوریتم بدون نظارت و ناپارامتر مبتنی بر درخت است. جنگل ایزوله‌سازی شباهت بسیار زیادی به جنگل‌های تصادفی (Random Forests) دارد و بر اساس مجموعه‌ای (انسمبلی) از درختان تصمیم برای یک مجموعه‌داده مشخص ساخته می‌شود.

به طور خاص، این الگوریتم در انجام تشخیص ناهنجاری در مجموعه‌داده‌های با ابعاد بالا بسیار مؤثر است. این الگوریتم با استفاده از روش ایزوله‌سازی، که در آن نقاط داده غیرعادی از مجموعه‌داده ایزوله می‌شوند، به شناسایی ناهنجاری‌ها کمک می‌کند. الگوریتم جنگل ایزوله‌سازی به این دلیل بسیار کاربردی است که نیازی به طی کردن فرآیند زمان‌بر پروفایل‌سازی نقاط داده عادی، ساخت مدل یا خوشه ندارد.

جنگل ایزوله‌سازی به خوبی با مجموعه‌داده‌هایی که دارای تعداد قابل‌توجهی ویژگی نامربوط هستند، و همچنین در موقعیت‌هایی که مجموعه‌داده آموزشی فاقد هرگونه ناهنجاری است، مقابله می‌کند.

تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها

One-Class SVM

آل‌وان کلاس اس‌وی‌ام (One-Class SVM) یکی دیگر از الگوریتم‌های یادگیری ماشین بدون نظارت برای تشخیص ناهنجاری است. این الگوریتم، داده‌های جدید را به عنوان داده‌های مشابه یا متمایز از مجموعه داده‌های آموزشی طبقه‌بندی می‌کند. One-Class SVM در واقع توسعه‌ای از الگوریتم یادگیری SVM (ماشین بردار پشتیبان) است که امکان آموزش یک دسته‌بند را در صورت عدم وجود داده‌های ناهنجار فراهم می‌کند. این الگوریتم خود را به گونه‌ای آموزش می‌دهد که تعداد مشخصی از نقاط داده نرمال را به عنوان داده‌های متعلق به ناهنجاری‌ها در نظر بگیرد. این کار امکان تعیین یک مرز بین نقاط داده نرمال و ناهنجار را فراهم می‌کند.

در حالی که SVM استاندارد با استفاده از یک ابرصفحه (Hyperplane) با بیشترین حاشیه ممکن، دو کلاس را از یکدیگر جدا می‌کند، One-Class SVM از یک ابرکره (Hypersphere) برای دربرگرفتن تمامی نمونه‌ها استفاده می‌کند. منظور از «حاشیه»، فضای بیرونی ابرکره است؛ بنابراین، منظور از «بیشترین حاشیه ممکن»، در واقع «کوچک‌ترین ابرکره ممکن» است.

خوشه‌بندی فضایی مبتنی بر چگالی (DBSCAN)

تحلیل خوشه‌بندی برای گروه‌بندی داده‌ها در قالب خوشه‌ها استفاده می‌شود. این روش یکی از محبوب‌ترین تکنیک‌ها در یادگیری ماشین بدون نظارت است. با این حال، تحلیل خوشه‌بندی یک وظیفه خودکار نیست، بلکه یک فرآیند تکرارپذیر از کشف دانش است که شامل تلاش و خطاست. در اینجا ما از یک مدل خوشه‌بندی چگالی‌محور به نام «خوشه‌بندی فضایی مبتنی بر چگالی کاربردها همراه با نویز» (DBSCAN) استفاده کردیم.

این الگوریتم برای گروه‌بندی نقاط داده‌ای که به هم نزدیک هستند (داده‌هایی با همسایگان نزدیک زیاد) به کار می‌رود و نقاط داده‌ای را که به صورت تنها قرار گرفته‌اند و نزدیک‌ترین همسایگانشان فاصله زیادی دارند، به عنوان داده‌های پرت (Outliers) رتبه‌بندی می‌کند. الگوریتم DBSCAN به‌طور کاملاً مناسبی با پرونده مشتری ما سازگار بود، زیرا وظیفه ما شناسایی فعالیت‌های تقلب‌آمیز توسط کارمندان شرکت بود که از کارت‌های وفاداری خود به جای مشتریان برای جمع‌آوری پاداش استفاده می‌کردند (به مطالعه موردی در انتهای این مقاله مراجعه کنید). این روش یکی از رایج‌ترین الگوریتم‌های خوشه‌بندی است و به ویژه برای خوشه‌بندی طیفی و یافتن نقاط داده متصل روی گراف دسترسی‌پذیری نامتقارن، بسیار کارآمد می‌باشد.

آموزش مدل

هنگامی که الگوریتم‌های تشخیص ناهنجاری انتخاب شدند، مدل تشخیص ناهنجاری به پیش‌بینی ناهنجاری‌های جدید کمک می‌کند. مدل تشخیص ناهنجاری برای کار کردن، ابتدا نیاز به آموزش دارد. در رویکرد تشخیص ناهنجاری با نظارت (Supervised)، مدل با پاسخ‌های درستی که به آن‌ها صفات هدف (Target Attributes) گفته می‌شود، آموزش می‌بیند. الگوریتم تشخیص ناهنجاری الگوهایی را پیدا می‌کند که داده‌های ورودی را به صفات هدف مرتبط می‌سازند و سپس الگوریتمی را ارائه می‌دهد که این الگوها را به تصویر می‌کشد. در تنظیمات تشخیص ناهنجاری بدون نظارت (Unsupervised)، هیچ متغیر هدفی وجود ندارد.

در مطالعه موردی که در ادامه این مقاله شرح داده خواهد شد، وظیفه ما شناسایی کارت‌های تقلبی و مکان کلاهبرداران بود. ما کار را با تحلیل خود داده‌ها (بدون برچسب) آغاز کردیم و سپس برای تنظیم دقیق الگوریتم، اطلاعاتی درباره مکان کلاهبرداران به خوشه‌های یادگرفته‌شده اضافه نمودیم. استفاده از تکنیک‌های تشخیص ناهنجاری با نظارت کاری نسبتاً زمان‌بر بود، زیرا هر مورد تقلب باید از طریق فایل‌های ویدئویی تأیید می‌شد. بنابراین، تیم علم داده شرکت های هوش مصنوعی از الگوریتم‌های تشخیص ناهنجاری بدون نظارت و نیمه‌نظارتی استفاده کرد، چرا که آن‌ها مناسب‌ترین گزینه‌ها برای مورد استفاده (Use Case) این مشتری بودند.

۶. ارزیابی عملکرد مدل تشخیص ناهنجاری

پس از آموزش مدل تشخیص ناهنجاری، نتایج تولیدشده توسط آن باید ارزیابی شوند تا دقت عملکرد مدل برای آینده بر روی داده‌های جدید و دیده‌نشده تعیین گردد. دو رویکرد برای ارزیابی عملکرد مدل تشخیص ناهنجاری وجود دارد:

هولدآوت (Holdout)

رویکرد هولدآوت به دلیل سرعت، انعطاف‌پذیری و سادگی، اغلب برای ارزیابی عملکرد مدل تشخیص ناهنجاری استفاده می‌شود. هدف تکنیک ارزیابی هولدآوت این است که مدل را با داده‌های متفاوتی نسبت به داده‌هایی که با آن‌ها آموزش دیده است، امتحان کند. این تکنیک برآورد منصفانه‌ای از کیفیت مدل به دست می‌دهد. برای پیروی از رویکرد هولدآوت، مجموعه داده به سه زیرمجموعه تقسیم می‌شود:

  • مجموعه آموزشی (Training Set): که برای ساخت پیش‌بینی‌ها استفاده می‌شود.
  • مجموعه اعتبارسنجی (Validation Set): که برای ارزیابی عملکرد مدل در مرحله آموزش استفاده می‌شود. مجموعه اعتبارسنجی برای تنظیم دقیق پارامترهای مدل و در نتیجه انتخاب بهترین مدلِ در حال اجرا به کار می‌رود.
  • مجموعه آزمون (Test Set) یا مجموعه داده دیده‌نشده: که برای ارزیابی عملکرد آتی مدل استفاده می‌شود. اگر مدل تمام نویزهای مجموعه آموزشی را حفظ کرده باشد و بیش از حد با آن انطباق پیدا کرده باشد، ممکن است دچار بیش‌برازش (Overfitting) شود. بیش‌برازش مفهومی در یادگیری ماشین است که در آن مدل نمی‌تواند به خوبی به داده‌های جدید عمومیت ببخشد و عملکرد مدل مطابق انتظار نخواهد بود.

اعتبارسنجی متقابل کی-فولد (K-fold Cross-validation)

تکنیک ارزیابی اعتبارسنجی متقابل برای سنجش عملکرد مدل روی یک نمونه داده مستقل استفاده می‌شود. این تکنیک اغلب برای ارزیابی عملکرد مدل یادگیری ماشین روی داده‌های دیده‌نشده و برآورد میزان توانایی آن در پیش‌بینی داده‌های جدید به کار می‌ رود.

همیشه داشتن یک مجموعه داده بزرگ‌تر برای آموزش مدل تشخیص ناهنجاری بهتر است. هنگامی که حجم یک مجموعه داده را کاهش می‌دهیم، خطر از دست دادن الگوهای ارزشمند وجود دارد. اعتبارسنجی متقابل K-fold روش رایج و مسلط است، زیرا درک آن ساده است و ارزیابی کم‌سوگیرانه‌تری (Less Biased) درباره میزان عملکرد مدل ارائه می‌دهد؛ به ویژه اگر با روش‌های دیگر مانند تقسیم معمولی آموزش و آزمون (Train & Test Split) مقایسه شود.

فرآیند استاندارد اعتبارسنجی متقابل K-fold به شرح زیر است:

  1. تصادفی‌سازی مجموعه داده
  2. تقسیم مجموعه داده به $K$ گروه
  3. برای هر گروه:
    • یک مجموعه داده هولدآوت و آزمون انتخاب می‌شود.
    • گروه‌های باقی‌مانده یک مجموعه داده آموزشی را تشکیل می‌دهند.
    • مدل روی مجموعه آموزشی فیت (Fitted) شده و روی مجموعه آزمون ارزیابی می‌شود.
    • امتیاز ارزیابی ذخیره می‌شود.
  4. عملکرد مدل با استفاده از نمونه‌ای از امتیازهای ارزیابی مدل بررسی می‌شود.

در بخش‌های بعدی، دو مورد استفاده از تشخیص ناهنجاری را که تیم‌های Avenga روی آن‌ها کار کرده‌اند، معرفی خواهیم کرد.

مطالعه موردی ۱: چگونه یک سیستم تشخیص ناهنجاری توسعه دهیم که زمان حل خسارت را ۳۰ درصد کاهش می‌دهد؟

تیم علم داده شرکت های هوش مصنوعی یک سیستم جامع تشخیص ناهنجاری برای پلتفرم بیمه در لحظه پیشرو در جهان، یعنی Trōv، توسعه داد. این راهکار پیش از پرداخت خسارت‌های بیمه، کلاهبرداران (مشتریان مشکوک) را شناسایی می‌کند و به شرکت کمک می‌کند تا از خسارت‌ها و زیان‌های ناشی از تقلب جلوگیری کند.

در طی قدم اول، تیم از تکنیک‌های یادگیری ماشین بدون نظارت برای شناسایی گروه‌های مشکوک کاربران قبل از جمع‌آوری داده‌های برچسب‌گذاری‌شده استفاده کرد.

در مرحله بعد، تیم به مهندسی ویژگی (Feature Engineering که در آن ویژگی نشانه‌ای از تقلب است) پرداخت. ویژگی‌ها شامل مواردی مانند فرکانس ادعای خسارت ثبت‌شده، ادعاهای رد شده و لغو شده، مبلغ خسارت و غیره بودند.

پس از آن، از تکنیک‌های یادگیری ماشین با نظارت به همراه شبکه‌های عصبی برای یادگیری الگوهای مشکوک از نمونه‌ها و تشخیص آن‌ها در موارد جدید بر اساس مجموعه داده برچسب‌گذاری‌شده استفاده شد.

راهکار تشخیص ناهنجاری که توسعه داد به روش زیر کار می‌کند:

  1. مشتری یک خسارت ثبت می‌کند.
  2. مدل یادگیری ماشین ویژگی‌هایی (سیگنال‌هایی) را تولید می‌کند که ممکن است نشان‌دهنده تقلب باشند. چنین سیگنال‌هایی شامل موارد زیر هستند (اما به آن‌ها محدود نمی‌شوند):
    • سیگنال‌های هویت: معیارهای تهدید، امتیاز کارت اعتباری، بررسی‌های شناختی، ریسک ایمیل/موبایل، اخطارهای تحریم و فوت‌شده، تعداد دستگاه‌هایی که مشتری روی آن‌ها دیده شده است، نرخ تقلب IP مشتری و غیره.
    • سیگنال‌های سنتی: تعداد پوشش‌هایی که در هفته اول خود ایجاد کرده‌اند، تعداد تراکنش‌های ناموفق، سطوح مازاد (Excess Levels).
    • سیگنال‌های روش پرداخت: میزان شباهت بین نام مشتری و نام صورت‌حساب.
    • سیگنال‌های رفتاری: زمان صرف شده در صفحه، یا مدت زمان بین قیمت‌گذاری و خرید یک بیمه‌نامه (مانند اینکه آیا یک کلاهبردار از یک اسکریپت برای اسکرپ کردن یک صفحه وب استفاده می‌کند یا فعالیت مرور عادی دارد).
  3. مدل تشخیص ناهنجاری امتیازهایی را برای هر سیگنال (ویژگی) پیش‌بینی می‌کند و به هر ادعا یک امتیاز ریسک در مقیاس ۰ تا ۱ می‌دهد.
  4. مدل تشخیص ناهنجاری آستانه‌هایی را برای چه درصدی از ادعاها باید پذیرفته، رد یا به صورت دستی بررسی شوند، تعیین می‌کند.

مزایای این راهکار به شرح زیر بود:

  • کوتاه کردن زمان حل خسارت تا ۳۰ درصد، به لطف سیستم تشخیص تقلب.
  • کاهش نسبت زیان (Loss Ratio) با تشخیص رفتارهای مشکوک پیش از اینکه آسیبی وارد کنند؛ در صنعت بیمه، نسبت زیان به معنای نسبت زیان‌ها به حق بیمه‌های کسب‌شده است.
  • دستیابی به بهره‌وری عملیاتی بهتر به دلیل غربالگری خودکار.
  • بهینه‌سازی هزینه‌ها به دلیل حداقل زمان بررسی و پردازش تقلب.
  • تسریع پرداخت‌ها در تراکنش‌ها/ادعاهای واقعی.
  • بهبود تجربه مشتری.

مطالعه موردی ۲: چگونه یک سیستم تشخیص ناهنجاری توسعه دهیم که ۹۴ درصد از تقلب‌ها را شناسایی می‌کند؟

تیم شرکت های هوش مصنوعی یک مدل تشخیص ناهنجاری برای مشتری‌ای توسعه داد که چندین صد شعبه در سراسر کشور خود دارد. این شرکت کارت‌های برنامه‌ وفاداری را پیاده‌سازی کرده بود که به مشتریان شرکت اجازه می‌داد هنگام خرید کالا از مجموعه‌ای از فروشگاه‌ها، امتیاز جمع‌آوری کنند.

این شرکت با برخی موارد تقلب در برنامه وفاداری مواجه شد که مشتری را در ایجاد یک پیوند پایدار و سودآور با مشتریان محدود کرده و حفظ مشتری را تهدید می‌کرد.

هدف پروژه این بود که بررسی شود افراد چگونه از کارت‌های وفاداری استفاده می‌کنند تا الگوهای رفتار کلاهبردار زودتر کشف شود، و همچنین انواع کلاهبرداران بر اساس ویژگی‌های احتمالی تقلب (تعداد تراکنش‌ها، الگوهای زمانی رفتاری، الگوهای جمع‌آوری امتیاز و غیره) شناسایی گردند.

پروژه تشخیص ناهنجاری شامل مراحل زیر بود:

  • تحلیل اکتشافی مجموعه داده (Exploratory dataset analysis)
  • پیش‌پردازش مجموعه داده
  • شناسایی فعالیت‌های ناهنجار
  • ساخت فرضیه در مورد انواع کلاهبرداران
  • طبقه‌بندی کلاهبرداران
    • تشخیص رفتار عادی
    • تشخیص رفتار کلاهبردار
    • خوشه‌بندی و بخش‌بندی کلاهبرداران
  • شناسایی شعب با ریسک بالا
  • تأیید تقلب
  • رتبه‌بندی تقلب
  • الگوریتم بازرسی کارت پاداش
تشخیص ناهنجاری با هوش مصنوعی: سیستم‌ها، الگوریتم‌ها و تکنیک‌ها

تیم علم داده شرکت های هوش مصن.ومجموعه داده‌های شرکت را که حاوی اطلاعات چند صد هزار کاربر بود، تحلیل کرد و به شش نوع تقلب احتمالی دست یافت. این موارد بر اساس تعداد تراکنش‌ها، الگوهای زمانی رفتاری، رفتار خرج کردن و جمع‌آوری امتیاز و غیره دسته‌بندی شده بودند.

با استفاده از الگوریتم‌های تشخیص ناهنجاری، کاربران شرکت به دو دسته کلاهبردار (Fraudster) و غیرکلاهبردار تفکیک شدند. ویژگی‌های کلیدی و توصیفی برای رفتارهای کلاهبردارانه ساخته شد. طبقه‌بندی رفتارهای غیرعادی کاربران کمک کرد تا کلاهبرداران به سرعت در یکی از شش نوع تقلب جای گیرند.

این تیم بینش‌های ارزشمندی درباره انواع تقلب‌ها با استفاده از کارت‌های وفاداری کشف کرد. برای مثال، کلاهبرداران خیلی بیشتر از حد معمول موجودی کارت خود را بررسی می‌کنند؛ کاری که افراد عادی انجام نمی‌دهند. علاوه بر این، بسیاری از خریدهای تقلبی معمولاً در طول شب انجام می‌شوند و این تراکنش‌ها بازتاب‌دهنده مبلغ زیادی پول در مدت زمانی کوتاه هستند.

برای شناسایی کلاهبرداران، این تیم یک مدل تشخیص ناهنجاری ساخت که از VAEGMM (مدل ترکیبی گاوسی خودکدگذار واریاسیون) استفاده می‌کرد. رویکردهای دیگر مبتنی بر تکنیک‌های یادگیری ماشین بدون نظارت مانند Isolation Forest، OneClassSVM و خوشه‌بندی (DBSCAN) در طول مرحله انتخاب مدل آزمایش شدند. رویکردهای اخیر در مقایسه با VAEGMM عملکرد خوبی نداشتند و به همین دلیل انتخاب نشدند.

این سیستم به شناسایی تمامی کارت‌های پاداش کلاهبرداران کمک کرد، زیرا برخی از کلاهبرداران از کارت‌های متفاوتی برای انواع تراکنش‌ها استفاده می‌کردند. در نتیجه، مشتری چندین گزارش دریافت کرد:

  • گزارشی از مکان‌هایی که تقلب‌ها در آن‌ها رخ می‌داد.
  • گزارشی از کارت‌های پاداشی که برای تراکنش‌های تقلبی استفاده شده بودند.
  • گزارشی از سایر کارت‌هایی که کلاهبرداران برای جمع‌آوری پاداش‌ها استفاده می‌کردند.

اثبات مفهومی (POC) تشخیص ناهنجاری، تقلب را با دقت بالا شناسایی کرد که نتیجه آن افزایش رضایت کاربران، ارتقای امنیت و بهبود جریان‌های کاری بود.

چالش‌های تشخیص ناهنجاری (Challenges of anomaly detection)

تشخیص فعالیت‌های ناهنجار مانند تقلب، نفوذ به شبکه و سایر فعالیت‌های مشکوک ممکن است دشوار باشد، زیرا الگوهای غیرعادی کمیاب هستند و معمولاً به وفور در مجموعه داده ظاهر نمی‌شوند. علاوه بر این، آن‌ها پراکنده و از بسیاری جهات ناهمسان هستند، که این امر مانع از کارایی تکنیک‌های معمولی آماده‌سازی داده می‌شود.

علاوه بر کمیاب بودن، نقاط داده غیرعادی به طور مساوی نیز نمایش داده نمی‌شوند. برای مثال، پس از اعمال یک تکنیک طبقه‌بندی روی مجموعه داده، یک دانشمند داده ممکن است مدلی با نتایج ۸۵ درصد دقت به دست آورد. با این حال، پس از بررسی بیشتر، مشخص می‌شود که ۸۵ درصد از نقاط داده تنها به یک کلاس تعلق دارند. این یک نمونه بی‌نقص از چیزی است که داده‌های نامتوازن (Imbalanced Data) نامیده می‌شود و نشان می‌دهد چگونه می‌تواند نتایج نادرستی تولید کند.

نفرین ابعاد (Curse of dimensionality)

در مجموعه‌های داده بزرگ که شامل تعداد زیادی از صفات و ویژگی‌ها هستند، حجم داده‌هایی که باید عمومیت‌دهی (Generalize) شوند بسیار زیاد است. این امر منجر به پراکندگی داده‌ها می‌شود؛ جایی که نقاط داده پراکنده‌تر و منزوی‌تر هستند. پراکندگی داده‌ها از طریق چندین متغیر نامربوط که ناهنجاری‌های واقعی را می‌پوشانند، سطوح نویز بالایی ایجاد می‌کند. این چالش «نفرین ابعاد» یا در برخی منابع چندوجهی (Multimodality) نامیده می‌شود که مانعی برای تکنیک‌های تشخیص ناهنجاری ایجاد می‌کند.

برچسب‌گذاری دشوار و طاقت‌فرسا (Cumbersome labeling)

هنگام تحلیل داده‌ها برای یافتن ناهنجاری‌ها، به دست آوردن داده‌های با برچسب دقیق که تمام انواع رفتارهای ناهنجار را نشان دهند دشوار است. به همین دلیل، برچسب‌گذاری اغلب به صورت دستی انجام می‌شود که به دلیل نیاز به دانش تخصصی بالا، پرهزینه است. این فرآیند همچنین به دلیل زمان‌بر بودن، بسیار خسته‌کننده و ملال‌آور است.

نظرات

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *