واژه‌نامه · فنی

RAG چیست و چه کاربردی دارد؟

تعریف به زبان ساده

معماری نوینی در هوش مصنوعی که با اتصال مدل زبانی به منابع دانش خارجی، دقت، کیفیت و قابلیت اطمینان پاسخ‌ها را به‌میزان چشمگیری ارتقا می‌دهد.

RAG (Retrieval-Augmented Generation) چیست ؟

تولید براساس داده های دریافتی که به اختصار (RAG) گفته میشود،فرآیندی است   در حوزه هوش مصنوعی که طی آن خروجی یک مدل زبانی بزرگ (Generative AI)، پیش ازاین که  پاسخ نهایی را بدهد ، از طریق ارجاع و استعلام گیری اطلاعات  از یک پایگاه دانش معتبر خارجی و با کمک گیری از داده‌های آموزش داده شده  اولیه، بهینه‌سازی می‌گردد. این راهکار، کاستی‌های موجود در نحوه پاسخ‌دهی مدل‌های زبانی بزرگ را برطرف می‌سازد.

مدل‌های زبانی هوش مصنوعی بر پایه داده‌های آموزشی پیشین خود — که دانش پارامتری  نامیده می‌شود — توانایی جمله‌سازی مشابه انسان و پاسخ‌دهی به پرسش‌های عمومی را دارا هستند. با این حال، حافظه داخلی مدل‌ها در مواجهه با نیازمندی‌هایی چون دسترسی به اطلاعات به‌روز، پاسخ‌های کاملاً دقیق و اتکا به منابع مشخص، با محدودیت مواجه می‌شود.

در این شرایط، فناوری RAG با برقرار ساختن اتصال میان هوش مصنوعی و پایگاه‌های دانش معتبر برون‌سازمانی، امکان بازیابی مستقیم اطلاعات و ارائه پاسخ‌های مستند و قابل اعتماد را فراهم می‌آورد.
مدل‌های زبانی بزرگ بر پایه حجم نوینی از داده‌ها ، آموزش یافته و با اتکا بر میلیاردها پارامترتعریف شده برای آنها ، به تولید متن در وظایفی نظیر پاسخ‌دهی به پرسش‌ها، ترجمه متون و تکمیل عبارات می‌پردازند.

فناوری RAG توانمندی‌های بنیادی این مدل‌ها را بدون نیاز به بازآموزی یا تنظیم دقیق (Fine-Tuning)  که فرایندی زمان بر و پرهزینه است، به حوزه‌های تخصصی یا پایگاه‌های داده درونی سازمان‌ها تعمیم می‌دهد. این رویکرد، راهکاری مقرون‌به‌صرفه جهت ارتقای کیفی خروجی مدل‌های زبانی محسوب می‌شود که دقت، ارتباط معنایی و کاربردپذیری پاسخ‌ها را در زمینه‌های گوناگون تضمین می‌نماید.

شماتیک ساده مفهوم RAG و جریان پردازش داده‌ها در هوش مصنوعی

ریشه‌شناسی و فلسفه وجودی RAG

عنوان RAG اختصاری تشکیل‌شده از سه واژه کلیدی است که فلسفه و مراحل ساختاری عملکرد این معماری را تبیین می‌کنند:

1. بازیابی (Retrieval)

به  معنی استخراج اطلاعات از منابع داده برون‌سازمانی اختصاص دارد. با دریافت پرسش از سوی کاربر، سیستم ابتدا ساختار و مفهوم سوال را تحلیل کرده و سپس برای یافتن داده‌های مرتبط، به جستجو در پایگاه دانش اختصاصی (نظیر اسناد سازمانی، مقالات علمی یا منابع وب) می‌پردازد.

2. افزایش/تکمیل (Augmentation)

قسمت میانی نیز به معنی داده‌های استخراج‌شده از پایگاه دانش با پرسش کاربر تلفیق می‌شوند. این ترکیب، اطلاعات جامع در قالب یک «پرامپت غنی‌شده» ایجاد می‌کند تا مدل زبانی بزرگ بتواند بر پایه داده‌های واقعی و دقیق، پاسخ‌دهی را انجام دهد.

3. تولید پاسخ (Generation)

قسمت انتهای نیز به معنی ساخت پاسخ نهایی توسط مدل زبانی بزرگ اختصاص دارد. در این گام، مدل زبانی «پرامپت غنی‌شده» را پردازش کرده و بر اساس اطلاعات معتبر دریافت‌شده، پاسخی دقیق، به‌روز و بدون هیچ توهم (Hallucination) ارائه می‌دهد.

پیشینه نام‌گذاری RAG:

فناوری RAG  نخستین‌بار در سال ۲۰۲۰ میلادی طی مقاله‌ای با عنوان

 «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks» به قلم پاتریک لوئیس و پژوهشگرانی از پژوهشگاه هوش مصنوعی فیس‌بوک (Meta AI)، دانشگاه کالج لندن (UCL) و دانشگاه نیویورک (NYU) معرفی شد.
طراحان، این راهکار را یک دستور تنظیم دقیق (Fine-Tuning) همه‌منظوره نامیدند؛ زیرا بدون نیاز به تغییرات زیرساختی، امکان اتصال هر مدل زبانی بزرگ(LLM) را به پایگاه‌های دانش برون‌سازمانی و به‌روز فراهم می‌سازد.

عبارت RAG  امروزه به پایه ‌و‌اساس خانواده‌ای گسترده از روش‌ها در صدها مقاله و سرویس تجاری تبدیل شده است؛ روش‌هایی که به باور لوئیس ( مدیر کنونی بخش RAG در شرکت Cohere ) مسیر آینده هوش مصنوعی مولد را تعیین می‌کنند.
لوئیس بعدتر با اشاره به نام‌گذاری سریع این فناوری در زمان نگارش مقاله ابراز تأسف کرد و گفت: «اگر می‌دانستیم این ساختار تا این حد همه‌گیر می‌شود، نام خوش‌آهنگ‌تری برای آن انتخاب می‌کردیم . ما تصمیم داشتیم نام خوش‌آهنگ‌تری برگزینیم، اما هنگام نگارش مقاله، ایده بهتری به ذهن کسی نرسید».

صفحه اصلی موتور جستجوی قدیمی Ask Jeeves به عنوان پیش‌زمینه‌ای برای پیدایش سیستم‌های پرسش و پاسخ RAG

RAG چگونه کار می‌کند؟

در مدل‌های زبانی بزرگ، پاسخ‌ها فقط بر اساس اطلاعات و متن‌هایی تولید می‌شوند که در زمان ساخت و آموزش اولیه به مدل داده شده است. در مقابل، فناوری RAG با افزودن یک مکانیسم جستجو و استخراج، ورودی کاربر را قبل از ارسال به مدل زبانی، برای جستجو و استخراج اطلاعات  دریک منبع داده‌ی خارجی به کار می‌گیرد.

در این فرآیند، پرسش اصلی کاربر به همراه داده‌های به‌دست‌آمده از جستجو، به‌طور هم‌زمان در اختیار مدل زبانی قرار می‌گیرد تا خروجی نهایی با ترکیب «دانش اولیه مدل» و «اطلاعات جدید منبع خارجی» با دقتی بالاتر تولید شود.

فناوری RAG با اتصال مدل‌های زبانی به منابع اطلاعاتی، پاسخ‌دهی بر اساس داده‌های به‌روز و اختصاصی را ممکن می‌سازد. روند کلی این فرآیند در چند گام اصلی انجام می‌شود:

داده‌های خارجی و فرآیند آماده‌سازی (External Data and Generation)

به تمامی اطلاعات موجود در خارج از مجموعه داده‌های آموزشی اولیه مدل زبانی ، داده‌های خارجی گفته می‌شود. این داده‌ها از منابع متعددی نظیر (API) ها، پایگاه‌های داده و فایل‌ها یا اسناد ذخیره‌شده به‌دست می‌آیند و می‌توانند قالب‌هایی چون متون طولانی، فایل‌ها یا رکوردهای داده را شامل ‌شوند.
در معماری RAG، جهت قابل استفاده ساختن این اطلاعات، مدل‌های تعبیه‌ساز (Embedding Models) داده‌های یادشده را به نمایش‌های عددی (بردارهای ریاضی) تبدیل و در پایگاه‌های داده برداری ذخیره می‌سازند. این اقدام سبب تشکیل یک پایگاه دانش یکپارچه و قابل درک برای پردازش توسط هوش مصنوعی مولد می‌گردد.

فلوچارت مرحله به مرحله نحوه کارکرد معماری RAG از کوئری کاربر تا تولید جواب توسط LLM

بازیابی اطلاعات مرتبط  (Relevant Information Retrieval)

مرحله استخراج و سنجش پیوستگی معنایی میان پرسش ورودی و داده‌های ذخیره‌شده در پایگاه دانش است. در این گام، عبارت یا پرسش کاربر ابتدا به یک بردار عددی تبدیل شده و سپس بر پایه محاسبات ریاضی، با بردارهای موجود در پایگاه داده تطبیق داده می‌شود تا مرتبط‌ترین اسناد شناسایی گردند.

برای نمونه، در یک سامانه هوشمند منابع انسانی، پس از طرح پرسش «میزان مرخصی استحقاقی چقدر است؟»، سیستم بردار این پرسش را با پایگاه داده تطبیق داده و اسناد مربوط به مقررات مرخصی و سوابق فردی کاربر را به‌دقت استخراج و بازمی‌گرداند.

تقویت درخواست (Prompt Augmentation)

مرحله‌ای است که طی آن، پرامپت یا پرسش کاربر با اطلاعات مرتبط و بازیابی‌شده از پایگاه دانش ترکیب می‌شود. این گام از طریق روش‌های مهندسی پرامپت (Prompt Engineering) صورت می‌پذیرد تا زمینه‌ای جامع و دقیق شکل گیرد.
در نهایت، این درخواستِ تقویت‌شده در اختیار مدل زبانی بزرگ قرار می‌گیرد تا پاسخ نهایی بر پایه داده‌های واقعی، کاملاً مستند و دقیق تولید شود.

تغییرات مهمی که برای روانی متن انجام شد:

  • حذف واژه‌های تکراری: عبارت «در بستر زمینه» حذف و به «اطلاعات مرتبط و کاربردی» یا «زمینه» تبدیل شد تا جمله سنگین نباشد.
  • بهبود ساختار جملات: جملات کوتاه و مرتبط به هم وصل شدند تا خواندن متن برای مخاطب واژه‌نامه آسان‌تر و جذاب‌تر شود.
  • سادگی کلمات: از به کار بردن اصطلاحات پیچیده فارسی خودداری شد تا اصالت متن حفظ شود و در عین حال کاملاً فهم‌پذیر باشد.

به‌روزرسانی داده‌های خارجی (Updating External Data)

جهت حفظ بروز بودن اطلاعات و ارتقای دقت پاسخ‌ها در فرآیند RAG، پایگاه دانش برداری باید به‌طور پیوسته بازنگری و به‌روزرسانی شود. این بازنگری شامل انباشت مجدد اسناد و به‌روزرسانی بردارهای ذخیره‌شده است که به دو روش انجام می‌پذیرد: پردازش آنی (Real-time) یا پردازش دوره‌ای و دسته‌ای (Batch Processing).

مدیریت پویای داده‌ها و جلوگیری از ارائه اطلاعات منقضی‌شده توسط مدل زبانی، از چالش‌های کلیدی علوم داده است که با به‌روزرسانی مستمر تعبیه‌ها (Embeddings) برطرف می‌گردد.

نکات بهبود یافته در این ویرایش:

  • حذف عبارات گفتگو محور: جملاتی مانند «پرسش بعدی این است —» حذف شدند تا متن حالت دانشنامه‌ای و رسمی به خود بگیرد.
  • جایگزینی اصطلاحات پیچیده: اصطلاح «نمایش تعبیه‌ای اسناد» و «غیرهمزمان» با معادل‌های روان‌تر توضیح داده شدند تا کاربر واژه‌نامه بدون سردرگمی مفهوم را درک کند.
  • روانی کلام: جملات به‌گونه‌ای به هم متصل شده‌اند که خواندن آن آسان و لحن متن یکدست و ادبی باشد

درک RAG در دنیای واقعی

نمونه‌ای از به‌کارگیری RAGمی توان عملکرد سامانه هوشمند پاسخ‌دهی به پرسش‌های سازمانی اشاره کرد. در صورتی که یک کارمند از چت‌بات بپرسد: «چقدر مرخصی استحقاقی دارم؟»، سیستم با اتکا به فرآیند RAG، سند رسمی «سیاست‌های مرخصی سازمان» را به همراه «سوابق فردی کارمند» از پایگاه داده استخراج می‌کند. سپس مدل زبانی با پردازش این زمینه اختصاصی، پاسخی دقیق، شخصی‌سازی‌شده و مطابق با مقررات فعلی ارائه می‌دهد.

نقطه عطف هوش مصنوعی: اهمیت و مزایای RAG

فناوری RAG با برطرف ساختن دو چالش کلیدی مدل‌های زبانی بزرگ — یعنی «پیش‌بینی‌ناپذیری و توهم (Hallucination)» و «محدودیت زمانی دانش (Cut-off Date)» — امکان تعامل مستقیم و پویا با مخازن داده برون‌سازمانی را فراهم می‌آورد.

زمینه‌های اصلی به‌کارگیری:

  • پزشکی و درمان: اتصال به پرونده‌ها و دانشنامه‌های تخصصی جهت ارائه دستار هوشمند به کادر درمان.
  • تحلیل مالی: لینک داده‌های لحظه‌ای بازار سرمایه به مدل جهت ارائه تحلیل‌های اقتصادی دقیق.
  • کسب‌وکارها و سازمان‌ها: تبدیل مستندات فنی، ویدیوها و گزارش‌های داخلی به پایگاه دانش (Knowledge Base) برای ارتقای پشتیبانی مشتریان و آموزش نیروها.

قابلیت‌های گسترده این معماری در تنوع‌بخشی به خدمات هوشمند، سبب یکپارچه‌سازی و پذیرش گسترده آن توسط غول‌های فناوری نظیر مایکروسافت، گوگل، انویدیا، آی‌بی‌ام و آمازون شده است.

مرزهای مفهومی: RAG در برابر جستجوی معنایی (Semantic Search)

اگرچه RAG و جستجوی معنایی هر دو جهت دسترسی به اطلاعات خارجی به کار می‌روند، اما ماهیت و نقش آن‌ها متفاوت است؛ جستجوی معنایی یک روش بازیابی پیشرفته است، در حالی که RAG یک معماری کامل برای پردازش و تولید متن محسوب می‌شود.

  • نقش جستجوی معنایی: این فناوری با تحلیل مفاهیم و ارتباطات معنایی — به‌جای تطبیق ساده کلیدواژه‌ها — اسناد و عبارات مرتبط را از حجم عظیمی از داده‌های سازمانی استخراج می‌کند. همچنین فرایندهایی مانند قطعه‌بندی اسناد و مرتب‌سازی داده‌ها بر اساس میزان ارتباط را به‌طور خودکار انجام می‌دهد.
  • نقش RAG: سیستم RAG نتایج حاصل از جستجوی معنایی را به عنوان زمینه (Context) دریافت کرده و در اختیار مدل زبانی بزرگ قرار می‌دهد تا پاسخی دقیق، روان و مستند تولید شود.

در واقع، جستجوی معنایی به عنوان بخش بازیابی (Retrieval)، کیفیت و دقت خروجی را در معماری RAG به حداکثر می‌رساند.

اکوسیستم RAG: ابزارها و فریم‌ورک‌های توسعه یافته با RAG

توسعه و استقرار معماری RAG نیازمند زیست‌بومی متشکل از سرویس‌های ابری، کتابخانه‌های نرم‌افزاری و زیرساخت‌های سخت‌افزاری است. مهم‌ترین ابزارها و پلتفرم‌ها در این حوزه عبارت‌اند از:

  سرویس‌های ابری آمازون (AWS):

  • Amazon Bedrock: سرویس کاملاً مدیریت‌شده برای اتصال مستقیم مدل‌های پایه به منابع داده و مدیریت خودکار تبدیل‌های برداری و بازیابی.
  • Amazon Kendra: موتور جستجوی سازمانی مبتنی بر یادگیری ماشین با قابلیت بازیابی تا ۱۰۰ گزاره مرتبط معنایی و اتصالات پیش‌ساخته به سامانه‌هایی چون SharePoint و Confluence.
  • Amazon SageMaker: مرکز توسعه یادگیری ماشین حاوی الگوها و دفترچه‌های راهنما برای تسریع در پیاده‌سازی خطوط لوله RAG.
نمودار معماری فریم‌ورک LangChain و ارتباط دیتابیس برداری (Vectorstore) با مدل‌های زبانی

فریم‌ورک‌های توسعه نرم‌افزار:

  • LangChain: کتابخانه متن‌باز کلیدی برای زنجیره‌سازی و متصل کردن مدل‌های زبانی، مدل‌های تعبیه‌ساز و پایگاه‌های دانش.

  اکوسیستم نرم‌افزاری و سخت‌افزاری انویدیا (NVIDIA):

  • NVIDIA AI Blueprint for RAG: الگوی پایه برای ساخت خطوط لوله مقیاس‌پذیر و سفارشی‌سازی‌شده استخراج و بازیابی داده.
  • NVIDIA NeMo Retriever: مدل‌های اختصاصی برای افزایش دقت بازیابی داده در مقیاس بزرگ.
  • NVIDIA NIM Microservices: ریزخدمت‌هایی برای استقرار امن و بهینه مدل‌ها در ابزارها و مراکز داده مختلف.
  • TensorRT-LLM: نرم‌افزار شتاب‌دهی پردازش برای اجرای سریع و محلی خطوط لوله RAG در محیط ویندوز.
  • NVIDIA GH200 Grace Hopper Superchip: زیرساخت سخت‌افزاری قدرتمند با پهنای باند و حافظه بالا جهت پردازش حجم عظیمی از داده‌ها در پردازش‌های سنگین RAG
نمونه یک معماری سازمانی و پیچیده برای سیستم‌های RAG چندوجهی (Multimodal) در هوش مصنوعی

  پلتفرم‌های ابری و پایگاه‌های داده برداری: شرکت‌های پیشتاز نظیر IBM، Google، Microsoft، Oracle، Glean و همچنین پایگاه‌های داده برداری مانند Pinecone، بخش مهمی از زیرساخت‌های ارائه و پشتیبانی از فناوری RAG را تشکیل می‌دهند.