واژهنامه · فنی
RAG چیست و چه کاربردی دارد؟
تعریف به زبان ساده
معماری نوینی در هوش مصنوعی که با اتصال مدل زبانی به منابع دانش خارجی، دقت، کیفیت و قابلیت اطمینان پاسخها را بهمیزان چشمگیری ارتقا میدهد.
RAG (Retrieval-Augmented Generation) چیست ؟
تولید براساس داده های دریافتی که به اختصار (RAG) گفته میشود،فرآیندی است در حوزه هوش مصنوعی که طی آن خروجی یک مدل زبانی بزرگ (Generative AI)، پیش ازاین که پاسخ نهایی را بدهد ، از طریق ارجاع و استعلام گیری اطلاعات از یک پایگاه دانش معتبر خارجی و با کمک گیری از دادههای آموزش داده شده اولیه، بهینهسازی میگردد. این راهکار، کاستیهای موجود در نحوه پاسخدهی مدلهای زبانی بزرگ را برطرف میسازد.
مدلهای زبانی هوش مصنوعی بر پایه دادههای آموزشی پیشین خود — که دانش پارامتری نامیده میشود — توانایی جملهسازی مشابه انسان و پاسخدهی به پرسشهای عمومی را دارا هستند. با این حال، حافظه داخلی مدلها در مواجهه با نیازمندیهایی چون دسترسی به اطلاعات بهروز، پاسخهای کاملاً دقیق و اتکا به منابع مشخص، با محدودیت مواجه میشود.
در این شرایط، فناوری RAG با برقرار ساختن اتصال میان هوش مصنوعی و پایگاههای دانش معتبر برونسازمانی، امکان بازیابی مستقیم اطلاعات و ارائه پاسخهای مستند و قابل اعتماد را فراهم میآورد.
مدلهای زبانی بزرگ بر پایه حجم نوینی از دادهها ، آموزش یافته و با اتکا بر میلیاردها پارامترتعریف شده برای آنها ، به تولید متن در وظایفی نظیر پاسخدهی به پرسشها، ترجمه متون و تکمیل عبارات میپردازند.
فناوری RAG توانمندیهای بنیادی این مدلها را بدون نیاز به بازآموزی یا تنظیم دقیق (Fine-Tuning) که فرایندی زمان بر و پرهزینه است، به حوزههای تخصصی یا پایگاههای داده درونی سازمانها تعمیم میدهد. این رویکرد، راهکاری مقرونبهصرفه جهت ارتقای کیفی خروجی مدلهای زبانی محسوب میشود که دقت، ارتباط معنایی و کاربردپذیری پاسخها را در زمینههای گوناگون تضمین مینماید.

ریشهشناسی و فلسفه وجودی RAG
عنوان RAG اختصاری تشکیلشده از سه واژه کلیدی است که فلسفه و مراحل ساختاری عملکرد این معماری را تبیین میکنند:
1. بازیابی (Retrieval)
به معنی استخراج اطلاعات از منابع داده برونسازمانی اختصاص دارد. با دریافت پرسش از سوی کاربر، سیستم ابتدا ساختار و مفهوم سوال را تحلیل کرده و سپس برای یافتن دادههای مرتبط، به جستجو در پایگاه دانش اختصاصی (نظیر اسناد سازمانی، مقالات علمی یا منابع وب) میپردازد.
2. افزایش/تکمیل (Augmentation)
قسمت میانی نیز به معنی دادههای استخراجشده از پایگاه دانش با پرسش کاربر تلفیق میشوند. این ترکیب، اطلاعات جامع در قالب یک «پرامپت غنیشده» ایجاد میکند تا مدل زبانی بزرگ بتواند بر پایه دادههای واقعی و دقیق، پاسخدهی را انجام دهد.
3. تولید پاسخ (Generation)
قسمت انتهای نیز به معنی ساخت پاسخ نهایی توسط مدل زبانی بزرگ اختصاص دارد. در این گام، مدل زبانی «پرامپت غنیشده» را پردازش کرده و بر اساس اطلاعات معتبر دریافتشده، پاسخی دقیق، بهروز و بدون هیچ توهم (Hallucination) ارائه میدهد.
پیشینه نامگذاری RAG:
فناوری RAG نخستینبار در سال ۲۰۲۰ میلادی طی مقالهای با عنوان
«Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks» به قلم پاتریک لوئیس و پژوهشگرانی از پژوهشگاه هوش مصنوعی فیسبوک (Meta AI)، دانشگاه کالج لندن (UCL) و دانشگاه نیویورک (NYU) معرفی شد.
طراحان، این راهکار را یک دستور تنظیم دقیق (Fine-Tuning) همهمنظوره نامیدند؛ زیرا بدون نیاز به تغییرات زیرساختی، امکان اتصال هر مدل زبانی بزرگ(LLM) را به پایگاههای دانش برونسازمانی و بهروز فراهم میسازد.
عبارت RAG امروزه به پایه واساس خانوادهای گسترده از روشها در صدها مقاله و سرویس تجاری تبدیل شده است؛ روشهایی که به باور لوئیس ( مدیر کنونی بخش RAG در شرکت Cohere ) مسیر آینده هوش مصنوعی مولد را تعیین میکنند.
لوئیس بعدتر با اشاره به نامگذاری سریع این فناوری در زمان نگارش مقاله ابراز تأسف کرد و گفت: «اگر میدانستیم این ساختار تا این حد همهگیر میشود، نام خوشآهنگتری برای آن انتخاب میکردیم . ما تصمیم داشتیم نام خوشآهنگتری برگزینیم، اما هنگام نگارش مقاله، ایده بهتری به ذهن کسی نرسید».

RAG چگونه کار میکند؟
در مدلهای زبانی بزرگ، پاسخها فقط بر اساس اطلاعات و متنهایی تولید میشوند که در زمان ساخت و آموزش اولیه به مدل داده شده است. در مقابل، فناوری RAG با افزودن یک مکانیسم جستجو و استخراج، ورودی کاربر را قبل از ارسال به مدل زبانی، برای جستجو و استخراج اطلاعات دریک منبع دادهی خارجی به کار میگیرد.
در این فرآیند، پرسش اصلی کاربر به همراه دادههای بهدستآمده از جستجو، بهطور همزمان در اختیار مدل زبانی قرار میگیرد تا خروجی نهایی با ترکیب «دانش اولیه مدل» و «اطلاعات جدید منبع خارجی» با دقتی بالاتر تولید شود.
فناوری RAG با اتصال مدلهای زبانی به منابع اطلاعاتی، پاسخدهی بر اساس دادههای بهروز و اختصاصی را ممکن میسازد. روند کلی این فرآیند در چند گام اصلی انجام میشود:
دادههای خارجی و فرآیند آمادهسازی (External Data and Generation)
به تمامی اطلاعات موجود در خارج از مجموعه دادههای آموزشی اولیه مدل زبانی ، دادههای خارجی گفته میشود. این دادهها از منابع متعددی نظیر (API) ها، پایگاههای داده و فایلها یا اسناد ذخیرهشده بهدست میآیند و میتوانند قالبهایی چون متون طولانی، فایلها یا رکوردهای داده را شامل شوند.
در معماری RAG، جهت قابل استفاده ساختن این اطلاعات، مدلهای تعبیهساز (Embedding Models) دادههای یادشده را به نمایشهای عددی (بردارهای ریاضی) تبدیل و در پایگاههای داده برداری ذخیره میسازند. این اقدام سبب تشکیل یک پایگاه دانش یکپارچه و قابل درک برای پردازش توسط هوش مصنوعی مولد میگردد.

بازیابی اطلاعات مرتبط (Relevant Information Retrieval)
مرحله استخراج و سنجش پیوستگی معنایی میان پرسش ورودی و دادههای ذخیرهشده در پایگاه دانش است. در این گام، عبارت یا پرسش کاربر ابتدا به یک بردار عددی تبدیل شده و سپس بر پایه محاسبات ریاضی، با بردارهای موجود در پایگاه داده تطبیق داده میشود تا مرتبطترین اسناد شناسایی گردند.
برای نمونه، در یک سامانه هوشمند منابع انسانی، پس از طرح پرسش «میزان مرخصی استحقاقی چقدر است؟»، سیستم بردار این پرسش را با پایگاه داده تطبیق داده و اسناد مربوط به مقررات مرخصی و سوابق فردی کاربر را بهدقت استخراج و بازمیگرداند.
تقویت درخواست (Prompt Augmentation)
مرحلهای است که طی آن، پرامپت یا پرسش کاربر با اطلاعات مرتبط و بازیابیشده از پایگاه دانش ترکیب میشود. این گام از طریق روشهای مهندسی پرامپت (Prompt Engineering) صورت میپذیرد تا زمینهای جامع و دقیق شکل گیرد.
در نهایت، این درخواستِ تقویتشده در اختیار مدل زبانی بزرگ قرار میگیرد تا پاسخ نهایی بر پایه دادههای واقعی، کاملاً مستند و دقیق تولید شود.
تغییرات مهمی که برای روانی متن انجام شد:
- حذف واژههای تکراری: عبارت «در بستر زمینه» حذف و به «اطلاعات مرتبط و کاربردی» یا «زمینه» تبدیل شد تا جمله سنگین نباشد.
- بهبود ساختار جملات: جملات کوتاه و مرتبط به هم وصل شدند تا خواندن متن برای مخاطب واژهنامه آسانتر و جذابتر شود.
- سادگی کلمات: از به کار بردن اصطلاحات پیچیده فارسی خودداری شد تا اصالت متن حفظ شود و در عین حال کاملاً فهمپذیر باشد.
بهروزرسانی دادههای خارجی (Updating External Data)
جهت حفظ بروز بودن اطلاعات و ارتقای دقت پاسخها در فرآیند RAG، پایگاه دانش برداری باید بهطور پیوسته بازنگری و بهروزرسانی شود. این بازنگری شامل انباشت مجدد اسناد و بهروزرسانی بردارهای ذخیرهشده است که به دو روش انجام میپذیرد: پردازش آنی (Real-time) یا پردازش دورهای و دستهای (Batch Processing).
مدیریت پویای دادهها و جلوگیری از ارائه اطلاعات منقضیشده توسط مدل زبانی، از چالشهای کلیدی علوم داده است که با بهروزرسانی مستمر تعبیهها (Embeddings) برطرف میگردد.
نکات بهبود یافته در این ویرایش:
- حذف عبارات گفتگو محور: جملاتی مانند «پرسش بعدی این است —» حذف شدند تا متن حالت دانشنامهای و رسمی به خود بگیرد.
- جایگزینی اصطلاحات پیچیده: اصطلاح «نمایش تعبیهای اسناد» و «غیرهمزمان» با معادلهای روانتر توضیح داده شدند تا کاربر واژهنامه بدون سردرگمی مفهوم را درک کند.
- روانی کلام: جملات بهگونهای به هم متصل شدهاند که خواندن آن آسان و لحن متن یکدست و ادبی باشد
درک RAG در دنیای واقعی
نمونهای از بهکارگیری RAGمی توان عملکرد سامانه هوشمند پاسخدهی به پرسشهای سازمانی اشاره کرد. در صورتی که یک کارمند از چتبات بپرسد: «چقدر مرخصی استحقاقی دارم؟»، سیستم با اتکا به فرآیند RAG، سند رسمی «سیاستهای مرخصی سازمان» را به همراه «سوابق فردی کارمند» از پایگاه داده استخراج میکند. سپس مدل زبانی با پردازش این زمینه اختصاصی، پاسخی دقیق، شخصیسازیشده و مطابق با مقررات فعلی ارائه میدهد.

نقطه عطف هوش مصنوعی: اهمیت و مزایای RAG
فناوری RAG با برطرف ساختن دو چالش کلیدی مدلهای زبانی بزرگ — یعنی «پیشبینیناپذیری و توهم (Hallucination)» و «محدودیت زمانی دانش (Cut-off Date)» — امکان تعامل مستقیم و پویا با مخازن داده برونسازمانی را فراهم میآورد.
زمینههای اصلی بهکارگیری:
- پزشکی و درمان: اتصال به پروندهها و دانشنامههای تخصصی جهت ارائه دستار هوشمند به کادر درمان.
- تحلیل مالی: لینک دادههای لحظهای بازار سرمایه به مدل جهت ارائه تحلیلهای اقتصادی دقیق.
- کسبوکارها و سازمانها: تبدیل مستندات فنی، ویدیوها و گزارشهای داخلی به پایگاه دانش (Knowledge Base) برای ارتقای پشتیبانی مشتریان و آموزش نیروها.
قابلیتهای گسترده این معماری در تنوعبخشی به خدمات هوشمند، سبب یکپارچهسازی و پذیرش گسترده آن توسط غولهای فناوری نظیر مایکروسافت، گوگل، انویدیا، آیبیام و آمازون شده است.
مرزهای مفهومی: RAG در برابر جستجوی معنایی (Semantic Search)
اگرچه RAG و جستجوی معنایی هر دو جهت دسترسی به اطلاعات خارجی به کار میروند، اما ماهیت و نقش آنها متفاوت است؛ جستجوی معنایی یک روش بازیابی پیشرفته است، در حالی که RAG یک معماری کامل برای پردازش و تولید متن محسوب میشود.
- نقش جستجوی معنایی: این فناوری با تحلیل مفاهیم و ارتباطات معنایی — بهجای تطبیق ساده کلیدواژهها — اسناد و عبارات مرتبط را از حجم عظیمی از دادههای سازمانی استخراج میکند. همچنین فرایندهایی مانند قطعهبندی اسناد و مرتبسازی دادهها بر اساس میزان ارتباط را بهطور خودکار انجام میدهد.
- نقش RAG: سیستم RAG نتایج حاصل از جستجوی معنایی را به عنوان زمینه (Context) دریافت کرده و در اختیار مدل زبانی بزرگ قرار میدهد تا پاسخی دقیق، روان و مستند تولید شود.
در واقع، جستجوی معنایی به عنوان بخش بازیابی (Retrieval)، کیفیت و دقت خروجی را در معماری RAG به حداکثر میرساند.
اکوسیستم RAG: ابزارها و فریمورکهای توسعه یافته با RAG
توسعه و استقرار معماری RAG نیازمند زیستبومی متشکل از سرویسهای ابری، کتابخانههای نرمافزاری و زیرساختهای سختافزاری است. مهمترین ابزارها و پلتفرمها در این حوزه عبارتاند از:
سرویسهای ابری آمازون (AWS):
- Amazon Bedrock: سرویس کاملاً مدیریتشده برای اتصال مستقیم مدلهای پایه به منابع داده و مدیریت خودکار تبدیلهای برداری و بازیابی.
- Amazon Kendra: موتور جستجوی سازمانی مبتنی بر یادگیری ماشین با قابلیت بازیابی تا ۱۰۰ گزاره مرتبط معنایی و اتصالات پیشساخته به سامانههایی چون SharePoint و Confluence.
- Amazon SageMaker: مرکز توسعه یادگیری ماشین حاوی الگوها و دفترچههای راهنما برای تسریع در پیادهسازی خطوط لوله RAG.

فریمورکهای توسعه نرمافزار:
- LangChain: کتابخانه متنباز کلیدی برای زنجیرهسازی و متصل کردن مدلهای زبانی، مدلهای تعبیهساز و پایگاههای دانش.
اکوسیستم نرمافزاری و سختافزاری انویدیا (NVIDIA):
- NVIDIA AI Blueprint for RAG: الگوی پایه برای ساخت خطوط لوله مقیاسپذیر و سفارشیسازیشده استخراج و بازیابی داده.
- NVIDIA NeMo Retriever: مدلهای اختصاصی برای افزایش دقت بازیابی داده در مقیاس بزرگ.
- NVIDIA NIM Microservices: ریزخدمتهایی برای استقرار امن و بهینه مدلها در ابزارها و مراکز داده مختلف.
- TensorRT-LLM: نرمافزار شتابدهی پردازش برای اجرای سریع و محلی خطوط لوله RAG در محیط ویندوز.
- NVIDIA GH200 Grace Hopper Superchip: زیرساخت سختافزاری قدرتمند با پهنای باند و حافظه بالا جهت پردازش حجم عظیمی از دادهها در پردازشهای سنگین RAG

پلتفرمهای ابری و پایگاههای داده برداری: شرکتهای پیشتاز نظیر IBM، Google، Microsoft، Oracle، Glean و همچنین پایگاههای داده برداری مانند Pinecone، بخش مهمی از زیرساختهای ارائه و پشتیبانی از فناوری RAG را تشکیل میدهند.
