الذكاء الاصطناعي على مستنداتك الخاصة: كيف يعمل RAG

تقوم معظم مشاريع الذكاء الاصطناعي في الشركات على تقنية واحدة: استرجاع المقاطع المناسبة من مستندات المؤسسة، ثم مطالبة النموذج بالإجابة اعتمادا عليها. إليكم كيف تعمل، وأين تخطئ، ولماذا يفضل إبقاء المستندات الحساسة في مكانها.

مصدر جيد وإجابة خاطئة

سأل مسافر مساعد المحادثة في موقع Air Canada عن الأسعار المخصصة للسفر بسبب الحداد. شرح له المساعد أنه يستطيع دفع ثمن تذكرته بالسعر العادي ثم طلب التخفيض بعد ذلك، في غضون 90 يوما. وفي الرسالة نفسها قدم رابطا إلى الصفحة الرسمية للشركة. لكن هذه الصفحة تقول العكس: سعر الحداد لا ينطبق على الطلبات المقدمة بعد السفر.

فصلت محكمة تسوية النزاعات المدنية في كولومبيا البريطانية في فبراير 2024. كانت Air Canada تدفع بأن مساعدها يشبه كيانا مستقلا مسؤولا عن أقواله؛ ووصفت المحكمة الحجة بأنها «لافتة للنظر» وردتها. وكان على الشركة أن تدفع الفرق بين السعر المدفوع وسعر الحداد. وبحسب المحكمة، لا يهم أن تأتي المعلومة من صفحة ثابتة أو من مساعد: فالشركة مسؤولة عما ينشر على موقعها.

تلخص هذه الواقعة المشكلة التي يسعى التوليد المعزز بالاسترجاع، أو RAG اختصارا لـ retrieval-augmented generation، إلى حلها. كان المستند الصحيح موجودا. وما كان ينقص هو نظام يجيب انطلاقا منه، ويبين مصدر كل ادعاء.

المبدأ: امتحان بالكتاب المفتوح

ظهر المصطلح عام 2020 في ورقة بحثية وقعها باتريك لويس (Patrick Lewis) وأحد عشر معه من المؤلفين، قدمت في مؤتمر NeurIPS. يميز المؤلفون فيها بين ذاكرتين. الذاكرة المعلمية هي ما استوعبه النموذج أثناء تدريبه، المسجل في معاملاته. والذاكرة غير المعلمية فهرس خارجي، هو في تجربتهم نسخة من ويكيبيديا، يستشيره النظام لحظة الإجابة. وخلاصتهم أن الجمع بين الاثنتين ينتج نصوصا أدق وأكثر التزاما بالوقائع من النموذج وحده.

أوضح تشبيه هو الامتحان. الطالب الذي حفظ كل شيء عن ظهر قلب يجيب بسرعة، لكنه يخطئ فيما حفظه حفظا سيئا ويجهل كل ما تغير منذ مراجعته. أما الطالب المسموح له بفتح ملفه فيبحث أولا عن الصفحة المناسبة، ثم يكتب انطلاقا مما يقرأ. يضع RAG النموذج اللغوي في موضع الطالب الثاني.

تلخص CNIL فائدة الطريقة: فهي تنتج إجابات تثريها بيانات خارجية، وهي أكثر تحديدا وأسهل تحديثا من النموذج نفسه. وهذه هي النقطة الحاسمة بالنسبة إلى الشركة. إعادة تدريب نموذج على مستنداتها مكلفة ويجب تكرارها عند كل تحديث. وتضيف ANSSI حجة أمنية: فبمجرد دمج البيانات في التدريب يستحيل تطبيق حقوق الوصول عليها، بينما تظل المستندات المخزنة بجانب النموذج خاضعة للقواعد المعتادة لمن يرى ماذا.

عمليا، يسلسل RAG أربع عمليات: إعداد المستندات، وتحويلها إلى إحداثيات، واسترجاع المقاطع المفيدة، ثم كتابة إجابة تستشهد بها.

الخطوة 1: إعداد المستندات وتقطيعها

يبدأ كل شيء باستخراج النص. ملف معالجة النصوص أو صفحة الويب تقرأ بسهولة؛ أما ملف PDF ممسوح ضوئيا فيتطلب تعرفا على الحروف، والجدول أو المخطط يتطلبان معالجة خاصة. هذا العمل الشاق يحدد جانبا كبيرا من الجودة النهائية: النص المستخرج بشكل سيئ يعطي إجابات خاطئة مهما بلغت قوة النموذج.

ثم يقطع النص إلى أجزاء من بضع فقرات، يسميها الممارسون chunks. التقطيع ضروري لأن البحث يجب أن يشير إلى مقطع محدد لا إلى تقرير من مئتي صفحة. كما أنه يخلق فخا، وصفته Anthropic جيدا في منشور من سبتمبر 2024: الجزء المعزول يفقد سياقه. والمثال المعتمد تقرير مالي يذكر مقتطف منه أن رقم الأعمال ارتفع 3% في الربع، دون أن يحدد أي شركة ولا أي ربع.

الحلول معروفة. نجعل الأجزاء تتداخل قليلا، ونحترم العناوين والمواد بدل القطع في منتصف جملة، ونضيف إلى كل جزء وصفا موجزا لسياقه: المستند الأصلي والقسم والتاريخ. ستفيد هذه البيانات الوصفية لاحقا في التصفية والاستشهاد ومراقبة الوصول.

الخطوة 2: ترجمة المعنى إلى إحداثيات

يمر كل جزء بعد ذلك عبر نموذج تضمين (embedding)، وهو غير النموذج الذي سيكتب الإجابة. دوره تحويل نص إلى قائمة من الأعداد، أي متجه، تمثل معناه. المقطعان اللذان يتحدثان عن الشيء نفسه، حتى بكلمات مختلفة، يحصلان على متجهين متقاربين.

أدق صورة هي صورة الخريطة. يحصل كل مقطع على إحداثيات، لا على محورين كخط العرض وخط الطول، بل على مئات أو آلاف الأبعاد. وعلى هذه الخريطة تجد «إشعار الاستقالة» قرب «المهلة الواجب احترامها قبل مغادرة الشركة»، مع أن العبارتين لا تشتركان تقريبا في أي كلمة. وهذا ما يميز البحث الدلالي عن البحث بالكلمات المفتاحية في محرك داخلي تقليدي.

تبدو هذه المتجهات مجردة. لكنها أقل تجريدا مما يظن. في ورقة قدمت في مؤتمر EMNLP 2023، بين باحثون أنه يمكن إعادة بناء 92% من النصوص القصيرة، ذات 32 رمزا (token)، بدقة تامة انطلاقا من تضميناتها وحدها، وبذلك استعادوا أسماء كاملة في ملاحظات سريرية. لذلك يجب حماية الفهرس المتجهي بالعناية نفسها التي تحمى بها المستندات المشتق منها.

الخطوة 3: التخزين ثم الاسترجاع

تخزن المتجهات في قاعدة متجهات، مع النص الأصلي وبياناته الوصفية. وحين يطرح مستخدم سؤالا، يحول إلى متجه بنموذج التضمين نفسه، ثم تبحث القاعدة عن الأجزاء الأقرب إحداثيات. يذكر المبدأ بأمين مكتبة يذهب، بدل البحث عن الكلمة الحرفية في العناوين، مباشرة إلى الرف الذي توجد عليه الكتب المتعلقة بالموضوع.

للبحث الدلالي وحده نقاط ضعف. فقد يفوته مرجع دقيق أو رقم عقد أو رمز مادة، وهي أمور يجدها البحث بالكلمات المفتاحية بلا عناء. لذلك تجمع الأنظمة الجادة بين الاثنين، ثم تضيف غالبا خطوة إعادة ترتيب: نموذج ثان يعيد قراءة المرشحين المختارين ويرتبهم بحسب صلتهم الفعلية بالسؤال المطروح.

قدرت Anthropic أثر هذه التحسينات على مجموعات اختبارها الخاصة. مع بحث متجهي بسيط، كانت المعلومة الصحيحة غائبة عن النتائج العشرين الأولى في 5.7% من الحالات. وبإضافة سياق إلى كل جزء، انخفضت هذه النسبة إلى 3.7%. ومع دمجها بالبحث بالكلمات المفتاحية من نوع BM25، نزلت إلى 2.9%، ثم إلى 1.9% مع إعادة الترتيب. هذه قياسات مزود على بياناته، لكن رتبة القدر تبين أن البحث، أكثر من الكتابة، هو ما يصنع جودة RAG.

الخطوة 4: كتابة الإجابة والاستشهاد بالمصادر

تدرج المقاطع القليلة المختارة في التعليمة المرسلة إلى النموذج اللغوي، مع السؤال وتعليمات صريحة: الإجابة من المقتطفات المقدمة فقط، وذكر المستند والصفحة لكل ادعاء، والقول بوضوح عندما لا تكون المعلومة موجودة فيها. يكتب النموذج حينئذ إجابة بلغة عادية، وتعرض الواجهة روابط إلى المقاطع المستشهد بها.

الاستشهاد يغير طبيعة الأداة. فبدونه يجب على المستخدم أن يصدق الآلة بكلمتها. ومعه يستطيع التحقق بنقرة واحدة، وتستطيع المؤسسة تتبع أصل إجابة مطعون فيها بعد وقوعها. في حالة Air Canada، كان الرابط موجودا لكنه ناقض النص؛ والنظام المضبوط جيدا يجب أن ينتج إجابة وفية للمصدر الذي يستشهد به، ويجب أن يكون لدى المستخدم عادة فتحه.

ولا ينبغي أيضا إغراق النموذج بالمقتطفات. أظهرت دراسة نشرت عام 2023 في Transactions of the Association for Computational Linguistics بعنوان «Lost in the Middle» أن النماذج تستفيد من المعلومة الموضوعة في بداية النص المقدم إليها أو نهايته أكثر، وتستفيد منها بدرجة أقل بوضوح حين تكون في الوسط. فبضعة مقاطع وثيقة الصلة أفضل من كومة مقاطع تقريبية.

ثم إن RAG ليس ضروريا دائما. تلاحظ Anthropic أنه دون نحو 200,000 رمز، أي ما يقارب 500 صفحة، قد يكون أبسط إدراج القاعدة كلها في التعليمة، بشرط أن يقبل النموذج نافذة سياق بهذا الطول. بالنسبة إلى لائحة داخلية وبضعة إجراءات، يطرح السؤال نفسه. أما بالنسبة إلى أرشيف مكتب، فلا يطرح.

لماذا تبدأ بها معظم المشاريع

النموذج اللغوي، مهما كان ممتازا، لا يعرف الإجراءات الداخلية للشركة ولا عقودها ولا بطاقات منتجاتها ولا تاريخ ملفاتها. RAG هو أقصر طريق لمنحه الوصول إلى هذه المعرفة دون تعديله. إضافة مستند تعني فهرسته؛ وإزالة نسخة قديمة تعني حذفها من الفهرس. العملية من إدارة المستندات، لا من تدريب جديد.

الاستخدامات متشابهة من قطاع إلى آخر. تجيب إدارة الموارد البشرية عن الأسئلة المتكررة للموظفين حول الاتفاقية الجماعية أو الإجازات. ويجد دعم العملاء بطاقة المواصفات الصحيحة. وتستجوب إدارة قانونية قاعدة عقود لتحديد بنود الإنهاء. وتساعد جماعة محلية موظفيها على التوجه وسط مداولات ولوائح تراكمت منذ سنوات. وفي كل حالة من هذه الحالات، تكمن القيمة في القدرة على إيجاد المقطع الصحيح أكثر مما تكمن في الكتابة.

الهلوسات تتناقص ولا تزول

كثيرا ما يقدم RAG بوصفه علاجا للإجابات المختلقة. لكن دراسة أجراها RegLab ومعهد HAI في جامعة ستانفورد، نشرت في مايو 2024 وشملت أكثر من 200 سؤال قانوني، تخفف هذا الوعد بشدة. فأدوات البحث القانوني من LexisNexis وThomson Reuters، القائمة على RAG والتي ادعى بعضها خلوه من الهلوسات، أنتجت معلومات غير صحيحة في أكثر من 17% من الحالات بالنسبة إلى Lexis+ AI وAsk Practical Law AI، وفي أكثر من 34% من الحالات بالنسبة إلى Westlaw AI-Assisted Research. وكان أداء GPT-4 المستخدم وحده أسوأ بوضوح، بنسبة خطأ تتراوح بين 58 و82% في هذا النوع من الأسئلة.

ويلاحظ المؤلفون أسبابا عدة: بحثا يعيد نصوصا غير منطبقة، وصعوبة خاصة بالاستدلال القانوني، وميل النموذج إلى مجاراة السؤال حتى حين يقوم على مقدمة خاطئة. فـ RAG ينقل الخطر أكثر مما يلغيه. إذا أعاد البحث المقطع الخاطئ، كتب النموذج إجابة سلسة انطلاقا من المقطع الخاطئ.

الحمايات تنظيمية في معظمها. نكون مجموعة أسئلة حقيقية نعرف إجاباتها الصحيحة، ونقيس النظام عليها قبل نشره، ثم عند كل تغيير. ونسمح له بأن يجيب بأنه لا يعرف. ونخصص مراجعة بشرية للإجابات التي تلزم المؤسسة. وفي مرافقتها لمشروع في France Travail، شددت CNIL على هذه النقطة الأخيرة: تدريب الموظفين على رصد الأخطاء، وترك الوقت لهم للابتعاد عن اقتراح الأداة.

حقوق الوصول: المساعد يرى ما يراه الفهرس

الخطر الأكثر استهانة به ليس الخطأ، بل التسرب الداخلي. إذا فهرست كل مستندات مؤسسة ما في قاعدة واحدة، استطاع متدرب أن يسأل المساعد عن راتب مديره وأن يحصل على مقتطف من كشف راتب. لم يخترق النموذج شيئا؛ لقد قرأ ما نقلته إليه القاعدة.

تجعل ANSSI من ذلك شرطا صريحا: يجب على نظام الذكاء الاصطناعي أن يحترم في إجاباته قيود الوصول الخاصة بكل مستخدم. وتوضح أن ذلك ممكن للمستندات المخزنة بجانب النموذج، بحسب قدرات أداة التخزين، وتوصي بمراجعة الحقوق المضبوطة بانتظام، مثلا كل شهر. وتصيغه Microsoft بطريقتها في وثائق الاستعداد لـ Copilot: يحترم المساعد الأذونات القائمة، وهو ما يعني عمليا كشف كل المشاركات الواسعة أكثر من اللازم التي تراكمت عبر السنين. وتذكر الشركة أن إعدادات المشاركة في SharePoint هي، افتراضيا، الأكثر تساهلا.

تخصص OWASP، وهي المؤسسة المرجعية في أمن التطبيقات، في إصدار 2025 من تصنيفها لأهم عشرة مخاطر متعلقة بالنماذج اللغوية، فئة لنقاط ضعف المتجهات والتضمينات. وفيها تسربات بين المستخدمين أو العملاء الذين يتشاركون قاعدة متجهات واحدة، وتسميم القاعدة بمستندات مفخخة، وقلب التضمينات المذكور أعلاه. والمثال المذكور يتكلم عن نفسه: سيرة ذاتية تتضمن، بنص أبيض على خلفية بيضاء، تعليمة تهدف إلى جعل نظام الفرز يوصي بالمرشح. كل مستند مفهرس سينتهي أمام عيني النموذج؛ فيجب معرفة مصدره.

النتيجة العملية سهلة القول وطويلة التنفيذ. يجب أن يحمل كل جزء مفهرس حقوق مستنده الأصلي، ويجب أن يصفي البحث بحسب هوية من يسأل، ويجب تسجيل كل استشارة في سجل.

مستندات منتهية الصلاحية، إجابات منتهية الصلاحية

يجيب RAG انطلاقا مما أوكل إليه. فإذا كان الفهرس يحتوي مذكرة الخدمة لعام 2019 والمذكرة التي حلت محلها، جاز له أن يستشهد بإحداهما أو بالأخرى بالثقة نفسها. والحالة شائعة في المؤسسات التي تتكدس فيها المستندات دون أن تسحب أبدا: جداول أسعار قديمة، وإجراءات متروكة، ونماذج عقود تجاوزها الزمن.

الحل توثيقي قبل أن يكون تقنيا. يجب تعيين مسؤول لكل مدونة، وتأريخ المستندات، وأرشفة ما استبدل، وجعل الفهرس يتابع تلقائيا الإضافات والتعديلات والحذف. وتوصي Microsoft نفسها بأرشفة المواقع غير النشطة كي يعتمد مساعدها على محتوى محدث. أما في الواجهة، فإن عرض تاريخ كل مصدر مستشهد به يسمح برصد إجابة مبنية على نص قديم من النظرة الأولى.

لماذا نشغله محليا للمستندات الحساسة

يتعامل RAG، بحكم بنيته، مع أثمن مستندات المؤسسة. ومع خدمة عبر الإنترنت، تمر هذه المستندات ومتجهاتها وأسئلة المستخدمين وإجاباتهم عند المزود أو تقيم لديه. توصي CNIL في أسئلتها وأجوبتها الصادرة في يوليو 2024 حول الذكاء الاصطناعي التوليدي بتفضيل النشر في الموقع حين تعالج بيانات شخصية أو حساسة، للحد من مخاطر الاستخراج من طرف ثالث. وتنصح ANSSI، في توصيتها R34، بعدم استخدام أدوات الذكاء الاصطناعي التوليدي عبر الإنترنت لأي استخدام مهني يتضمن بيانات حساسة.

يقدم القطاع العام مثالا موثقا. في إطار صندوقها التجريبي المخصص للذكاء الاصطناعي في الخدمات العامة، رافقت CNIL عام 2024 مشروع «Conseils Personnalisés» في France Travail، وهو أداة تقترح تدريبات على المستشارين انطلاقا من RAG يغذيه فهرس التدريبات وملف طالب العمل. وكان النموذج المعتمد، Mixtral من Mistral AI، مثبتا في الموقع. وتؤكد CNIL في توصياتها أن النموذج المستخدم في بيئة المزود ينطوي على مخاطر فقدان سرية البيانات الشخصية.

وفي بعض المهن، يمس السؤال السر المهني. فالمادة 226-13 من قانون العقوبات تعاقب بالسجن سنة وبغرامة 15,000 يورو على إفشاء معلومة ذات طابع سري من قبل من هي مودعة لديه بحكم مهنته. وتعنى بذلك مكاتب المحاماة والخبراء المحاسبين في المقام الأول. أما إدارة الموارد البشرية التي تفهرس ملفات فردية، والجماعة المحلية التي تعالج طلبات المساعدة الاجتماعية، فتتعامل بدورها مع بيانات شخصية يسبب كشفها ضررا حقيقيا للأشخاص.

يفترض المحلي أن تبقى السلسلة كلها في المكان: استخراج النص، ونموذج التضمين، وقاعدة المتجهات، والنموذج اللغوي، والسجلات. أما إبقاء النموذج لديك مع إيكال المتجهات إلى خدمة خارجية فلا يحمي كثيرا، لأن هذه المتجهات تتيح إعادة بناء جزء من النصوص. وفي المقابل، تتحمل المؤسسة التشغيل: النسخ الاحتياطية، والتحديثات، ومراقبة الوصول.

من أين نبدأ

المشروع الأول الناجح يقوم على أمور قليلة: مدونة محدودة ومحكمة الإدارة، مثل إجراءات إحدى الإدارات، وحقوق وصول واضحة، ومجموعة أسئلة حقيقية لقياس الجودة، ومستخدمون يعرفون أن عليهم فتح المصادر المستشهد بها. نادرا ما تأتي الصعوبات من النموذج. إنها تأتي من المستندات، ومن حالتها ونسخها، ومن مسألة من له الحق في قراءتها.

هذا هو النهج الذي تعتمده HOMN: المستندات والفهرس والنموذج تبقى داخل جدران المؤسسة، ويظل اللجوء إلى خدمة خارجية خيارا صريحا. وأيا كانت الأداة المختارة، ستتوقف جودة الإجابات أولا على جودة المدونة وصرامة الحقوق.

ما هو RAG؟

RAG، اختصار retrieval-augmented generation أي التوليد المعزز بالاسترجاع، تقنية تبحث أولا عن المقاطع المناسبة في قاعدة مستندات، ثم تطلب من نموذج لغوي أن يجيب انطلاقا من هذه المقاطع. وهي تتيح استجواب مستنداتك الخاصة دون إعادة تدريب النموذج، والاستشهاد بمصدر كل إجابة.

هل يزيل RAG الهلوسات؟

لا، إنه يقللها دون أن يقضي عليها. قاست دراسة من ستانفورد نشرت عام 2024 أكثر من 17% من الإجابات غير الصحيحة في أدوات قانونية تجارية قائمة على RAG. وإذا أعاد البحث مقطعا خاطئا، كتب النموذج إجابة سلسة انطلاقا من ذلك المقطع، ومن هنا أهمية الاستشهادات والتحقق البشري.

هل يجب تدريب ذكاء اصطناعي على مستنداتي كي يعرفها؟

عموما لا. يترك RAG النموذج كما هو ويزوده بالمقتطفات المفيدة عند كل سؤال، مما يتيح تحديث القاعدة بإضافة المستندات أو إزالتها. كما يتيح الإبقاء على حقوق الوصول لكل مستند، وهو ما تراه ANSSI مستحيلا بمجرد دمج البيانات في التدريب.

هل يمكن إنشاء روبوت محادثة على مستنداتي دون إرسالها إلى السحابة؟

نعم. يمكن لاستخراج النص ونموذج التضمين وقاعدة المتجهات والنموذج اللغوي أن تعمل كلها على خادم مثبت في مقر المؤسسة. وهذا هو الخيار الذي توصي CNIL بتفضيله عند معالجة بيانات شخصية أو حساسة.