May 24, 20268 min read

بناء خطوط RAG جاهزة للإنتاج: ما وراء الدروس التعليمية

Muhammad Talha Sultan

Lead Engineer, Innvo Labs

التوليد المدعوم بالاسترجاع (RAG) هو الطريقة الافتراضية لربط النماذج اللغوية الكبيرة بالبيانات الخاصة بك. إذا اتبعت درساً تعليمياً أساسياً، فسيكون لديك روبوت دردشة يعمل في غضون عشرين سطرًا من لغة بايثون باستخدام LangChain أو LlamaIndex.

ولكن إذا قمت بنشر هذا الكود البرمجي في بيئة الإنتاج، فسيشتكي مستخدموك سريعاً. سيحصلون على إجابات غير ذات صلة، وحقائق وهمية (هلوسة)، وأوقات تحميل بطيئة بشكل محبط.

يفترض الدرس التعليمي ملفات نصية نظيفة ومنسقة مسبقاً بصيغة Markdown. أما بيانات الأعمال في العالم الحقيقي فهي فوضى من ملفات PDF متعددة الصفحات، والجداول المعقدة، والمسوحات الضوئية غير الواضحة، وجداول البيانات المتداخلة.

إليك كيفية تصميم وبناء خطوط RAG التي تعمل بالفعل في بيئة الإنتاج.

1. كابوس التحليل (Parsing)

إذا كان المحلل الخاص بك لا يستطيع استخراج نص نظيف من مستنداتك، فإن استرجاعك محكوم عليه بالفشل من البداية. غالبًا ما تقرأ مكتبات PDF القياسية الجداول كتدفق مسطح من النص، مما يخلط الأعمدة معاً.

لقد توقفنا عن استخدام طرق استخراج النصوص البسيطة لأي شيء يحتوي على هياكل معقدة. بدلاً من ذلك، نستخدم محللات تراعي التخطيط البصري أو نماذج التحليل المرئي مثل Unstructured أو LlamaParse. إذا كان المستند يحتوي على جداول هامة، فنحن نحول الصفحات إلى صور ونستخدم النماذج المرئية لاستخراج الجداول بصيغة Markdown نظيفة. إنها طريقة أكثر تكلفة، لكنها الطريقة الوحيدة للحفاظ على البيانات الجدولية قابلة للقراءة للنموذج.

2. التقسيم الذكي يتفوق على التقسيم العشوائي

تقسيم النص كل 500 حرف مع تداخل 50 حرفاً هو أمر بسيط، ولكنه يقطع الجمل بشكل عشوائي، ويفصل الحقائق الأساسية عن سياقها.

بدلاً من ذلك، نستخدم تقسيماً يعتمد على علامات الترقيم وهيكل المستند (مثل الفقرات وعناصر القائمة). والأفضل من ذلك هو **تقسيم الأب والابن** (أو الاسترجاع من الصغير إلى الكبير):

  • نقوم بتقسيم المستندات إلى أجزاء صغيرة (على سبيل المثال، 100-200 توكن) لتمثيلها كمتجهات. هذا يحافظ على تركيز التمثيل المتجهي الدلالي للغاية.
  • يشير كل جزء صغير إلى جزء أب أكبر (على سبيل المثال، 1000 توكن) يحتوي على السياق الأوسع.
  • عندما تطابق قاعدة البيانات المتجهية الجزء الصغير، نقوم باسترجاع الجزء الأب الأكبر وتغذية النموذج اللغوي به.

هذا يمنحنا أفضل ما في الحالتين: مطابقة دقيقة للغاية وسياق كامل.

3. البحث الهجين وإعادة الترتيب (Reranking)

البحث المتجهي رائع في التقاط التشابه المفاهيمي، ولكنه سيء بشكل ملحوظ في العثور على مصطلحات محددة، مثل الأرقام التسلسلية للمنتجات أو معرفات النظام المخصصة.

في الإنتاج، نقوم دائماً بتنفيذ **البحث الهجين**:

1.

تشغيل بحث متجهي دلالي (على سبيل المثال، باستخدام pgvector في PostgreSQL أو Pinecone).

2.

تشغيل بحث تقليدي بالكلمات المفتاحية (مثل BM25).

3.

دمج النتائج باستخدام دمج الرتب المتبادلة (RRF).

بعد دمج القوائم، نقوم بتمريرها عبر **نموذج إعادة الترتيب** (مثل Cohere Rerank أو BGE-Reranker). نماذج إعادة الترتيب هي نماذج أصغر ومتخصصة تقيم العلاقة الدقيقة بين استعلام المستخدم والنص المسترجع. تقوم هذه النماذج باستبعاد التطابقات غير ذات الصلة، مما يقلل من حجم السياق الذي نرسله إلى النموذج اللغوي الكبير.

4. تحسين زمن الاستجابة والتكلفة

إرسال 8,000 توكن من السياق إلى Claude أو GPT-4o لكل سؤال بسيط هو أمر بطيء ومكلف.

لحل هذا:

  • **التخزين المؤقت للمطالبات (Prompt Caching)**: إذا كانت مطالباتك تشترك في سياق أساسي مشترك (مثل دليل المنتجات أو الكتيبات)، فنحن نخزن تلك التوكنز مؤقتاً. تدعم Anthropic و OpenAI التخزين المؤقت للمطالبات، مما يقلل التكاليف بنسبة تصل إلى 50% ويقلل من زمن استجابة النموذج.
  • **التخزين المؤقت للمتجهات**: نقوم بتخزين استعلامات المستخدمين الشائعة وأجزاء النصوص المسترجعة الخاصة بهم في ذاكرة تخزين مؤقت مثل Redis. إذا سأل مستخدم آخر سؤالاً ممثلاً، نتخطى البحث المتجهي واستدعاءات النموذج بالكامل.
  • **استجابات التدفق (Streaming)**: قم دائماً بتدفق المخرجات إلى العميل. لا يمانع المستخدمون في أن يستغرق الاستعلام 3 ثوانٍ إذا بدأ النص في الكتابة والظهور على الشاشة فوراً.

الخلاصة

بناء خط RAG كعرض تجريبي يستغرق بضع ساعات. أما بناء خط يخدم مئات العملاء بإجابات دقيقة وسريعة فيتطلب انضباطاً هندسياً في إدخال البيانات، واستراتيجيات الاسترجاع، وإدارة التكلفة. توقف عن الاعتماد على الإعدادات الافتراضية، وقيم دقة استرجاعك، واستخدم البحث الهجين، ونظف بياناتك قبل تحويلها إلى متجهات.

05 / اتصال

فلنتحدث

التقنيات

  • Next.js · React · Node.js
  • Python · FastAPI
  • AWS · Vercel

المكاتب

  • عن بعد أولاً
  • عملاء حول العالم

السنة

  • 2026
  • مستمر

© 2026 إينفو لابس. جميع الحقوق محفوظة.

نقدم برمجيات موثوقة، ذكاء اصطناعي، وتصميم.