الحدّ الزمني للمعرفة

ما الحدّ الزمني للمعرفة (الحدّ الزمني لبيانات التدريب)، ولماذا لا يطابق تاريخ إصدار النموذج، وما أدوات الذكاء الاصطناعي التي تتجاوزه بالاسترجاع، وما دلالته لتحسين محركات البحث.

نُشر أول مرة: 24 يونيو 2026 · آخر تحديث: 22 أغسطس 2026 · Advanced
اللغات

الحدّ الزمني للمعرفة هو التاريخ الذي توقف بعده تدريب نموذج لغوي كبير على بيانات جديدة، وليس تاريخ إصداره. وهو يقيّد المعرفة البارامترية المدمجة في النموذج فقط. أما الأدوات التي تستخدم الاسترجاع، مثل Google AI Overviews وBing Copilot وPerplexity وChatGPT مع البحث، فتؤسس الإجابات على فهرس حي وتتجاوز الحد عمليًا. وهذا ينشئ مهمتين منفصلتين لتحسين محركات البحث: الظهور في بيانات التدريب على المدى الطويل، والبقاء مفهرسًا وحديثًا كي يُسترجع المحتوى وقت الاستعلام.

باختصار — الحدّ الزمني للمعرفة هو تاريخ توقف جمع بيانات التدريب، لا تاريخ الإصدار، وغالبًا تفصل بينهما 6–12 شهرًا أو أكثر. وهو يقيّد المعرفة البارامترية المدمجة فقط. تتجاوز الأنظمة المعززة بالاسترجاع هذا القيد عمليًا بالاعتماد على فهرس حي، بينما تبقى النماذج الأساسية بلا بحث مجمدة. والحد منطقة ضبابية لا جدارًا؛ لذا تنقسم مهمة SEO إلى إدخال المحتوى في بيانات التدريب والبقاء مفهرسًا وحديثًا للاسترجاع.

ما الحدّ الزمني للمعرفة فعليًا؟

تختلف الحدود باختلاف النموذج والإصدار، وقد تتغير عند تحديث المورّد للنموذج. Evidence for this claim Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Scope: OpenAI model metadata; the date is model- and version-specific and may change with releases. Confidence: high · Verified: OpenAI: Models لا تستنتج حداثة المنتج الحالي من تاريخ حدّ تتذكره وحده. Evidence for this claim A product can supplement model knowledge with current web search and cited web sources. Scope: ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Confidence: high · Verified: OpenAI: ChatGPT search

الحدّ الزمني للمعرفة هو التاريخ الذي لم يعد النموذج بعده يتدرب على بيانات جديدة. تتجمد معرفته في أوزانه عند تلك النقطة، ما لم يضف النظام استرجاعًا حيًا.

المصطلح الأدق هو الحدّ الزمني لبيانات التدريب، أما «الحدّ الزمني للمعرفة» فهو الاختصار الشائع. تخيله كتابًا أُرسل إلى المطبعة: بعد طباعته لا يمكن إضافة فصل إلا في طبعة جديدة. وبالمثل لا تدخل الحقائق الجديدة إلى النموذج إلا في تشغيل تدريب لاحق.

هذا قيد على المعرفة البارامترية المدمجة في الأوزان فقط. لا يعني أن النموذج يعجز عن معالجة أحداث لاحقة. فإذا زودته بالمعلومات ضمن السياق عبر RAG أو موجّه نظام، يستطيع النموذج اللغوي الكبير الاستدلال عليها. الحد يقيّد ما يعرفه وحده، لا ما يستطيع العمل عليه حين تزوده بالمصادر.

The cutoff freezes parametric knowledge; retrieval can add current evidence without changing the model's weights. المصدر: /ai-search/how-search-works/knowledge-cutoff/

A current question can follow two paths. On the weights-only path, the model relies on knowledge frozen at the training cutoff. On the grounded path, the system retrieves current sources and places them in the model's context. Retrieval supplies evidence at query time; it does not update or retrain the model weights.

© Patrick Stox LLC · CC BY 4.0 ·

تمييز Anthropic بين الحدّ الموثوق وحدّ التدريب

تفرق Anthropic بين تاريخين: الحدّ الموثوق للمعرفة، الذي تكون المعرفة حتى تاريخه أوسع وأكثر موثوقية، والحدّ الزمني لبيانات التدريب الأوسع. وعادة يسبق التاريخ الموثوق تاريخ التدريب بأشهر.

يرجع الفرق إلى ندرة المحتوى الأحدث في المجموعة؛ فالإنترنت لم يكتمل حديثه عن الأحداث شديدة الحداثة. لذلك قد تكون معرفة النموذج العملية بالأسابيع الأخيرة قبل حد التدريب ضعيفة رغم وجود بعض بياناتها. وعند رؤية تاريخ واحد واثق، تذكر أن الحد المفيد قد يكون أقدم.

الحدّ الزمني للمعرفة ليس تاريخ إصدار النموذج

ينتهي جمع البيانات أولًا، ثم تأتي التنقية واختبارات السلامة والتقييم والمواءمة، ولذلك تكون الفجوة عادة 6–12 شهرًا أو أكثر:

النموذجالحدّ الزمني للمعرفةالتأخر حتى الإصدار
GPT-5 (الأصلي، مهمل)30 سبتمبر 2024نحو 10 أشهر
Claude Opus 4,1 (مهمل)مارس 2025نحو 4 أشهر
Gemini 2,5 Proنحو 3 أشهر

(الأرقام من نقاش واسع الاستشهاد في Hacker News، ويجب مقارنتها ببطاقات النماذج الرسمية. حتى هذا التحديث أصبحت أمثلة كانت حالية مهملة، ولذلك أبقيناها كتاريخ لا كتوصيات.)

النتيجة أن النموذج الذي صدر للتو ليس بالضرورة حديث المعرفة. وقد يكون متأخرًا عن العالم عامًا. وتغير الأمثلة سريعًا هو سبب تركيز هذه الصفحة على آلية الحدود؛ تعامل مع كل جدول مؤرخ كلقطة لا كحقيقة دائمة.

الحدّ منطقة ضبابية لا جدار

يتخيله الناس خطًا حادًا: معرفة كاملة قبله وفراغ بعده. لكن الأبحاث تقول غير ذلك.

وجدت ورقة Dated Data: Tracing Knowledge Cutoffs in Large Language Models أن الحدود الفعلية قد تختلف كثيرًا عن المعلنة. تحمل مجموعات CommonCrawl نسخ Wikipedia من 2016–2019 رغم تأريخ التفريغ في 2023، وفي مجموعة واحدة كان أكثر من 80% من الوثائق من نسخ أقدم من 2023. وفي بعض العائلات سبق الحد الفعلي المعلن بثلاث أو أربع سنوات.

وتتدهور الدقة تدريجيًا كلما اقتربت الأسئلة من الحد بسبب قلة إشارة التدريب للأحداث الحديثة. كما وجدت أبحاث أخرى أنه لا يمكن دفع النموذج بثقة إلى نسيان حقائق ما بعد الحد؛ تنجح إزالة الحقائق المباشرة نحو 82% من الوقت، لكن المعرفة السببية تتسرب نحو 81%. لذا تعامل معه كمنطقة ضبابية في الاتجاهين.

أي الأدوات مقيدة وأيها يتجاوز الحد؟

يعتمد أثر الحد على ما إذا كانت الأداة تسترجع محتوى حيًا.

مقيدة بالحد (بارامترية فقط)

  • ChatGPT المجاني أو مع تعطيل التصفح يجيب من بيانات التدريب فقط؛ وتوضح OpenAI أن تعطيل بحث الويب يمنع استخدامه حتى إذا طلب المستخدم البحث.
  • أي نموذج أساسي بلا أدوات، مثل Claude أو Gemini أو GPT عبر استدعاء API خام بلا استرجاع.

تتجاوز الحد عمليًا (الاسترجاع أو التأسيس)

  • Google AI Overviews وAI Mode تستخدم RAG، أو ما تسميه Google التأسيس، للاسترجاع من الفهرس الحي. يظل للنموذج حد بارامتري، لكن التأسيس يجلب صفحات حديثة وقت الاستعلام.
  • Perplexity أداة بحث أولًا، تنفذ بحث ويب لحظيًا لمعظم الاستعلامات.
  • Microsoft Copilot مؤسس على Bing افتراضيًا، فيسد فجوات المعرفة بمعلومات الويب الحالية.
  • ChatGPT مع تشغيل البحث يحول الطلب إلى استعلامات ويسترجع النتائج ويجيب منها مع روابط.

المعرفة البارامترية والمسترجعة تتصرفان بشكل مختلف

حتى مع تشغيل الاسترجاع لا يبدو المصدران متماثلين. تظهر المعرفة المدمجة بطلاقة وسرعة ومن دون تحفظ، بينما تأتي المعرفة المسترجعة بعبارات مثل «وفقًا للتقارير». ولا يلغي الاسترجاع الأخطاء؛ فعند تعارض المصادر قد تظل الإجابات المؤسسة تهلوس. إنه يخفف أثر الحد ولا يمحو الفرق.

ما المحتوى الأكثر والأقل تأثرًا؟

يشتد أثر الحد فيما يتغير بسرعة ويضعف فيما يبقى ثابتًا.

شديد التأثر: الأسعار الحالية ومواصفات المنتجات والإصدارات؛ أسماء الشركات والاستحواذات وإعادة العلامة؛ التغييرات التنظيمية والقانونية؛ الأحداث والرياضة والانتخابات؛ القيادات والموظفون؛ الأبحاث الحديثة وبيانات السوق.

قليل التأثر: المفاهيم والتعريفات الأساسية؛ الحقائق التاريخية؛ المبادئ الرياضية والعلمية؛ أساسيات البرمجة؛ الجغرافيا.

الخطر على العلامات أن النموذج قد يقدم إجابة خاطئة بطلاقة وثقة عن حقيقة حساسة للوقت. فإذا تغير السعر أو القيادة أو المنتجات بعد حدّه، فقد يعرض الصورة القديمة وكأنها يقين.

ماذا يعني هذا لتحسين محركات البحث وGEO؟

هذه مهمتان منفصلتان، وخلطهما مصدر الخطأ.

المسار الأول: الدخول في بيانات التدريب (المدى الطويل)

كي يندمج محتواك في الذاكرة البارامترية يجب أن يوجد قبل حد التدريب وأن يُذكر بما يكفي. فالنماذج تتنبأ بالكلمة التالية، وكما ورد في بحثنا في Ahrefs عن AI Overviews: «كلما زاد ذكرك في بيانات التدريب، مثل صفحات الويب، زاد احتمال ذكرك في مخرجات النماذج اللغوية الكبيرة». يتعلق هذا المسار بحضور العلامة وسلطتها الموضوعية والسماح لبرامج زحف التدريب مثل GPTBot وClaudeBot. وتشغيلات التدريب متباعدة وغير متوقعة.

المسار الثاني: البقاء قابلًا للاسترجاع وحديثًا (المدى القريب)

في أدوات الاسترجاع يصبح الحد غير ذي أثر إذا كنت في الفهرس:

  • احصل على الفهرسة في Google وBing. يعتمد بحث ChatGPT وCopilot على Bing، بينما تعتمد AI Overviews على Google. الفهرسة شرط أساسي.
  • ميّز برامج الزحف. برامج التدريب مثل GPTBot وClaudeBot منفصلة عن برامج استرجاع بحث الذكاء الاصطناعي مثل OAI-SearchBot وPerplexityBot. يمكنك السماح لأحدها وحظر الآخر. راجع برامج زحف الذكاء الاصطناعي.
  • أشر إلى الحداثة بصدق. تساعد قيم dateModified وdatePublished الدقيقة و<lastmod> الصادق في خرائط المواقع على إعادة جلب المحتوى الحساس للوقت.

وجدت دراستنا لـ17 مليون اقتباس في Ahrefs أن المحتوى الذي تستشهد به أدوات الذكاء الاصطناعي أحدث بنسبة 25,7% من المحتوى المستشهد به عضويًا، لكن متوسط عمره ما يزال 2,9 سنة. لاحق الحداثة في الصفحات المتقلبة، لكن لا تجعلها بديلًا للمحتوى الدائم الموثوق.

خرافات ينبغي إنهاؤها

  • «الحد جدار صلب». إنه منطقة ضبابية تتراجع الدقة قربها وتختلف حدودها الفعلية عن المعلنة.
  • «الحد المعلن يساوي ما يعرفه النموذج». غالبًا يكون الحد الفعلي أقدم.
  • «AI Overviews مقيدة بحد نموذج ChatGPT الأساسي نفسه». لا؛ فهي تعتمد على فهرس Google الحي.
  • «بعد تمكين التصفح يصبح الحد بلا أهمية». لا يعمل التصفح لكل سؤال، وتختلف المعرفة المسترجعة عن المدربة.
  • «يدخل محتواي الجديد تدريب ChatGPT فورًا». لا؛ ينتظر تشغيل تدريب لاحق، بينما يوفر الاسترجاع طريقًا قريبًا.
  • «حظر GPTBot يخفيني من بحث الذكاء الاصطناعي». يؤثر في التدريب فقط، ويمكن لـOAI-SearchBot الاسترجاع آنيًا.
  • «الحد الزمني للمعرفة هو تاريخ الإصدار». غالبًا يسبقه بـ6–12 شهرًا أو أكثر.

تقع الصفحة ضمن مجموعة كيف يعمل البحث. راجع النماذج اللغوية الكبيرة وRAG والتأسيس وهلوسات الذكاء الاصطناعي.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.