زواحف الذكاء الاصطناعي

الأنواع الثلاثة لزواحف الذكاء الاصطناعي — روبوتات التدريب، وفهارس بحث الذكاء الاصطناعي، والجلب الذي يطلقه المستخدم — وأشهر الأسماء وكيف تتحكم في كل نوع من دون الإضرار بـSEO.

نُشر أول مرة: 24 يونيو 2026 · آخر تحديث: 22 أغسطس 2026 · Advanced
اللغات
عدد الأدلة في هذه الصفحة: 2

زواحف الذكاء الاصطناعي ثلاثة أنواع، والخلط بينها هو الخطأ الأكبر: روبوتات التدريب وتحسين النماذج مثل GPTBot وClaudeBot وCCBot؛ وفهارس البحث مثل OAI-SearchBot وPerplexityBot وApplebot؛ وجلب يطلقه المستخدم مثل ChatGPT-User وPerplexity-User وClaude-User. الضوابط خاصة بالمزوّد والوكيل: حظر GPTBot لا يحظر OAI-SearchBot، وOAI-AdsBot له نطاق إعلاني مستقل. Google-Extended وApplebot-Extended رموز تحكم وليسا زاحفين مستقلين. يتحكم Google-Extended في تحسين نماذج Gemini وVertex والتأسيس، لا في تضمين Google Search أو ترتيبه أو AI Overviews أو AI Mode؛ ويتحكم Applebot-Extended في استخدام نماذج Apple من دون إزالة الصفحات من بحث Apple. يظل llms.txt اقتراحاً لا معيار تحكم معتمداً على نطاق واسع.

تقول OpenAI إن إعدادات GPTBot وOAI-SearchBot وChatGPT-User مستقلة. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers وتعرض Anthropic بصورة منفصلة ClaudeBot وClaude-SearchBot وClaude-User، كما توثّق طريقة تعاملها مع robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information

الخلاصة — تنقسم زواحف الذكاء الاصطناعي إلى ثلاث فئات، والخلط بينها هو الخطأ الذي يقع فيه معظم الناس. تجمع روبوتات التدريب (GPTBot وClaudeBot وCCBot وBytespider وAmazonbot وMeta-ExternalAgent) البيانات لبناء مجموعات نماذج. وتبني روبوتات البحث بالذكاء الاصطناعي (OAI-SearchBot وPerplexityBot وApplebot وAmzn-SearchBot) فهرسًا للاستشهادات. أما الجالبون الذين يطلقهم المستخدم (ChatGPT-User وPerplexity-User وClaude-User) فيجلبون صفحة مباشرة عندما يطرح شخص سؤالًا. لكل روبوت user-agent وقاعدة robots.txt خاصة، لذلك لا يمس حظر GPTBot ‏OAI-SearchBot. Google-Extended وApplebot-Extended رمزان وليسا روبوتين — لا يزحفان، بل يتيحان لك الانسحاب من التدريب أو التأسيس. لا يؤثر حظر روبوتات التدريب في ترتيب Google (بحسب Google والبيانات التجريبية)، بينما يقلل حظر روبوتات البحث بالذكاء الاصطناعي ظهورك في إجاباتها. والنقاش حول robots.txt حقيقي بالنسبة إلى الجالبين الذين يطلقهم المستخدم (يقول المشغّلون إن القاعدة «قد لا تنطبق») وبالنسبة إلى زحف Perplexity المتخفي المبلّغ عنه. أما llms.txt فاقتراح لم تعتمدْه الشركات الكبرى، ومعظمها لا يقرأه.

الفئات الثلاث — العمود الفقري لهذا الموضوع

Classify the purpose before writing the rule: training, AI-search visibility, and live user fetching are separate decisions. المصدر: /technical-seo/how-search-works/crawling/crawler/ai-crawlers/

Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.

© Patrick Stox LLC · CC BY 4.0 ·

ينتمي كل روبوت ذكاء اصطناعي مسمّى إلى واحد من ثلاثة دلاء. إذا أصبت في تحديد الدلو، اتضحت كل القرارات اللاحقة (هل تحظره؟ هل تسمح به؟ ماذا يحدث لـSEO لديك؟).

1. زواحف التدريب وجمع البيانات. تزحف هذه الروبوتات على نطاق واسع لبناء مجموعات بيانات لتدريب نماذج اللغة الكبيرة وضبطها. وهي أكثر الروبوتات التي يرغب الناشرون في حظرها، ولا يؤثر منعها في ترتيب البحث. تشمل القائمة GPTBot (OpenAI)، وClaudeBot (Anthropic)، وCCBot (Common Crawl)، وBytespider (ByteDance)، وAmazonbot (Amazon)، وMeta-ExternalAgent (Meta)، وAI2Bot (Allen Institute)، وcohere-training-data-crawler (Cohere)، وDiffbot، وTimpibot (Timpi)، وwebzio-extended (Webz.io). وهناك أيضًا رمزان للتحكم ليسا زاحفين مستقلين: Google-Extended وApplebot-Extended، وسنعود إليهما أدناه.

2. زواحف البحث والفهرسة بالذكاء الاصطناعي. تبني هذه الروبوتات فهرسًا حيًا يُستخدم للإجابة عن الاستعلامات مع الاستشهادات والروابط العائدة إليك. وقد يؤدي حظرها إلى إزالتك من نتائج البحث بالذكاء الاصطناعي. تشمل OAI-SearchBot (OpenAI — مستقل عن GPTBot)، وPerplexityBot (Perplexity)، وApplebot (Apple — يشغّل Spotlight وSiri واقتراحات Safari)، وAmzn-SearchBot (Amazon).

3. الجالبون الذين يطلقهم المستخدم أو عند الطلب. يجلب هؤلاء صفحة محددة مباشرة لأن مستخدمًا طرح سؤالًا، لا لأن روبوتًا يجوب الويب. ويقول المشغّلون عادةً إن robots.txt لا يلزم الجلب الذي يبدأه المستخدم — وهذه منطقة متنازع عليها. تشمل القائمة ChatGPT-User (OpenAI)، وPerplexity-User (Perplexity)، وClaude-User وClaude-SearchBot (Anthropic)، وAmzn-User (Amazon، لمساعد Alexa)، وMeta-ExternalFetcher (Meta).

يوجد الجدول الكامل، مع رموز user-agent وامتثال robots.txt، في علامة تبويب Cheat Sheets — وهو محور هذه المقالة.

فخ «رمز لا روبوت» (Google-Extended وApplebot-Extended)

هذه أكثر حقيقة يساء فهمها في هذا المجال، لذلك سأكون دقيقًا: Google-Extended وApplebot-Extended لا يزحفان إلى أي شيء. لا يملك أي منهما user-agent مستقلًا ولا يولّد حركة زحف. إنهما رمزا تحكم في robots.txt يغيران ما يُسمح للزحف الموجود أصلًا بفعله بمحتواك.

  • يتحكم Google-Extended في استخدام المحتوى لتحسين تطبيقات Gemini ونماذج Vertex AI التوليدية، بما في ذلك التأسيس خارج Google Search. لكنه لا يتحكم في AI Overviews أو AI Mode في Google Search؛ فهذان يعتمدان على وصول Googlebot. وتقول Google صراحة: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (ترجمة) «لا يؤثر Google-Extended في إدراج الموقع في Google Search ولا يُستخدم إشارةً لترتيب نتائج Google Search». لذلك لا يغير من وصول Googlebot أو ترتيبك شيئًا.
  • الفكرة نفسها تنطبق على Applebot-Extended لدى Apple. تقول Apple: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (ترجمة) «لا يزحف Applebot-Extended إلى صفحات الويب، ويمكن أن تبقى الصفحات التي تمنعه مدرجةً في نتائج البحث». إنه يخرجك من تدريب نماذج Apple الأساسية (Apple Intelligence)، لكن صفحاتك تظل تظهر في Spotlight وSiri عبر الزاحف الحقيقي Applebot.

لذلك فإن Disallow: Google-Extended وDisallow: Applebot-Extended ضوابط لاستخدام المنتج، وليست حظرًا لزحف مستقل. لا تزيل نطاقاتهما المنشورة الصفحات من فهرس البحث المقابل، كما أنهما ليسا قابلين للاستبدال ولا ينبغي اختصارهما معًا إلى «روبوت تدريب».

المشغّلون الرئيسيون، روبوتًا روبوتًا

تشغّل OpenAI أربعة روبوتات معلنة، لكل منها غرض مستقل: GPTBot (للتدريب — “used to make our generative AI foundation models more useful and safe” (ترجمة) «يُستخدم لجعل نماذج الذكاء الاصطناعي التوليدية الأساسية أكثر فائدة وأمانًا»)، وOAI-SearchBot (للبحث — “used to surface websites in search results in ChatGPT’s search features” (ترجمة) «يُستخدم لإظهار المواقع في نتائج البحث ضمن ميزات بحث ChatGPT»)، وChatGPT-User (جالب للمستخدم — “used for certain user actions in ChatGPT” (ترجمة) «يُستخدم لبعض إجراءات المستخدم في ChatGPT»)، وOAI-AdsBot (نطاق إعلاني مستقل، وليس للتدريب ولا زاحف فهرس البحث). وتلخّص OpenAI السياسة التي تصلح نموذجًا للمجال كله: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (ترجمة) «إعداد كل روبوت مستقل، ما يتيح لأصحاب المواقع تحكمًا دقيقًا في تفاعل محتواهم مع أنظمة OpenAI المختلفة». ويشير منع GPTBot إلى أن “signals that future data from these materials should be excluded from model training datasets” (ترجمة) «تشير البيانات المستقبلية من هذه المواد إلى ضرورة استبعادها من مجموعات بيانات تدريب النماذج»؛ أما منع OAI-SearchBot فيعني أن موقعك “won’t appear in ChatGPT search results.” (ترجمة) «لن يظهر في نتائج بحث ChatGPT».

تشغّل Anthropic ثلاثة روبوتات: ClaudeBot (للتدريب)، وClaude-SearchBot (لفهرسة البحث)، وClaude-User (للجلب). وتقول Anthropic إن روبوتاتها “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (ترجمة) «تحترم إشارات “عدم الزحف” عبر الالتزام بالتوجيهات المعيارية في robots.txt». كما تشير صفحة الدعم الحالية إلى قائمة IP منشورة مشتركة للتحقق الخاص بـAnthropic. هذه القائمة دليل على الهوية، وليست قاعدة عامة للتحقق من كل روبوت عبر IP أو DNS العكسي.

Google — الحقيقة الأساسية هي ما سبق: Google-Extended رمز لا روبوت. وتشغّل Google أيضًا Google-CloudVertexBot (يزحف لوكلاء Vertex AI الذين يطلبهم مالك الموقع ولا يؤثر في الترتيب)، ووكلاء يطلقهم المستخدم مثل Gemini-Deep-Research وGoogle-NotebookLM.

تشغّل Apple Applebot (الزاحف الحقيقي الذي يغذي Spotlight وSiri واقتراحات Safari، وقد “may also be used to help train Apple foundation models” (ترجمة) «قد يُستخدم أيضًا للمساعدة في تدريب نماذج Apple الأساسية») ورمز Applebot-Extended. يؤدي حظر Applebot إلى إخراجك من بحث Apple، بينما يخرجك حظر Applebot-Extended من التدريب فقط.

تعلن Perplexity عن روبوتين: PerplexityBot (للبحث والاستشهادات — “not used to crawl content for AI foundation models” (ترجمة) «لا يُستخدم لزحف المحتوى لتدريب نماذج الذكاء الاصطناعي الأساسية»، ولذلك لا تملك Perplexity زاحف تدريب معلنًا) وPerplexity-User (للجلب). وتقول وثائقها إن Perplexity-User “generally ignores robots.txt rules” (ترجمة) «يتجاهل قواعد robots.txt عمومًا» لأن الجلب يبدأه المستخدم. كما أن Perplexity موضوع تقارير عن زحف متخفي — وسنعود إلى الخلاف أدناه.

تشغّل Amazon ثلاثة روبوتات، وهذه استثناءات مفيدة: Amazonbot (يحسّن المنتجات و*“may be used to train Amazon AI models”* (ترجمة) «قد يُستخدم لتدريب نماذج Amazon للذكاء الاصطناعي»)، وAmzn-SearchBot (للبحث)، وAmzn-User (لجلب Alexa). ووفق وثائق Amazon، فإن Amzn-SearchBot وAmzn-User لا يزحفان صراحةً لتدريب نماذج الذكاء الاصطناعي التوليدية — لذلك فقول «كل شركات الذكاء الاصطناعي تكشط للتدريب» خرافة. وتحترم Amazon أيضًا وسم meta باسم noarchive بمعنى خاص: «لا تستخدم الصفحة لتدريب النماذج»، وهو انسحاب نادر على مستوى الصفحة.

تضمّ معالجة Amazon لـrobots.txt حافتين تشغيليتين غير معتادتين: قد تستخدم زواحفها نسخةً مخزنة مؤقتًا من الملف خلال 30 يومًا سابقة، وتقول Amazon إن تعذر جلب الملف يجعل زواحفها تتصرف كأنه غير موجود. لكن ذلك لا يعني أن فشل جلبك التدقيقي يثبت أن Amazon رأت حالة السماح للجميع؛ فقد يصل التدقيق وAmazon إلى المضيف في أوقات مختلفة أو عبر مسارات شبكة مختلفة. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot

تشغّل Meta Meta-ExternalAgent (للتدريب والفهرسة لدى Llama وMeta AI)، وMeta-ExternalFetcher (للجلب من المستخدم)، وبصورة منفصلة Facebookbot (لمعاينات الروابط — وليس زاحف ذكاء اصطناعي). لا يؤثر حظر Meta-ExternalAgent في معاينات روابط Facebook.

تشغّل مؤسسة غير ربحية Common Crawl (CCBot) التي تحافظ على أرشيف مفتوح للويب. وهذه هي الطبقة الخفية: استُخدمت مجموعة بيانات Common Crawl لتدريب ChatGPT وClaude وLLaMA وغيرها كثيرًا، لذلك قد يؤثر حظر CCBot في نماذج لا تزحف إليك مباشرة. وتحذّر Common Crawl أيضًا من منتحلين يزوّرون هوية CCBot.

أما ByteDance (Bytespider) فهو الأكثر عدوانية: يُعلن احترام robots.txt، لكن التقارير عن مخالفته واسعة، مع أحجام طلبات مرتفعة جدًا. ومن المفيد معرفة AI2Bot (Allen Institute، والنماذج المفتوحة أو مجموعة Dolma)، وCohere، وDiffbot (استخراج البيانات المنظمة التي تغذي مخرجاته خطوط أنابيب ذكاء اصطناعي كثيرة)، وTimpibot / webzio-extended.

هل تطيع روبوتات الذكاء الاصطناعي robots.txt فعلًا؟

بالنسبة إلى زواحف التدريب والبحث، تقول الوثائق إن المشغّلين الكبار (OpenAI وAnthropic وGoogle وApple وAmazon) يحترمون robots.txt. أما المنطقة المتنازع عليها فهي الجالبون الذين يطلقهم المستخدم؛ إذ يقول مشغّلون عدة صراحةً إن robots.txt قد لا ينطبق لأن شخصًا بدأ الطلب — تقول OpenAI: “these actions are initiated by a user, robots.txt rules may not apply” (ترجمة) «هذه الإجراءات يبدأها مستخدم، وقد لا تنطبق قواعد robots.txt»؛ وتقول Perplexity إن Perplexity-User “generally ignores robots.txt rules.” (ترجمة) «يتجاهل قواعد robots.txt عمومًا». هذه سياسة معلنة، وليست إثباتًا لمخالفة.

خلاف Perplexity هو النزاع الأبرز، وسأصفه بأنه مبلّغ عنه لا محسوم. ففي يونيو 2024 أفادت Wired والمطوّر Robb Knight بأن Perplexity وصلت إلى محتوى مواقع حظرتها، على ما يبدو باستخدام عناوين IP غير معلنة. وفي أغسطس 2025 أفادت Cloudflare بأن Perplexity استخدمت user-agent متخفيًا ينتحل Chrome على macOS، وبدّلت عناوين IP وASNs لتفادي الحظر، وجلبت محتوى من نطاقات اختبار أُنشئت حديثًا تحمل Disallow: / كاملًا؛ ثم أزالت Cloudflare Perplexity من قائمة الروبوتات الموثقة. اعرض ذلك كتقارير موثقة من تلك المصادر؛ أما وثائق Perplexity نفسها فتظل تقول إن PerplexityBot يحترم robots.txt.

لأن بعض الروبوتات تتجاهل robots.txt إلى حد ما، أصبحت Cloudflare طبقة الإنفاذ العملية — حظر على مستوى الشبكة، ومفتاح «AI Scrapers and Crawlers» بنقرة واحدة، وملف robots.txt مُدار، وتتبع مخالفات robots.txt، وتجربة دفع مقابل الزحف. ومنذ يوليو 2025 تحظر نطاقات Cloudflare الجديدة زواحف الذكاء الاصطناعي المعروفة افتراضيًا.

كيف تتحكم في زواحف الذكاء الاصطناعي

  • ملف robots.txt لكل user-agent هو أداة التحكم الأساسية، وهو دقيق: حظر GPTBot لا يحظر OAI-SearchBot أو ChatGPT-User. توجد وصفات robots.txt (حظر كل روبوتات التدريب أو حظر روبوتات البحث بالذكاء الاصطناعي) في علامة تبويب Scripts.
  • رموز التدريبGoogle-Extended وApplebot-Extended — تخرجك من تدريب Gemini وApple Intelligence بلا كلفة على البحث.
  • وسم meta باسم noarchive لدى Amazon انسحاب من التدريب على مستوى الصفحة.
  • Cloudflare AI Crawl Control — حظر أو سماح أو فرض رسوم على مستوى الشبكة، مع robots.txt مُدار وتوجيهات Content Signals (search وai-input وai-train)؛ والقيمة الافتراضية هي search=yes, ai-train=no.
  • llms.txt اقتراح (Jeremy Howard / Answer.AI، سبتمبر 2024)، وليس معيارًا معتمدًا ولا تلتزم به الزواحف الكبرى. إنه خريطة Markdown منتقاة يُفترض قراءتها وقت الاستدلال، لكن دراسة Ahrefs لـ137 ألف موقع وجدت أن 97% من ملفات llms.txt المنشورة تلقت صفر طلبات، ولم يعتمدها مزوّد رئيسي لنماذج اللغة رسميًا. عامله كأداة توثيق لا كأداة لظهور البحث بالذكاء الاصطناعي.
  • يحافظ مشروع المجتمع ai.robots.txt على ملف شامل Disallow: / يسرد أكثر من 150 user-agent لروبوتات الذكاء الاصطناعي — وهو مرجع مفيد للحظر الشامل.

سياسة زحف تضع الظهور أولًا

بالنسبة إلى موقع تعليمي أو تجاري عام يريد الظهور في البحث بالذكاء الاصطناعي، هذه سياستي الافتراضية:

  1. اسمح بزواحف البحث التقليدية التي تغذي أسطح البحث التي تريدها، ومنها Googlebot وBingbot.
  2. اسمح بزواحف البحث والفهرسة بالذكاء الاصطناعي الموثقة مثل OAI-SearchBot وClaude-SearchBot وPerplexityBot على المحتوى العام.
  3. اسمح بالجالبين المقصودين الذين يطلقهم المستخدم مثل ChatGPT-User وClaude-User وPerplexity-User، مع إدراك اختلاف سلوك المزودين تجاه robots. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers
  4. اتخذ قرارًا منفصلًا بشأن حقوق التدريب وتطوير النماذج. لا يلزم أن تشترك GPTBot وClaudeBot وGoogle-Extended وضوابط التدريب الأخرى في سياسة البحث. اسمح بها فقط إذا وافق ذلك سياسة النشر لديك.
  5. احمِ المسارات الخاصة والتشغيلية بالمصادقة. أبقِ /admin/ والمعاينات وبيانات الحساب وواجهات API غير العامة خلف تفويض من الخادم؛ فـDisallow مجرد تفضيل للزاحف.
  6. تحقق من الهوية قبل تجاوز ضوابط WAF. اجمع بين user-agent الموثق ونطاقات IP الحالية للمزود والتحقق من DNS العكسي أو مصادقة الروبوت المدعومة. لا تنشئ قاعدة سماح واسعة في WAF اعتمادًا على user-agent قابل للانتحال وحده.

لا تضف مجموعة user-agent محددة لمجرد كتابة Allow: / ما لم تكرر كل قيد يجب أن يظل منطبقًا على ذلك الزاحف. وفق قواعد مطابقة robots، قد تتغلب المجموعة المحددة على مجموعة البدل بدل أن ترث استثناءات المسارات الخاصة منها في تحليل بعض المزودين. وغالبًا ما يكون الملف الآمن الأبسط مجموعة بدل آمنة مستقلّة، مع انسحابات تدريب محددة بدقة.

أما سياسة هذا الموقع حاليًا فهي سماح صريح بالبحث وإدخال الذكاء الاصطناعي والتدريب، مع استبعاد مسارات الإدارة والمعاينة وواجهات API والفخاخ والبوابات. سأبقي البحث والجلب الذي يوجهه المستخدم مسموحين. وأغيّر ai-train=yes بقرار حقوق تحريري فقط، لا كتكتيك لزيادة الظهور بالذكاء الاصطناعي، لأن الوصول للتدريب لا يملك فائدة مثبتة للاستشهاد.

وصول الزاحف ليس جاهزية للذكاء الاصطناعي

تثبت قاعدة السماح، في أقصى حد، أن سياسة robots المعلنة تسمح لوكيل مسمّى بطلب عنوان URL. ولا تثبت أن المشغّل التزم بالسياسة أو جلب الصفحة أو صَيّرها أو استخرج المعلومات المهمة أو وضعها في سياق النموذج أو استشهد بها أو أكمل إجراءً.

أبقِ الطبقات الخمس منفصلة:

الطبقةالسؤالالدليل
الإذنهل يجوز للوكيل المسمّى طلب عنوان URL وفق السياسة المعلنة؟اختبار robots الفعّال والوصول إلى الشبكة
قابلية الاستخراجهل يوجد المحتوى المهم في نص ثابت أو روابط أو بيانات وصفية أو بيانات منظمة؟التقاط خام ومصيّر مع استخراج الحقول
العرضهل يظل المحتوى موجودًا مع قدرة الوكيل الفعلية على المتصفح وJavaScript؟دليل جلب خاص بالمزود عند توفره؛ وإلا قيد اختبار معلن
قابلية التشغيلهل يستطيع الوكيل تحديد الإجراء المقصود واستدعاءه بأمان؟عقد موثق للأداة أو الواجهة واختبار مضبوط من البداية إلى النهاية
الجاهزية التجاريةهل تتطابق الهوية والسعر والتوفر والسياسة والتنفيذ والسلة والدفع؟مطابقة الخلاصة والصفحة والواجهة الخلفية والطلب

لذلك ينبغي أن يعرض مدقق وصول الزاحف مسموحًا أو محظورًا أو غير محدد للسياسة، لا «جاهزًا للذكاء الاصطناعي». يثبت طلب سجل ناجح أن الطلب حدث، لكنه ليس دليلًا على استخدام الصفحة في إجابة. كما أن إعلان خلاصة أو أداة صالح لا يثبت أن الصفحة العامة تُصيّر بصورة صحيحة أو أن الدفع يستطيع تنفيذ العرض الموصوف.

استخدم كيف يعمل بحث الذكاء الاصطناعي لطبقتي الاسترجاع والاستشهاد، وتحسين التسوق بالذكاء الاصطناعي لجاهزية الكتالوج والمعاملة. وفصل الطبقات يجعل العلاج محددًا: أصلح سياسة الوصول عند الحظر، ومخرج الصفحة عند فشل الاستخراج، والعرض عند غياب حالة، وعقد الواجهة عند تعذر التشغيل، وبيانات التجارة عند فشل الشراء.

في صفحات التجارة الإلكترونية، ينبغي لاختبار قابلية الاستخراج أن يتحقق من وجود هوية المنتج الأساسية والعرض المختار — SKU ومعرّف المجموعة والسعر والعملة والتوفر — في الاستجابة الأولية، وأن تظل متطابقة بعد العرض. ويحدد معيار صفحة المنتج الخام مقابل المصيّرة ما يجب أن يظهر على الخادم؛ أما إذن الزحف وحده فلا يقول شيئًا عن هذا العقد.

الخرافة التي تكلفك الزيارات: التدريب لا يساوي البحث بالذكاء الاصطناعي

هذه هي النقطة التي يجب إصابتها: حظر روبوتات التدريب ليس حظرًا لروبوتات البحث بالذكاء الاصطناعي. إنهما قاعدتا robots.txt منفصلتان ونتيجتاهما متعاكستان:

  • حظر روبوتات التدريب (GPTBot وClaudeBot وCCBot وBytespider، إضافة إلى رمزي Google-Extended وApplebot-Extended) → لا أثر في ترتيب Google، وفق Google وبيانات الناشرين التجريبية. أنت تنسحب من تدريب النماذج فحسب.
  • حظر روبوتات البحث بالذكاء الاصطناعي (OAI-SearchBot وPerplexityBot) → تخسر الظهور في إجابات ChatGPT وPerplexity. إنها مقايضة حقيقية وليست فائدة مجانية.

إذا حظرت على نطاق واسع — كقاعدة شاملة تلتقط OAI-SearchBot بينما قصدك إيقاف التدريب فقط — فقد تخرج نفسك بهدوء من البحث بالذكاء الاصطناعي. كن دقيقًا في الفئة التي تصيبها كل قاعدة.

لماذا يحظر الناشرون أصلًا: العقد الاجتماعي

يرجع هذا الجدل كله إلى الزيارات. وكما كتبت في تحليلي لروبوتات الذكاء الاصطناعي، “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (ترجمة) «لزحف الروبوتات إلى مواقعك كلفة، وهناك عقد اجتماعي بين محركات البحث ومالكي المواقع، إذ تضيف محركات البحث قيمة بإرسال زيارات إحالة إلى المواقع. ترسل Google الزيارات (في الوقت الحالي)، لذلك لا تُحظر». أما زواحف الذكاء الاصطناعي فلا تعيد الزيارات غالبًا حتى الآن، وتؤيد البيانات هذا القلق. وفي تحليلي لـCloudflare Radar أصبحت روبوتات الذكاء الاصطناعي بالفعل الزاحف الثاني بوضوح بعد محركات البحث، وعلى مسار تجاوزها. راجع مزيدًا من التفاصيل في علامة تبويب Stats.

إفصاح: كنت موظفًا سابقًا لدى Ahrefs وأحصل على وصول مجاني إليها. تحليل الزحف المرتبط هو عملي المنشور من تلك الفترة؛ ولا تراجع Ahrefs الاستنتاجات التحريرية الحالية لهذا الموقع ولا توافق عليها.

للاطلاع على خط الأنابيب الأوسع الذي تندرج فيه هذه المسألة — الاكتشاف وجدولة الزحف والعرض والفرق بين الزحف والفهرسة — راجع محور الزحف والموضوعات الشقيقة عن الزاحف عمومًا وuser-agent وGooglebot وBingbot وrobots.txt.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.