زواحف الذكاء الاصطناعي
الأنواع الثلاثة لزواحف الذكاء الاصطناعي — روبوتات التدريب، وفهارس بحث الذكاء الاصطناعي، والجلب الذي يطلقه المستخدم — وأشهر الأسماء وكيف تتحكم في كل نوع من دون الإضرار بـSEO.
اللغات
عدد الأدلة في هذه الصفحة: 2
- بيانات مصدر مرتبطةقائمة IP منشورة
- أداة مباشرة ذات صلةLog File Analyzer
زواحف الذكاء الاصطناعي ثلاثة أنواع، والخلط بينها هو الخطأ الأكبر: روبوتات التدريب وتحسين النماذج مثل GPTBot وClaudeBot وCCBot؛ وفهارس البحث مثل OAI-SearchBot وPerplexityBot وApplebot؛ وجلب يطلقه المستخدم مثل ChatGPT-User وPerplexity-User وClaude-User. الضوابط خاصة بالمزوّد والوكيل: حظر GPTBot لا يحظر OAI-SearchBot، وOAI-AdsBot له نطاق إعلاني مستقل. Google-Extended وApplebot-Extended رموز تحكم وليسا زاحفين مستقلين. يتحكم Google-Extended في تحسين نماذج Gemini وVertex والتأسيس، لا في تضمين Google Search أو ترتيبه أو AI Overviews أو AI Mode؛ ويتحكم Applebot-Extended في استخدام نماذج Apple من دون إزالة الصفحات من بحث Apple. يظل llms.txt اقتراحاً لا معيار تحكم معتمداً على نطاق واسع.
OpenAI تنشر ضوابط منفصلة لروبوتات التدريب والبحث وإجراءات المستخدم. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers وتوثّق Anthropic بالطريقة نفسها وكلاء منفصلين للتدريب والبحث والطلبات التي يطلقها المستخدم. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Evidence for this claim Cloudflare Radar reports worldwide Cloudflare-observed HTTP request trends for the five most active AI bots during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; it is not site-specific traffic and is not a census of all web requests. Confidence: high · Verified: Cloudflare Radar: HTTP traffic by AI botThe chart compares request trends for the five most active AI bots observed by Cloudflare during the selected four-week period, including Googlebot, ClaudeBot, Meta-ExternalAgent, GPTBot, and Bingbot.
الخلاصة — «زواحف الذكاء الاصطناعي» ليست شيئًا واحدًا، بل ثلاثة أشياء. بعض الروبوتات تزحف إلى موقعك لتدريب نماذج الذكاء الاصطناعي (مثل GPTBot وClaudeBot). وبعضها يبني فهرسًا يتيح لبحث الذكاء الاصطناعي الاستشهاد بك (مثل OAI-SearchBot وPerplexityBot). وبعضها يجلب صفحة مباشرة لأن شخصًا طرح سؤالًا للتو (مثل ChatGPT-User). لكل واحد اسم مستقل في
robots.txt، لذا يمكنك السماح به أو حظره منفصلًا. حظر روبوتات التدريب لا يضر ترتيبك في Google، أما حظر روبوتات البحث بالذكاء الاصطناعي فقد يخفيك من إجابات الذكاء الاصطناعي.
ما هي زواحف الذكاء الاصطناعي؟
أنت تعرف بالفعل زواحف البحث — روبوتًا مثل Googlebot أو Bingbot يزور صفحاتك لكي تظهر في نتائج البحث. زواحف الذكاء الاصطناعي هي المجموعة الأحدث: روبوتات تشغّلها شركات الذكاء الاصطناعي (OpenAI وAnthropic وGoogle وApple وPerplexity وغيرها) لجلب صفحاتك لأغراضها الخاصة.
أهم ما ينبغي فهمه قبل حظر أي شيء هو أن هذه الروبوتات لا تؤدي العمل نفسه. هناك ثلاثة أنواع.
- تقرأ روبوتات التدريب صفحاتك للمساعدة في بناء نماذج الذكاء الاصطناعي وتحسينها. ومن أشهرها GPTBot (OpenAI) وClaudeBot (Anthropic).
- تقرأ روبوتات البحث بالذكاء الاصطناعي صفحاتك لبناء فهرس قابل للبحث، حتى يستطيع ChatGPT أو Perplexity الإجابة عن سؤال وربط الإجابة بك. ويفعل ذلك OAI-SearchBot وPerplexityBot.
- يجلب الجالبون الذين يطلقهم المستخدم صفحة محددة في الوقت الحقيقي لأن شخصًا طلب شيئًا. ChatGPT-User مثال على ذلك — فهو لا يجوب الويب من تلقاء نفسه، بل ينفذ مهمة لمستخدم.
لماذا يهم هذا الفرق؟
لكل روبوت اسم خاص (هو user-agent)، ويمكن لملف robots.txt السماح لكل اسم أو حظره. لذلك يمكنك اتخاذ القرار لكل فئة على حدة:
- هل يزعجني أن تدرّب شركات الذكاء الاصطناعي نماذجها على محتواي؟ ← هذا سؤال يخص روبوتات التدريب.
- هل أريد الظهور في إجابات ChatGPT وPerplexity؟ ← هذا سؤال يخص روبوتات البحث بالذكاء الاصطناعي، ويرغب معظم أصحاب المواقع في إبقائها مسموحة.
هذه هي الخرافة الأهم التي يجب إيقافها: حظر روبوتات الذكاء الاصطناعي لا يضر ترتيبك في Google. قالت Google ذلك صراحة، ويواصل الناشرون الذين يحظرون روبوتات تدريب الذكاء الاصطناعي الحصول على ترتيب جيد. لكن حظر روبوتات البحث بالذكاء الاصطناعي قد يخرجك من إجابات الذكاء الاصطناعي — فلا تحظر الفئة الخطأ عرضًا.
الأسماء التي ستراها في سجلاتك
- GPTBot — OpenAI، للتدريب.
- OAI-SearchBot — OpenAI، الروبوت الذي يشغّل بحث ChatGPT.
- ChatGPT-User — OpenAI، جلب مباشر عندما يطرح المستخدم سؤالًا.
- ClaudeBot — Anthropic، للتدريب.
- PerplexityBot — Perplexity، للبحث والاستشهادات.
- CCBot — Common Crawl، منظمة غير ربحية تُستخدم بياناتها لتدريب نماذج ذكاء اصطناعي كثيرة.
- Bytespider — ByteDance (الشركة الأم لـTikTok)، للتدريب.
- Applebot — Apple، يشغّل Siri وSpotlight وApple Intelligence.
يظهر Google-Extended وApplebot-Extended في قواعد التحكم، لكنهما ليسا زاحفين فعليين. إنهما مفاتيح داخل robots.txt تقول: “don’t use my content to train your AI.” (ترجمة) «لا تستخدم محتواي لتدريب ذكائك الاصطناعي». ولا يجلب أيٌّ منهما صفحات.
هل تريد الجدول الكامل روبوتًا روبوتًا، ووصفات robots.txt، والنقاش حول «هل تطيع هذه الروبوتات robots.txt فعلًا؟»، وقرار حظرها من عدمه؟ انتقل إلى علامة التبويب Advanced.
تقول OpenAI إن إعدادات GPTBot وOAI-SearchBot وChatGPT-User مستقلة. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers وتعرض Anthropic بصورة منفصلة ClaudeBot وClaude-SearchBot وClaude-User، كما توثّق طريقة تعاملها مع robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
الخلاصة — تنقسم زواحف الذكاء الاصطناعي إلى ثلاث فئات، والخلط بينها هو الخطأ الذي يقع فيه معظم الناس. تجمع روبوتات التدريب (GPTBot وClaudeBot وCCBot وBytespider وAmazonbot وMeta-ExternalAgent) البيانات لبناء مجموعات نماذج. وتبني روبوتات البحث بالذكاء الاصطناعي (OAI-SearchBot وPerplexityBot وApplebot وAmzn-SearchBot) فهرسًا للاستشهادات. أما الجالبون الذين يطلقهم المستخدم (ChatGPT-User وPerplexity-User وClaude-User) فيجلبون صفحة مباشرة عندما يطرح شخص سؤالًا. لكل روبوت user-agent وقاعدة
robots.txtخاصة، لذلك لا يمس حظر GPTBot OAI-SearchBot. Google-Extended وApplebot-Extended رمزان وليسا روبوتين — لا يزحفان، بل يتيحان لك الانسحاب من التدريب أو التأسيس. لا يؤثر حظر روبوتات التدريب في ترتيب Google (بحسب Google والبيانات التجريبية)، بينما يقلل حظر روبوتات البحث بالذكاء الاصطناعي ظهورك في إجاباتها. والنقاش حول robots.txt حقيقي بالنسبة إلى الجالبين الذين يطلقهم المستخدم (يقول المشغّلون إن القاعدة «قد لا تنطبق») وبالنسبة إلى زحف Perplexity المتخفي المبلّغ عنه. أما llms.txt فاقتراح لم تعتمدْه الشركات الكبرى، ومعظمها لا يقرأه.
الفئات الثلاث — العمود الفقري لهذا الموضوع
Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.
© Patrick Stox LLC · CC BY 4.0 ·
ينتمي كل روبوت ذكاء اصطناعي مسمّى إلى واحد من ثلاثة دلاء. إذا أصبت في تحديد الدلو، اتضحت كل القرارات اللاحقة (هل تحظره؟ هل تسمح به؟ ماذا يحدث لـSEO لديك؟).
1. زواحف التدريب وجمع البيانات. تزحف هذه الروبوتات على نطاق واسع لبناء مجموعات بيانات لتدريب نماذج اللغة الكبيرة وضبطها. وهي أكثر الروبوتات التي يرغب الناشرون في حظرها، ولا يؤثر منعها في ترتيب البحث. تشمل القائمة GPTBot (OpenAI)، وClaudeBot (Anthropic)، وCCBot (Common Crawl)، وBytespider (ByteDance)، وAmazonbot (Amazon)، وMeta-ExternalAgent (Meta)، وAI2Bot (Allen Institute)، وcohere-training-data-crawler (Cohere)، وDiffbot، وTimpibot (Timpi)، وwebzio-extended (Webz.io). وهناك أيضًا رمزان للتحكم ليسا زاحفين مستقلين: Google-Extended وApplebot-Extended، وسنعود إليهما أدناه.
2. زواحف البحث والفهرسة بالذكاء الاصطناعي. تبني هذه الروبوتات فهرسًا حيًا يُستخدم للإجابة عن الاستعلامات مع الاستشهادات والروابط العائدة إليك. وقد يؤدي حظرها إلى إزالتك من نتائج البحث بالذكاء الاصطناعي. تشمل OAI-SearchBot (OpenAI — مستقل عن GPTBot)، وPerplexityBot (Perplexity)، وApplebot (Apple — يشغّل Spotlight وSiri واقتراحات Safari)، وAmzn-SearchBot (Amazon).
3. الجالبون الذين يطلقهم المستخدم أو عند الطلب. يجلب هؤلاء صفحة محددة مباشرة لأن مستخدمًا طرح سؤالًا، لا لأن روبوتًا يجوب الويب. ويقول المشغّلون عادةً إن robots.txt لا يلزم الجلب الذي يبدأه المستخدم — وهذه منطقة متنازع عليها. تشمل القائمة ChatGPT-User (OpenAI)، وPerplexity-User (Perplexity)، وClaude-User وClaude-SearchBot (Anthropic)، وAmzn-User (Amazon، لمساعد Alexa)، وMeta-ExternalFetcher (Meta).
يوجد الجدول الكامل، مع رموز user-agent وامتثال robots.txt، في علامة تبويب Cheat Sheets — وهو محور هذه المقالة.
فخ «رمز لا روبوت» (Google-Extended وApplebot-Extended)
هذه أكثر حقيقة يساء فهمها في هذا المجال، لذلك سأكون دقيقًا: Google-Extended وApplebot-Extended لا يزحفان إلى أي شيء. لا يملك أي منهما user-agent مستقلًا ولا يولّد حركة زحف. إنهما رمزا تحكم في robots.txt يغيران ما يُسمح للزحف الموجود أصلًا بفعله بمحتواك.
- يتحكم Google-Extended في استخدام المحتوى لتحسين تطبيقات Gemini ونماذج Vertex AI التوليدية، بما في ذلك التأسيس خارج Google Search. لكنه لا يتحكم في AI Overviews أو AI Mode في Google Search؛ فهذان يعتمدان على وصول Googlebot. وتقول Google صراحة: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (ترجمة) «لا يؤثر Google-Extended في إدراج الموقع في Google Search ولا يُستخدم إشارةً لترتيب نتائج Google Search». لذلك لا يغير من وصول Googlebot أو ترتيبك شيئًا.
- الفكرة نفسها تنطبق على Applebot-Extended لدى Apple. تقول Apple: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (ترجمة) «لا يزحف Applebot-Extended إلى صفحات الويب، ويمكن أن تبقى الصفحات التي تمنعه مدرجةً في نتائج البحث». إنه يخرجك من تدريب نماذج Apple الأساسية (Apple Intelligence)، لكن صفحاتك تظل تظهر في Spotlight وSiri عبر الزاحف الحقيقي Applebot.
لذلك فإن Disallow: Google-Extended وDisallow: Applebot-Extended ضوابط لاستخدام المنتج، وليست حظرًا لزحف مستقل. لا تزيل نطاقاتهما المنشورة الصفحات من فهرس البحث المقابل، كما أنهما ليسا قابلين للاستبدال ولا ينبغي اختصارهما معًا إلى «روبوت تدريب».
المشغّلون الرئيسيون، روبوتًا روبوتًا
تشغّل OpenAI أربعة روبوتات معلنة، لكل منها غرض مستقل: GPTBot (للتدريب — “used to make our generative AI foundation models more useful and safe” (ترجمة) «يُستخدم لجعل نماذج الذكاء الاصطناعي التوليدية الأساسية أكثر فائدة وأمانًا»)، وOAI-SearchBot (للبحث — “used to surface websites in search results in ChatGPT’s search features” (ترجمة) «يُستخدم لإظهار المواقع في نتائج البحث ضمن ميزات بحث ChatGPT»)، وChatGPT-User (جالب للمستخدم — “used for certain user actions in ChatGPT” (ترجمة) «يُستخدم لبعض إجراءات المستخدم في ChatGPT»)، وOAI-AdsBot (نطاق إعلاني مستقل، وليس للتدريب ولا زاحف فهرس البحث). وتلخّص OpenAI السياسة التي تصلح نموذجًا للمجال كله: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (ترجمة) «إعداد كل روبوت مستقل، ما يتيح لأصحاب المواقع تحكمًا دقيقًا في تفاعل محتواهم مع أنظمة OpenAI المختلفة». ويشير منع GPTBot إلى أن “signals that future data from these materials should be excluded from model training datasets” (ترجمة) «تشير البيانات المستقبلية من هذه المواد إلى ضرورة استبعادها من مجموعات بيانات تدريب النماذج»؛ أما منع OAI-SearchBot فيعني أن موقعك “won’t appear in ChatGPT search results.” (ترجمة) «لن يظهر في نتائج بحث ChatGPT».
تشغّل Anthropic ثلاثة روبوتات: ClaudeBot (للتدريب)، وClaude-SearchBot (لفهرسة البحث)، وClaude-User (للجلب). وتقول Anthropic إن روبوتاتها “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (ترجمة) «تحترم إشارات “عدم الزحف” عبر الالتزام بالتوجيهات المعيارية في robots.txt». كما تشير صفحة الدعم الحالية إلى قائمة IP منشورة مشتركة للتحقق الخاص بـAnthropic. هذه القائمة دليل على الهوية، وليست قاعدة عامة للتحقق من كل روبوت عبر IP أو DNS العكسي.
Google — الحقيقة الأساسية هي ما سبق: Google-Extended رمز لا روبوت. وتشغّل Google أيضًا Google-CloudVertexBot (يزحف لوكلاء Vertex AI الذين يطلبهم مالك الموقع ولا يؤثر في الترتيب)، ووكلاء يطلقهم المستخدم مثل Gemini-Deep-Research وGoogle-NotebookLM.
تشغّل Apple Applebot (الزاحف الحقيقي الذي يغذي Spotlight وSiri واقتراحات Safari، وقد “may also be used to help train Apple foundation models” (ترجمة) «قد يُستخدم أيضًا للمساعدة في تدريب نماذج Apple الأساسية») ورمز Applebot-Extended. يؤدي حظر Applebot إلى إخراجك من بحث Apple، بينما يخرجك حظر Applebot-Extended من التدريب فقط.
تعلن Perplexity عن روبوتين: PerplexityBot (للبحث والاستشهادات — “not used to crawl content for AI foundation models” (ترجمة) «لا يُستخدم لزحف المحتوى لتدريب نماذج الذكاء الاصطناعي الأساسية»، ولذلك لا تملك Perplexity زاحف تدريب معلنًا) وPerplexity-User (للجلب). وتقول وثائقها إن Perplexity-User “generally ignores robots.txt rules” (ترجمة) «يتجاهل قواعد robots.txt عمومًا» لأن الجلب يبدأه المستخدم. كما أن Perplexity موضوع تقارير عن زحف متخفي — وسنعود إلى الخلاف أدناه.
تشغّل Amazon ثلاثة روبوتات، وهذه استثناءات مفيدة: Amazonbot (يحسّن المنتجات و*“may be used to train Amazon AI models”* (ترجمة) «قد يُستخدم لتدريب نماذج Amazon للذكاء الاصطناعي»)، وAmzn-SearchBot (للبحث)، وAmzn-User (لجلب Alexa). ووفق وثائق Amazon، فإن Amzn-SearchBot وAmzn-User لا يزحفان صراحةً لتدريب نماذج الذكاء الاصطناعي التوليدية — لذلك فقول «كل شركات الذكاء الاصطناعي تكشط للتدريب» خرافة. وتحترم Amazon أيضًا وسم meta باسم noarchive بمعنى خاص: «لا تستخدم الصفحة لتدريب النماذج»، وهو انسحاب نادر على مستوى الصفحة.
تضمّ معالجة Amazon لـrobots.txt حافتين تشغيليتين غير معتادتين: قد تستخدم زواحفها نسخةً مخزنة مؤقتًا من الملف خلال 30 يومًا سابقة، وتقول Amazon إن تعذر جلب الملف يجعل زواحفها تتصرف كأنه غير موجود. لكن ذلك لا يعني أن فشل جلبك التدقيقي يثبت أن Amazon رأت حالة السماح للجميع؛ فقد يصل التدقيق وAmazon إلى المضيف في أوقات مختلفة أو عبر مسارات شبكة مختلفة. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot
تشغّل Meta Meta-ExternalAgent (للتدريب والفهرسة لدى Llama وMeta AI)، وMeta-ExternalFetcher (للجلب من المستخدم)، وبصورة منفصلة Facebookbot (لمعاينات الروابط — وليس زاحف ذكاء اصطناعي). لا يؤثر حظر Meta-ExternalAgent في معاينات روابط Facebook.
تشغّل مؤسسة غير ربحية Common Crawl (CCBot) التي تحافظ على أرشيف مفتوح للويب. وهذه هي الطبقة الخفية: استُخدمت مجموعة بيانات Common Crawl لتدريب ChatGPT وClaude وLLaMA وغيرها كثيرًا، لذلك قد يؤثر حظر CCBot في نماذج لا تزحف إليك مباشرة. وتحذّر Common Crawl أيضًا من منتحلين يزوّرون هوية CCBot.
أما ByteDance (Bytespider) فهو الأكثر عدوانية: يُعلن احترام robots.txt، لكن التقارير عن مخالفته واسعة، مع أحجام طلبات مرتفعة جدًا. ومن المفيد معرفة AI2Bot (Allen Institute، والنماذج المفتوحة أو مجموعة Dolma)، وCohere، وDiffbot (استخراج البيانات المنظمة التي تغذي مخرجاته خطوط أنابيب ذكاء اصطناعي كثيرة)، وTimpibot / webzio-extended.
هل تطيع روبوتات الذكاء الاصطناعي robots.txt فعلًا؟
بالنسبة إلى زواحف التدريب والبحث، تقول الوثائق إن المشغّلين الكبار (OpenAI وAnthropic وGoogle وApple وAmazon) يحترمون robots.txt. أما المنطقة المتنازع عليها فهي الجالبون الذين يطلقهم المستخدم؛ إذ يقول مشغّلون عدة صراحةً إن robots.txt قد لا ينطبق لأن شخصًا بدأ الطلب — تقول OpenAI: “these actions are initiated by a user, robots.txt rules may not apply” (ترجمة) «هذه الإجراءات يبدأها مستخدم، وقد لا تنطبق قواعد robots.txt»؛ وتقول Perplexity إن Perplexity-User “generally ignores robots.txt rules.” (ترجمة) «يتجاهل قواعد robots.txt عمومًا». هذه سياسة معلنة، وليست إثباتًا لمخالفة.
خلاف Perplexity هو النزاع الأبرز، وسأصفه بأنه مبلّغ عنه لا محسوم. ففي يونيو 2024 أفادت Wired والمطوّر Robb Knight بأن Perplexity وصلت إلى محتوى مواقع حظرتها، على ما يبدو باستخدام عناوين IP غير معلنة. وفي أغسطس 2025 أفادت Cloudflare بأن Perplexity استخدمت user-agent متخفيًا ينتحل Chrome على macOS، وبدّلت عناوين IP وASNs لتفادي الحظر، وجلبت محتوى من نطاقات اختبار أُنشئت حديثًا تحمل Disallow: / كاملًا؛ ثم أزالت Cloudflare Perplexity من قائمة الروبوتات الموثقة. اعرض ذلك كتقارير موثقة من تلك المصادر؛ أما وثائق Perplexity نفسها فتظل تقول إن PerplexityBot يحترم robots.txt.
لأن بعض الروبوتات تتجاهل robots.txt إلى حد ما، أصبحت Cloudflare طبقة الإنفاذ العملية — حظر على مستوى الشبكة، ومفتاح «AI Scrapers and Crawlers» بنقرة واحدة، وملف robots.txt مُدار، وتتبع مخالفات robots.txt، وتجربة دفع مقابل الزحف. ومنذ يوليو 2025 تحظر نطاقات Cloudflare الجديدة زواحف الذكاء الاصطناعي المعروفة افتراضيًا.
كيف تتحكم في زواحف الذكاء الاصطناعي
- ملف robots.txt لكل user-agent هو أداة التحكم الأساسية، وهو دقيق: حظر
GPTBotلا يحظرOAI-SearchBotأوChatGPT-User. توجد وصفات robots.txt (حظر كل روبوتات التدريب أو حظر روبوتات البحث بالذكاء الاصطناعي) في علامة تبويب Scripts. - رموز التدريب —
Google-ExtendedوApplebot-Extended— تخرجك من تدريب Gemini وApple Intelligence بلا كلفة على البحث. - وسم meta باسم
noarchiveلدى Amazon انسحاب من التدريب على مستوى الصفحة. - Cloudflare AI Crawl Control — حظر أو سماح أو فرض رسوم على مستوى الشبكة، مع robots.txt مُدار وتوجيهات Content Signals (
searchوai-inputوai-train)؛ والقيمة الافتراضية هيsearch=yes, ai-train=no. - llms.txt اقتراح (Jeremy Howard / Answer.AI، سبتمبر 2024)، وليس معيارًا معتمدًا ولا تلتزم به الزواحف الكبرى. إنه خريطة Markdown منتقاة يُفترض قراءتها وقت الاستدلال، لكن دراسة Ahrefs لـ137 ألف موقع وجدت أن 97% من ملفات llms.txt المنشورة تلقت صفر طلبات، ولم يعتمدها مزوّد رئيسي لنماذج اللغة رسميًا. عامله كأداة توثيق لا كأداة لظهور البحث بالذكاء الاصطناعي.
- يحافظ مشروع المجتمع ai.robots.txt على ملف شامل
Disallow: /يسرد أكثر من 150 user-agent لروبوتات الذكاء الاصطناعي — وهو مرجع مفيد للحظر الشامل.
سياسة زحف تضع الظهور أولًا
بالنسبة إلى موقع تعليمي أو تجاري عام يريد الظهور في البحث بالذكاء الاصطناعي، هذه سياستي الافتراضية:
- اسمح بزواحف البحث التقليدية التي تغذي أسطح البحث التي تريدها، ومنها Googlebot وBingbot.
- اسمح بزواحف البحث والفهرسة بالذكاء الاصطناعي الموثقة مثل
OAI-SearchBotوClaude-SearchBotوPerplexityBotعلى المحتوى العام. - اسمح بالجالبين المقصودين الذين يطلقهم المستخدم مثل
ChatGPT-UserوClaude-UserوPerplexity-User، مع إدراك اختلاف سلوك المزودين تجاه robots. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers - اتخذ قرارًا منفصلًا بشأن حقوق التدريب وتطوير النماذج. لا يلزم أن تشترك
GPTBotوClaudeBotوGoogle-Extendedوضوابط التدريب الأخرى في سياسة البحث. اسمح بها فقط إذا وافق ذلك سياسة النشر لديك. - احمِ المسارات الخاصة والتشغيلية بالمصادقة. أبقِ
/admin/والمعاينات وبيانات الحساب وواجهات API غير العامة خلف تفويض من الخادم؛ فـDisallowمجرد تفضيل للزاحف. - تحقق من الهوية قبل تجاوز ضوابط WAF. اجمع بين user-agent الموثق ونطاقات IP الحالية للمزود والتحقق من DNS العكسي أو مصادقة الروبوت المدعومة. لا تنشئ قاعدة سماح واسعة في WAF اعتمادًا على user-agent قابل للانتحال وحده.
لا تضف مجموعة user-agent محددة لمجرد كتابة Allow: / ما لم تكرر كل قيد يجب أن يظل منطبقًا على ذلك الزاحف. وفق قواعد مطابقة robots، قد تتغلب المجموعة المحددة على مجموعة البدل بدل أن ترث استثناءات المسارات الخاصة منها في تحليل بعض المزودين. وغالبًا ما يكون الملف الآمن الأبسط مجموعة بدل آمنة مستقلّة، مع انسحابات تدريب محددة بدقة.
أما سياسة هذا الموقع حاليًا فهي سماح صريح بالبحث وإدخال الذكاء الاصطناعي والتدريب، مع استبعاد مسارات الإدارة والمعاينة وواجهات API والفخاخ والبوابات. سأبقي البحث والجلب الذي يوجهه المستخدم مسموحين. وأغيّر ai-train=yes بقرار حقوق تحريري فقط، لا كتكتيك لزيادة الظهور بالذكاء الاصطناعي، لأن الوصول للتدريب لا يملك فائدة مثبتة للاستشهاد.
وصول الزاحف ليس جاهزية للذكاء الاصطناعي
تثبت قاعدة السماح، في أقصى حد، أن سياسة robots المعلنة تسمح لوكيل مسمّى بطلب عنوان URL. ولا تثبت أن المشغّل التزم بالسياسة أو جلب الصفحة أو صَيّرها أو استخرج المعلومات المهمة أو وضعها في سياق النموذج أو استشهد بها أو أكمل إجراءً.
أبقِ الطبقات الخمس منفصلة:
| الطبقة | السؤال | الدليل |
|---|---|---|
| الإذن | هل يجوز للوكيل المسمّى طلب عنوان URL وفق السياسة المعلنة؟ | اختبار robots الفعّال والوصول إلى الشبكة |
| قابلية الاستخراج | هل يوجد المحتوى المهم في نص ثابت أو روابط أو بيانات وصفية أو بيانات منظمة؟ | التقاط خام ومصيّر مع استخراج الحقول |
| العرض | هل يظل المحتوى موجودًا مع قدرة الوكيل الفعلية على المتصفح وJavaScript؟ | دليل جلب خاص بالمزود عند توفره؛ وإلا قيد اختبار معلن |
| قابلية التشغيل | هل يستطيع الوكيل تحديد الإجراء المقصود واستدعاءه بأمان؟ | عقد موثق للأداة أو الواجهة واختبار مضبوط من البداية إلى النهاية |
| الجاهزية التجارية | هل تتطابق الهوية والسعر والتوفر والسياسة والتنفيذ والسلة والدفع؟ | مطابقة الخلاصة والصفحة والواجهة الخلفية والطلب |
لذلك ينبغي أن يعرض مدقق وصول الزاحف مسموحًا أو محظورًا أو غير محدد للسياسة، لا «جاهزًا للذكاء الاصطناعي». يثبت طلب سجل ناجح أن الطلب حدث، لكنه ليس دليلًا على استخدام الصفحة في إجابة. كما أن إعلان خلاصة أو أداة صالح لا يثبت أن الصفحة العامة تُصيّر بصورة صحيحة أو أن الدفع يستطيع تنفيذ العرض الموصوف.
استخدم كيف يعمل بحث الذكاء الاصطناعي لطبقتي الاسترجاع والاستشهاد، وتحسين التسوق بالذكاء الاصطناعي لجاهزية الكتالوج والمعاملة. وفصل الطبقات يجعل العلاج محددًا: أصلح سياسة الوصول عند الحظر، ومخرج الصفحة عند فشل الاستخراج، والعرض عند غياب حالة، وعقد الواجهة عند تعذر التشغيل، وبيانات التجارة عند فشل الشراء.
في صفحات التجارة الإلكترونية، ينبغي لاختبار قابلية الاستخراج أن يتحقق من وجود هوية المنتج الأساسية والعرض المختار — SKU ومعرّف المجموعة والسعر والعملة والتوفر — في الاستجابة الأولية، وأن تظل متطابقة بعد العرض. ويحدد معيار صفحة المنتج الخام مقابل المصيّرة ما يجب أن يظهر على الخادم؛ أما إذن الزحف وحده فلا يقول شيئًا عن هذا العقد.
الخرافة التي تكلفك الزيارات: التدريب لا يساوي البحث بالذكاء الاصطناعي
هذه هي النقطة التي يجب إصابتها: حظر روبوتات التدريب ليس حظرًا لروبوتات البحث بالذكاء الاصطناعي. إنهما قاعدتا robots.txt منفصلتان ونتيجتاهما متعاكستان:
- حظر روبوتات التدريب (GPTBot وClaudeBot وCCBot وBytespider، إضافة إلى رمزي Google-Extended وApplebot-Extended) → لا أثر في ترتيب Google، وفق Google وبيانات الناشرين التجريبية. أنت تنسحب من تدريب النماذج فحسب.
- حظر روبوتات البحث بالذكاء الاصطناعي (OAI-SearchBot وPerplexityBot) → تخسر الظهور في إجابات ChatGPT وPerplexity. إنها مقايضة حقيقية وليست فائدة مجانية.
إذا حظرت على نطاق واسع — كقاعدة شاملة تلتقط OAI-SearchBot بينما قصدك إيقاف التدريب فقط — فقد تخرج نفسك بهدوء من البحث بالذكاء الاصطناعي. كن دقيقًا في الفئة التي تصيبها كل قاعدة.
لماذا يحظر الناشرون أصلًا: العقد الاجتماعي
يرجع هذا الجدل كله إلى الزيارات. وكما كتبت في تحليلي لروبوتات الذكاء الاصطناعي، “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (ترجمة) «لزحف الروبوتات إلى مواقعك كلفة، وهناك عقد اجتماعي بين محركات البحث ومالكي المواقع، إذ تضيف محركات البحث قيمة بإرسال زيارات إحالة إلى المواقع. ترسل Google الزيارات (في الوقت الحالي)، لذلك لا تُحظر». أما زواحف الذكاء الاصطناعي فلا تعيد الزيارات غالبًا حتى الآن، وتؤيد البيانات هذا القلق. وفي تحليلي لـCloudflare Radar أصبحت روبوتات الذكاء الاصطناعي بالفعل الزاحف الثاني بوضوح بعد محركات البحث، وعلى مسار تجاوزها. راجع مزيدًا من التفاصيل في علامة تبويب Stats.
إفصاح: كنت موظفًا سابقًا لدى Ahrefs وأحصل على وصول مجاني إليها. تحليل الزحف المرتبط هو عملي المنشور من تلك الفترة؛ ولا تراجع Ahrefs الاستنتاجات التحريرية الحالية لهذا الموقع ولا توافق عليها.للاطلاع على خط الأنابيب الأوسع الذي تندرج فيه هذه المسألة — الاكتشاف وجدولة الزحف والعرض والفرق بين الزحف والفهرسة — راجع محور الزحف والموضوعات الشقيقة عن الزاحف عمومًا وuser-agent وGooglebot وBingbot وrobots.txt.
ملخص زواحف الذكاء الاصطناعي
خلاصة مركزة لنسخة Advanced:
- زواحف الذكاء الاصطناعي ثلاث فئات لا فئة واحدة — والخلط بينها هو الخطأ الأساسي.
- التدريب: GPTBot وClaudeBot وCCBot وBytespider وAmazonbot وMeta-ExternalAgent وAI2Bot وCohere وDiffbot — تكشط لبناء مجموعات بيانات للنماذج.
- البحث والفهرسة بالذكاء الاصطناعي: OAI-SearchBot وPerplexityBot وApplebot وAmzn-SearchBot — تبني فهرسًا للاستشهاد.
- الجالبون الذين يطلقهم المستخدم: ChatGPT-User وPerplexity-User وClaude-User — يجلبون صفحة مباشرة عندما يطرح شخص سؤالًا.
- لكل روبوت user-agent وقاعدة robots.txt خاصة به. حظر GPTBot لا يحظر OAI-SearchBot أو ChatGPT-User.
- Google-Extended وApplebot-Extended رمزان لا روبوتان — لا يزحفان؛ بل يخرجانك من التدريب أو التأسيس، وحظرهما لا يكلّفك ظهورًا في البحث.
- حظر روبوتات التدريب لا يساوي الإضرار بـSEO. تقول Google إن Google-Extended “does not impact a site’s inclusion in Google Search” (ترجمة) «لا يؤثر في إدراج الموقع في Google Search»، وتؤيد بيانات الناشرين ذلك.
- حظر روبوتات البحث بالذكاء الاصطناعي يقلل ظهورك فعلًا في إجابات ChatGPT وPerplexity، وهذه مقايضة حقيقية.
- Amzn-SearchBot وAmzn-User لا يتدربان على المحتوى الذي جلباه، وفق Amazon؛ وقول «كل روبوتات الذكاء الاصطناعي تتدرب» خرافة.
- جدل robots.txt: يستثني الجالبون الذين يطلقهم المستخدم أنفسهم («قد لا تنطبق» القواعد)، وتوجد تقارير عن زحف Perplexity متخفيًا (Wired/Robb Knight 2024 وCloudflare 2025)؛ اعرضه كتقرير لا كحقيقة محسومة.
- llms.txt اقتراح غير معتمد — 97% من الملفات لم تتلقَّ قراءة، ولا يدعمه مزود LLM رئيسي؛ أما Cloudflare فهي طبقة الإنفاذ العملية.
التوثيق الرسمي
توثيق المصادر الأولية من مشغّلي الذكاء الاصطناعي والاقتراحات ذات الصلة.
OpenAI
- روبوتات / زواحف OpenAI — GPTBot وOAI-SearchBot وChatGPT-User وOAI-AdsBot، وسياسة «إعداد كل روبوت مستقل».
Anthropic
- هل تجمع Anthropic بيانات من الويب؟ — ClaudeBot وClaude-SearchBot وClaude-User وضوابط robots والتحقق الحالي من قائمة IP.
- قائمة عناوين IP لزواحف Anthropic — بيانات تحقق خاصة بالمزود.
- الزواحف الشائعة لدى Google (ومنها Google-Extended) — رموز المنتجات وuser-agents.
- ميزات الذكاء الاصطناعي وموقعك — Googlebot، لا Google-Extended، هو الذي يتحكم في الإدراج في AI Overviews وAI Mode.
Apple
- حول Applebot — الفرق بين Applebot وApplebot-Extended، وعبارة «Applebot-Extended لا يزحف إلى صفحات الويب».
Amazon
- Amazonbot — Amazonbot وAmzn-SearchBot وAmzn-User و
noarchiveللانسحاب من التدريب، وأي الروبوتات لا تتدرب.
Perplexity
- زواحف Perplexity — PerplexityBot وPerplexity-User، بما في ذلك عبارة «يتجاهل قواعد robots.txt عمومًا».
Common Crawl
- CCBot — الزاحف غير الربحي الذي يقف خلف قدر كبير من بيانات تدريب LLM، مع تحذير انتحال الهوية.
معهد Allen للذكاء الاصطناعي
- إشعار زاحف AI2 — AI2Bot وكيفية تصفيته.
Cloudflare (ضوابط زواحف الذكاء الاصطناعي)
- AI Crawl Control — الحظر والسماح وفرض الرسوم والمراقبة وتتبع مخالفات robots.txt.
- robots.txt مُدار — توجيهات زواحف الذكاء الاصطناعي التي تُحدَّث تلقائيًا.
- التحكم في استخدام المحتوى لتدريب الذكاء الاصطناعي — robots.txt مُدار وContent Signals والدفع مقابل الزحف.
الاقتراحات
- مواصفة llms.txt — اقتراح خريطة وقت الاستدلال، وليس معيارًا معتمدًا.
- مشروع ai.robots.txt — قائمة مجتمعية لصيغ user-agent لروبوتات الذكاء الاصطناعي.
اقتباسات من المصدر
تصريحات مسجلة على لسان المشغّلين ومؤلفي الاقتراحات. كل رابط يقود مباشرة إلى المقطع المقتبس حيث تم التحقق منه.
OpenAI — روبوتات مستقلة وأغراض مستقلة
- “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (ترجمة) «إعداد كل روبوت مستقل، ما يتيح لمديري المواقع تحكماً دقيقاً في تفاعل محتواهم مع أنظمة OpenAI المختلفة.» — توضح وثائق OpenAI فصل الإعدادات. اقتباس
- GPTBot is “used to make our generative AI foundation models more useful and safe.” (ترجمة) «يُستخدم لجعل نماذج الذكاء الاصطناعي التأسيسية أكثر فائدة وأماناً.» OAI-SearchBot is “used to surface websites in search results in ChatGPT’s search features.” (ترجمة) «يُستخدم لإظهار المواقع في نتائج البحث ضمن ميزات بحث ChatGPT.» ChatGPT-User: “these actions are initiated by a user, robots.txt rules may not apply.” (ترجمة) «هذه الإجراءات يطلقها المستخدم، وقد لا تنطبق قواعد robots.txt.» اقتباس
Anthropic — ضوابط robots ونطاق التحقق
- توثّق Anthropic ClaudeBot وClaude-SearchBot وClaude-User وضوابط robots الخاصة بها وطريقة التحقق من قائمة IP المشتركة. المصدر
Google — الرمز لا الروبوت
- “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (ترجمة) «لا يؤثر Google-Extended في إدراج الموقع في Google Search ولا يُستخدم إشارةً للترتيب فيه.» اقتباس
Apple — Applebot-Extended لا يزحف
- “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (ترجمة) «لا يزحف Applebot-Extended إلى صفحات الويب، ويمكن أن تظل الصفحات التي تمنعه مدرجةً في نتائج البحث.» اقتباس
Perplexity — استثناء جالب المستخدم
- PerplexityBot is “designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” (ترجمة) «صُمم لإظهار المواقع وربطها في نتائج بحث Perplexity، ولا يُستخدم لزحف المحتوى من أجل نماذج الذكاء الاصطناعي التأسيسية.» Perplexity-User: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” (ترجمة) «بما أن المستخدم طلب الجلب، يتجاهل هذا الجالب قواعد robots.txt عموماً.» اقتباس
Common Crawl — طبقة التدريب الخفية
- CCBot exists for “democratizing access to web information by producing and maintaining an open repository of web crawl data.” (ترجمة) «يوجد CCBot لإتاحة الوصول الديمقراطي إلى معلومات الويب عبر إنتاج مستودع مفتوح لبيانات الزحف وصيانته.» وتقر الجهة بأن «we are aware of crawlers falsely identifying themselves as CCBot.” (ترجمة) «نحن على علم بزواحف تنتحل هوية CCBot.» اقتباس
llms.txt — اقتراح بحسب وصفه هو نفسه
- “A proposal to standardise on using an
/llms.txtfile to provide information to help LLMs use a website at inference time.” (ترجمة) «اقتراح لتوحيد استخدام ملف /llms.txt لتقديم معلومات تساعد نماذج اللغة الكبيرة على استخدام الموقع وقت الاستدلال.» اقتباس
أنا — العقد الاجتماعي
- “There’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (ترجمة) «لزحف الروبوتات إلى مواقعك كلفة، وينشأ عقد اجتماعي حين تضيف محركات البحث قيمة بإرسال زيارات إحالة إلى المواقع. ترسل Google الزيارات (حاليًا)، ولذلك يتجنب أصحاب المواقع حظرها». — Patrick Stox، Ahrefs. اقرأ المقال
جدول زواحف الذكاء الاصطناعي الرئيسي
المحور. كل روبوت رئيسي، ورمز user-agent الخاص به، والمشغّل، والفئة، وامتثاله المعلن لـrobots.txt. انسخ الرموز حرفيًا — فالتهجئة وحالة الأحرف مهمتان في robots.txt.
| الروبوت | رمز UA | المشغّل | الفئة | هل يطيع robots.txt؟ |
|---|---|---|---|---|
| GPTBot | GPTBot | OpenAI | تدريب | نعم (معلن) |
| OAI-SearchBot | OAI-SearchBot | OpenAI | بحث بالذكاء الاصطناعي | نعم (معلن) |
| ChatGPT-User | ChatGPT-User | OpenAI | جلب المستخدم | ”May not apply” (ترجمة) «قد لا تنطبق» (بدأه المستخدم) |
| OAI-AdsBot | OAI-AdsBot | OpenAI | إعلانات (ليس للتدريب) | نعم (معلن) |
| ClaudeBot | ClaudeBot | Anthropic | تدريب | نعم (معلن) |
| Claude-SearchBot | Claude-SearchBot | Anthropic | بحث بالذكاء الاصطناعي | نعم للفهرسة |
| Claude-User | Claude-User | Anthropic | جلب المستخدم | نعم (تقول Anthropic إن كل روبوتاتها تحترم robots.txt) |
| Google-Extended | Google-Extended (رمز فقط — بلا UA مستقل) | تحكم التدريب/التأسيس | نعم (رمز انسحاب) | |
| Google-CloudVertexBot | Google-CloudVertexBot | Vertex AI بطلب المالك | نعم | |
| PerplexityBot | PerplexityBot | Perplexity | بحث بالذكاء الاصطناعي | نعم للفهرسة (لكن انظر الخلاف) |
| Perplexity-User | Perplexity-User | Perplexity | جلب المستخدم | ”Generally ignores” (ترجمة) «يتجاهل عمومًا» (معلن) |
| Applebot | Applebot | Apple | بحث بالذكاء الاصطناعي (+ تدريب) | نعم |
| Applebot-Extended | Applebot-Extended (رمز فقط — لا يزحف) | Apple | تحكم التدريب | نعم (رمز انسحاب) |
| Amazonbot | Amazonbot | Amazon | تدريب | نعم (معلن) |
| Amzn-SearchBot | Amzn-SearchBot | Amazon | بحث بالذكاء الاصطناعي (بلا تدريب) | نعم (معلن) |
| Amzn-User | Amzn-User | Amazon | جلب المستخدم (Alexa؛ بلا تدريب) | نعم (معلن) |
| Meta-ExternalAgent | meta-externalagent | Meta | تدريب/فهرسة | نعم (معلن) |
| Meta-ExternalFetcher | meta-externalfetcher | Meta | جلب المستخدم | مذكور |
| CCBot | CCBot | Common Crawl | تدريب (بيانات مفتوحة) | نعم؛ يوجد منتحلون |
| Bytespider | Bytespider | ByteDance | تدريب | متنازع عليه — انظر الخلافات |
| AI2Bot | AI2Bot | Allen Institute | تدريب | نعم (معلن) |
| cohere-training-data-crawler | cohere-training-data-crawler | Cohere | تدريب | نعم (معلن) |
| Diffbot | Diffbot | Diffbot | تدريب/استخراج | نعم افتراضيًا |
| Timpibot | Timpibot | Timpi | تدريب | نعم (معلن) |
| webzio-extended | webzio-extended | Webz.io | تدريب | مذكور |
القواعد الثلاث الناتجة عن الجدول
- حظر روبوت تدريب (GPTBot وClaudeBot وCCBot…) → لا أثر في الترتيب.
- حظر روبوت بحث بالذكاء الاصطناعي (OAI-SearchBot وPerplexityBot) → تخسر الظهور في إجابات الذكاء الاصطناعي.
- Google-Extended وApplebot-Extended رمزان لا زاحفان — انسحاب محض من التدريب بلا كلفة بحث.
حقائق سريعة
- GPTBot ≠ OAI-SearchBot ≠ ChatGPT-User — ثلاث قواعد OpenAI مستقلة.
- لا يتدرب Amazon’s
Amzn-SearchBotوAmzn-Userعلى المحتوى الذي جلباه. - تحترم Amazon وسم meta باسم
noarchiveكإشارة «لا تدريب» على مستوى الصفحة. - llms.txt اقتراح لا معيار معتمد؛ والزواحف الكبرى لا تلتزم به.
- احظر بحسب user-agent في robots.txt لا بحسب IP (فحظر IP قد يمنع الروبوت حتى من قراءة robots.txt).
كيف تدقق وتقرر ما الذي تسمح به
مرور عملي لتقرير أي زواحف الذكاء الاصطناعي تسمح بها أو تحظرها أو تراقبها فقط.
- استخرج سجلات الخادم وسجّل أي user-agents للذكاء الاصطناعي تضرب موقعك (GPTBot وClaudeBot وCCBot وBytespider وOAI-SearchBot وPerplexityBot وApplebot وغيرها) وعدد مرات ذلك. السجلات هي الحقيقة التشغيلية.
- رتّب كل واحد في فئته — تدريب أو بحث بالذكاء الاصطناعي أو جلب مستخدم. القرار يتبع الفئة لا العلامة التجارية.
- حدد موقفك من التدريب. إن كنت تقبل التدريب على محتواك، اسمح بزواحف التدريب. وإن لم تقبل، فاحظر GPTBot وClaudeBot وCCBot وBytespider وAmazonbot وMeta-ExternalAgent، وأضف الرمزين
Google-ExtendedوApplebot-Extended. لا يؤثر ذلك في ترتيب Google. - حدد موقفك من بحث الذكاء الاصطناعي بحذر. إن أردت الظهور في إجابات ChatGPT وPerplexity، أبقِ OAI-SearchBot وPerplexityBot مسموحين. احظرهما فقط إذا أردت الخروج من بحث الذكاء الاصطناعي فعلًا.
- لا تصب الروبوت الخطأ. تأكد من أن قاعدة «حظر التدريب» لا تلتقط روبوت بحث بالذكاء الاصطناعي أيضًا. GPTBot ≠ OAI-SearchBot.
- احظر بحسب user-agent لا IP — فقد يمنع حظر IP الروبوت من قراءة robots.txt (تحذير Anthropic الصريح).
- تحقق من الروبوتات المشبوهة. قد ينتحل أحدهم CCBot وغيره؛ افحص نطاقات IP المنشورة أو DNS العكسي قبل الوثوق بسلسلة user-agent.
- فكر في الإنفاذ على مستوى الشبكة (Cloudflare AI Crawl Control) للروبوتات التي لا تطيع robots.txt بثبات.
- تجاوز llms.txt كتكتيك SEO — فهو اقتراح غير مقروء غالبًا ولا تحترمه الزواحف الكبرى؛ لا تتوقع منه ظهورًا في بحث الذكاء الاصطناعي.
- أعد التحقق ربع سنويًا. تظهر روبوتات جديدة باستمرار (وقائمة ai.robots.txt مرجع جيد) ويتغير سلوك المشغّلين.
الخطأ الذي يكلّفك زيارات بحث الذكاء الاصطناعي
الخلط بين روبوتات التدريب وروبوتات بحث الذكاء الاصطناعي هو أغلى خطأ في هذا المجال، وهو الخرافة التي نبهت إليها أعلاه. قاعدة تهدف إلى إيقاف تدريب النماذج وقاعدة تهدف إلى إيقاف الاستشهاد في بحث الذكاء الاصطناعي ليستا القاعدة نفسها؛ الخلط بينهما يقلب النتيجة.
- الخطأ: حظر «روبوتات الذكاء الاصطناعي» ككتلة واحدة (قاعدة
Disallowواحدة تصيب GPTBot وOAI-SearchBot معًا). لماذا هو خطأ: يخرجك بصمت من إجابات ChatGPT وPerplexity بينما تظن أنك تنسحب من التدريب فقط. افعل بدلًا منه: اكتب قواعد مسماة منفصلة لكل روبوت — احظر GPTBot وClaudeBot وCCBot وBytespider للتدريب، واترك OAI-SearchBot وPerplexityBot مسموحين ما لم ترد الخروج من بحث الذكاء الاصطناعي عمدًا.
لا تخلط التحقق من الهوية بسياسة الوصول
يمكن لقائمة IP التي ينشرها المزود أن تساعدك في التحقق من مرسل الطلب، لكنها لا تحدد سياستك ولا تحول الحظر الشبكي إلى قاعدة robots.
- الخطأ: اعتبار نطاق تم التحقق منه قرار سماح أو حظر تلقائيًا.
لماذا هو خطأ: الهوية وتفضيل الزحف المعلن والوصول الشبكي المفروض حقائق منفصلة.
افعل بدلًا منه: عبّر عن سياسة الزحف برمز
User-agentالموثق، وأضف إنفاذًا شبكيًا (Cloudflare AI Crawl Control) للروبوتات التي لا تحترم الملف بثبات.
لا تتعامل مع llms.txt كرافعة لبحث الذكاء الاصطناعي
يُسوَّق llms.txt باستمرار على أنه «robots.txt لبحث الذكاء الاصطناعي»، لكن مصادر المقال نفسها تثبت خطأ هذا التأطير.
- الخطأ: نشر ملف
llms.txtتوقعًا لرفع الظهور أو الاستشهاد في بحث الذكاء الاصطناعي. لماذا هو خطأ: إنه اقتراح لا معيار معتمد؛ وجدت دراسة Ahrefs على 137 ألف موقع أن 97% من الملفات المنشورة تلقت صفر طلبات، ولم يعتمد أي مزود LLM رئيسي الملف رسميًا. افعل بدلًا منه: تعامل مع llms.txt كأداة توثيق في أحسن الأحوال، ووجّه الجهد إلى قواعدrobots.txtوزواحف بحث الذكاء الاصطناعي التي تتحكم فعلًا في الظهور.
لا تثق بسلسلة user-agent من دون التحقق منها
ينتحل الآخرون CCBot خصوصًا، باعتراف Common Crawl نفسها، وتفيد تقارير واسعة بأن Bytespider يتجاهل القواعد التي يزعم احترامها.
- الخطأ: افتراض أن سلسلة
User-agentفي سجلاتك هي صاحبها فعلًا. لماذا هو خطأ: قد يضربك روبوت منتحل أو غير ممتثل بكامل الحجم بينما تبقى قاعدةrobots.txtغير مفروضة. افعل بدلًا منه: طابق الطلبات عالية الحجم أو المشبوهة مع نطاقات IP المنشورة للمشغّل أو DNS العكسي قبل الوثوق بالسلسلة — فعلامة Tools تحوي أداة لهذا الفحص تحديدًا.
القرار: السماح أو الحظر أو المراقبة
1. صنّف أولًا — فالتصنيف يقرر كل شيء. التدريب مقابل بحث الذكاء الاصطناعي مقابل جلب المستخدم. إذا أصبت الفئة ظهر الأثر: حظر التدريب آمن على SEO، وحظر بحث الذكاء الاصطناعي يكلّفك الظهور، والجلب الذي يطلقه المستخدم محل خلاف.
2. قاعدة السماح / الحظر / المراقبة.
- اسمح بروبوتات بحث الذكاء الاصطناعي (OAI-SearchBot وPerplexityBot وApplebot) إن أردت إحالات من إجابات الذكاء الاصطناعي — ينبغي لمعظم المواقع ذلك.
- احظر روبوتات التدريب (GPTBot وClaudeBot وCCBot وBytespider) إن لم ترد التدريب على محتواك — بلا كلفة ترتيب. أضف رمزي Google-Extended وApplebot-Extended لتدريب Gemini وApple.
- راقب الجالبين الذين يطلقهم المستخدم والممثلين السيئين المعروفين (Bytespider وحركة Perplexity غير المعلنة). قد لا يوقفهم robots.txt؛ السجلات والقواعد الشبكية هي ما يريكهم ويحكمهم فعليًا.
3. فحص «رمز لا روبوت». قبل تفسير حركة الزحف، اسأل: هل هذا زاحف فعلي أم رمز تحكم؟ لا يولّد Google-Extended وApplebot-Extended حركة على الإطلاق، بل يبدلان إذنًا في حركة حدثت بالفعل.
4. التدريب ≠ بحث الذكاء الاصطناعي (الخطأ المكلف). قاعدتان منفصلتان في robots.txt ونتيجتان متعاكستان. لا تحظر «روبوتات الذكاء الاصطناعي» كتلة واحدة — وإلا أخفقت في إيقاف التدريب أو حذفت نفسك عرضًا من إجابات الذكاء الاصطناعي.
5. robots.txt طلب؛ والإنفاذ منفصل. يعمل البروتوكول مع الروبوتات الممتثلة. أما الجالبون الذين يستثنون أنفسهم (جالبو المستخدم) أو الذين تفيد التقارير بتجاهلهم الملف (زحف Perplexity المتخفي وBytespider)، فالحماية الحقيقية شبكية عبر Cloudflare — لا يكفي robots.txt وحده.
هل أحظر روبوت الذكاء الاصطناعي هذا؟
تسير شجرة القرار هذه مع قاعدة السماح/الحظر/المراقبة في علامة Frameworks خطوةً خطوة. ابدأ بتحديد الفئة التي ينتمي إليها الروبوت، ثم أجب عن السؤال الوحيد الذي يحدد مصيره.
Should I block this AI bot?
تدقيق robots.txt لروبوتات الذكاء الاصطناعي كل ربع سنة
يحافظ الفحص الدوري على مطابقة قواعد robots.txt للواقع مع ظهور روبوتات جديدة وتغير سلوك المشغّلين — وتضع علامة Checklists أصلًا «أعد التحقق ربع سنويًا»، وهذه نسخته خطوة بخطوة.
- استخرج زيارات روبوتات الذكاء الاصطناعي في الربع. مرر سجلات الخادم عبر محلل ملفات السجل أو ابحث عن قائمة user-agent المعروفة (تحوي علامة Scripts الأمر الدقيق) لتعرف أي الروبوتات زارتك وكم مرة.
- أعد التحقق من فئة كل روبوت. طابق كل user-agent مع الجدول الرئيسي في علامة Cheat Sheets لتؤكد أنه ما زال تدريبًا أو بحثًا بالذكاء الاصطناعي أو جلب مستخدم، وعلّم أي روبوت جديد مجهول مقابل قائمة مشروع ai.robots.txt.
- اختبر قواعدك الحالية. شغّل
robots.txtالحي عبر اختبار robots.txt لكل user-agent لتتأكد من أن قواعد حظر التدريب لا تصيب روبوت بحث بالذكاء الاصطناعي بالخطأ. - تحقق من الطلبات المشبوهة أو عالية الحجم. طابق CCBot أو Bytespider مع نطاقات IP المنشورة للمشغّل أو DNS العكسي باستخدام مدقق Googlebot قبل الوثوق بسلسلة user-agent — فالانتحال يحدث.
- سجّل حصة زحف روبوتات الذكاء الاصطناعي في الربع. دوّن تقسيم حركة التدريب والبحث بالذكاء الاصطناعي وجلب المستخدم (انظر علامة How to Measure) لتكون للفحص التالي سابقة اتجاهية لا لقطة منفردة.
تأكد أن تعديل robots.txt فعل ما قصدته
بعد تعديل robots.txt لحظر روبوتات التدريب، نفّذ هذه الفحوص قبل اعتبار العمل منتهيًا — الهدف إثبات أن روبوتات بحث الذكاء الاصطناعي ما زالت تصل إلى صفحاتك وأن روبوتات التدريب محظورة فعلًا.
الاختبار 1: ما زالت روبوتات بحث الذكاء الاصطناعي مسموحة
- الاختبار: افحص العنوان مع user-agents
OAI-SearchBotوPerplexityBotعبر اختبار robots.txt، أو أكد الزيارات الحقيقية عبر مدقق Googlebot. - النتيجة المتوقعة: “Allowed” (ترجمة) «مسموح» لكليهما في كل صفحة تريد الاستشهاد بها في إجابات الذكاء الاصطناعي.
- تفسير الفشل: نتيجة “Disallowed” (ترجمة) «محظور» تعني أن قاعدة حظر التدريب واسعة أكثر من اللازم وأصابت user-agent الخطأ.
- نافذة المراقبة: فورية للاختبار؛ وانتظر بضعة أيام لتحديث النسخة المخزنة من robots.txt لدى الروبوت.
- مُشغّل التراجع: يظهر روبوت بحث بالذكاء الاصطناعي تريد السماح به على أنه محظور، أو تهبط الاستشهادات/الإحالات من ذلك المحرك بعد التغيير.
الاختبار 2: روبوتات التدريب محظورة فعلًا
- الاختبار: افحص العنوان نفسه مع
GPTBotوClaudeBotوCCBotوBytespiderعبر اختبار robots.txt. - النتيجة المتوقعة: “Disallowed” (ترجمة) «محظور» لكل واحد.
- تفسير الفشل: نتيجة “Allowed” (ترجمة) «مسموح» تعني عادةً خطأً في الرمز — فالتهجئة وحالة الأحرف مهمتان في robots.txt.
- نافذة المراقبة: فورية.
- مُشغّل التراجع: لا يلزم مُشغّل — لا تحتاج كتلة تدريب إلى مسار تراجع إلا إذا قررت أنك تقبل التدريب بعد كل شيء.
الاختبار 3: لم تتأثر تصنيفات Google
- خطوة الاختبار: افحص أداء Search Console وتغطية الفهرسة لعناوين URL المتأثرة بعد حظر روبوتات التدريب أو رمز
Google-Extended. - النتيجة المتوقعة: لا يتغير الظهور أو الترتيب جوهرياً؛ تذكر Google أن
Google-Extended“does not impact a site’s inclusion in Google Search.” (ترجمة) «لا يؤثر Google-Extended في إدراج الموقع في Google Search.» - تفسير الفشل: قد يعني انخفاض الظهور الواسع المتزامن مع التغيير أن قاعدة شاملة حظرت Googlebot نفسه.
- نافذة المراقبة: من أسبوعين إلى أربعة أسابيع، وهي مدة تأخر تقارير Search Console.
- مُشغّل التراجع: أعد السياسة إذا انخفض الظهور أو الترتيب وظهر Googlebot محظوراً على URL يفترض أن يكون قابلاً للزحف.
مؤشرات الأداء الدائمة لحركة روبوتات الذكاء الاصطناعي
توضح متابعة هذه المؤشرات ربعًا بعد ربع إن كانت وضعية روبوتات الذكاء الاصطناعي تحقق قصدك فعلًا — بعيدًا عن أي تعديل منفرد في robots.txt.
| المقياس | ماذا يوضح؟ | كيف تستخرجه؟ | المعيار / النطاق الواقعي | الوتيرة |
|---|---|---|---|---|
| حصة روبوتات الذكاء الاصطناعي من إجمالي حركة الزحف، بحسب الفئة (تدريب / بحث بالذكاء الاصطناعي / جلب مستخدم) | هل تزداد الروبوتات حصةً من حمل الزحف الكلي، وأي فئة تقود ذلك | سجلات الخادم عبر محلل ملفات السجل، أو Cloudflare AI Crawl Control إن كنت على Cloudflare | لا هدف عالميًا — وضع Cloudflare Radar روبوتات الذكاء الاصطناعي عند نحو 18,9% من كل طلبات الروبوتات عالميًا (2025)، لكن مزيج موقعك هو المهم؛ أنشئ خط أساسك في الربع الأول ثم تابع الاتجاه | ربع سنوي |
| نسبة الزحف إلى الإحالة لكل روبوت بحث بالذكاء الاصطناعي | مقدار «إيجار» الزحف الذي تدفعه مقابل كل وحدة من حركة الإحالة من بحث الذكاء الاصطناعي | طابق أعداد الزحف في سجل الخادم لذلك user-agent مع زيارات الإحالة الفعلية في التحليلات | لا هدف ثابت — تذكر علامة Stats نحو 14 زحفًا من Google لكل إحالة مقابل نسب أعلى بكثير لزواحف الذكاء الاصطناعي؛ توقع نسبة أسوأ من Google وراقب الاتجاه لا الرقم المطلق | ربع سنوي |
| دقة حظر التدريب | هل تصيب قاعدة Disallow لروبوتات التدريب روبوت بحث بالذكاء الاصطناعي أو جلب مستخدم بالخطأ | دقّق robots.txt مقابل الجدول الرئيسي في علامة Cheat Sheets، ثم أكد عبر اختبار robots.txt | ينبغي أن تكون صفرًا — لا ينبغي أن يظهر أي روبوت بحث بالذكاء الاصطناعي محظورًا بقاعدة مخصصة للتدريب | عند كل تعديل في robots.txt، مع تدقيق ربع سنوي |
robots.txt — حظر الروبوتات الرئيسية
احظر زواحف التدريب وأبقِ بحث الذكاء الاصطناعي. تنسحب هكذا من تدريب النماذج مع بقائك ظاهرًا في إجابات ChatGPT وPerplexity. انسخ الرموز حرفيًا.
# --- AI training crawlers ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
# --- Training control tokens (not crawlers) ---
# Opt out of Gemini/Vertex training; search unaffected
User-agent: Google-Extended
Disallow: /
# Opt out of Apple Intelligence training; Applebot search unaffected
User-agent: Applebot-Extended
Disallow: /احظر مفهرسات بحث الذكاء الاصطناعي (وهذا يقلل الظهور في إجابات الذكاء الاصطناعي). افعل ذلك فقط إذا أردت الخروج فعلًا من إجابات ChatGPT وPerplexity.
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /المبدأ الأساسي: حظر GPTBot لا يحظر OAI-SearchBot أو ChatGPT-User — فكل واحد قاعدة مستقلة.
رصد روبوتات الذكاء الاصطناعي في سجلات الوصول
اعرف أي user-agents للذكاء الاصطناعي تضربك وكم مرة.
macOS / Linux
# Count hits per known AI bot in an Apache/Nginx access log
grep -iE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' access.log \
| grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' \
| sort | uniq -c | sort -rnWindows (PowerShell)
# Count hits per known AI bot in an access log
$bots = 'GPTBot','OAI-SearchBot','ChatGPT-User','ClaudeBot','Claude-User','Claude-SearchBot','PerplexityBot','Perplexity-User','CCBot','Bytespider','Amazonbot','Amzn-SearchBot','meta-externalagent','Applebot','AI2Bot','Diffbot'
Select-String -Path .\access.log -Pattern ($bots -join '|') |
ForEach-Object { ($_ -split '"')[5] } |
ForEach-Object { foreach ($b in $bots) { if ($_ -match $b) { $b } } } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, Nameيمكن انتحال سلسلة user-agent (خصوصًا CCBot) — طابق الروبوتات المهمة مع نطاقات IP المنشورة للمشغّل أو عبر DNS عكسي ثم أمامي قبل اتخاذ قرار.
صنّف زيارات السجل بحسب فئة روبوت الذكاء الاصطناعي
ألصق أسطر سجل الخادم الخام أو قائمة user-agent ودع الذكاء الاصطناعي يصنّف كل واحد باستخدام الجدول الرئيسي في علامة Cheat Sheets — فهذا مفيد عندما تحدق في ملف سجل مليء بأسماء روبوتات غير مألوفة.
I have a list of user-agent strings from my server logs. Using this
classification (paste the Cheat Sheets table from this article, or the list
below), classify each user-agent as one of: Training, AI-search, User fetch,
or Control token (not a crawler). Flag any user-agent you don't recognize as
"unknown — verify."
Categories:
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent,
AI2Bot, cohere-training-data-crawler, Diffbot, Timpibot, webzio-extended
- AI-search: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot
- User fetch: ChatGPT-User, Perplexity-User, Claude-User, Claude-SearchBot,
Amzn-User, Meta-ExternalFetcher
- Control token (no crawl traffic): Google-Extended, Applebot-Extended
My user-agent list:
<paste your list here>صِغ قائمة حظر robots.txt وفق موقفك
صف موقفك من التدريب وبحث الذكاء الاصطناعي بلغة عادية ودع الذكاء الاصطناعي يصوغ قواعد robots.txt الموافقة، ثم تحقق من الناتج مقابل اختبار robots.txt قبل نشره.
Draft a robots.txt block that does the following, using exact, correctly-cased
user-agent tokens for each rule (one User-agent/Disallow pair per bot, don't
combine bots under one User-agent line):
1. Block all training bots: GPTBot, ClaudeBot, CCBot, Bytespider,
Meta-ExternalAgent, Amazonbot.
2. Also disallow the Google-Extended and Applebot-Extended control tokens
(training/grounding opt-out only — not real crawlers).
3. Leave OAI-SearchBot and PerplexityBot allowed so AI-search visibility is
unaffected.
Output only the robots.txt block, no explanation. أدوات التحقق من روبوتات الذكاء الاصطناعي والتحكم فيها
-
مدقق Googlebot — ألصق زيارات السجل وتحقق هل طلب «GPTBot» أو «ClaudeBot» جاء فعلًا من نطاق IP المنشور للمشغّل أم منتحل. هذا هو العلاج المباشر لخطأ «الثقة بسلسلة user-agent» في علامة What Not to Do.
-
اختبار robots.txt — افحص هل يُسمح بعنوان URL محدد أو يُحظر لuser-agent روبوت بعينه، لتتأكد من أن قاعدة حظر التدريب لا تصيب روبوت بحث بالذكاء الاصطناعي أيضًا.
-
مولّد robots.txt — أنشئ قواعد حظر التدريب/السماح ببحث الذكاء الاصطناعي من علامة Scripts من دون كتابة رموز user-agent يدويًا (فالخطأ الإملائي يكسر القاعدة بصمت).
-
مولّد ومدقق llms.txt — إذا أردت ملف llms.txt للتوثيق، أنشئه وتحقق منه هنا — لكن لا تتوقع منه رفع ظهور بحث الذكاء الاصطناعي (انظر علامة What Not to Do).
موارد تستحق وقتك
كتاباتي ذات الصلة
- زواحف الويب الجديدة: روبوتات الذكاء الاصطناعي تقترب من روبوتات البحث — تحليلي لـCloudflare Radar؛ روبوتات الذكاء الاصطناعي هي الزاحف الثاني بوضوح وتأطير العقد الاجتماعي.
- روبوتات الذكاء الاصطناعي التي تحظرها نحو 140 مليونًا من المواقع — بيانات معدلات الحظر في robots.txt عبر الويب المفتوح وعلاقة حجم الطلب بالمعدل.
- لدى ChatGPT 12% من حجم بحث Google، لكن Google ترسل زيارات أكثر بـ190 مرة — فجوة إحالات الذكاء الاصطناعي والبحث التي تحرك جدل الحظر.
- ما نعرفه فعلًا عن تحسين بحث LLM — سياق GEO الأوسع.
من الآخرين
- Cloudflare: Perplexity تستخدم زواحف متخفية غير معلنة — تحقيق أغسطس 2025 (نتائج مبلّغ عنها).
- Robb Knight: Perplexity تكذب بشأن user-agent — تحقيق يونيو 2024 الأصلي.
- مشروع ai.robots.txt — قائمة مجتمعية تضم أكثر من 150 user-agent لروبوتات الذكاء الاصطناعي.
- Known Agents (المعروف سابقًا باسم Dark Visitors) — دليل شامل لروبوتات الذكاء الاصطناعي.
- Cloudflare: إعلان الاستقلال عن الذكاء الاصطناعي (حظر بنقرة واحدة) — إعلان مفتاح «AI Scrapers and Crawlers» ذي النقرة الواحدة.
- Cloudflare: التحكم في استخدام المحتوى لتدريب الذكاء الاصطناعي — robots.txt مُدار وتوجيهات Content Signals وشرح تجربة الدفع مقابل الزحف.
- Heise Online: زاحف بلا حدود — Perplexity تتجاهل robots.txt — تقرير يونيو 2024 عن تحايل Perplexity على robots.txt.
- Gizmodo: Perplexity تجاهلت قواعد الإنترنت — تغطية أخرى لخلاف الامتثال لبروتوكول robots.txt.
إحصاءات تستحق الاقتباس
- روبوتات الذكاء الاصطناعي هي الزاحف الثاني بوضوح. في تحليلي لـCloudflare Radar، ما تزال روبوتات محركات البحث تزحف أكثر، لكن روبوتات الذكاء الاصطناعي تحتل المركز الثاني وتتجه إلى تجاوزها — وتمثل نحو 18,9% من كل طلبات الروبوتات. المصدر
- فجوة الإحالة التي تحرك الحظر. ترسل Google إلى المواقع زيارات أكثر بنحو 190 مرة من ChatGPT، رغم أن لدى ChatGPT حصة مهمة من حجم بحث Google — وهذا الاختلال وراء حجة «العقد الاجتماعي». المصدر
- نسب الزحف إلى الإحالة (Cloudflare، 2025). نحو 14 زحفًا من Google لكل زيارة إحالة، مقابل نسب أعلى بكثير لزواحف الذكاء الاصطناعي — في حدود آلاف زواحف OpenAI وعشرات آلاف زواحف Anthropic لكل إحالة. هذه الأرقام سبب تشكك الناشرين في المقايضة.
- اختبار واقع llms.txt. في دراسة Ahrefs على 137 ألف موقع، نشر نحو 28% ملف llms.txt، لكن 97% من هذه الملفات تلقت صفر طلبات، ولم يعتمد أي مزود LLM رئيسي الملف رسميًا. المصدر
- معدلات الحظر عبر الويب المفتوح. في دراستي لنحو 140 مليون موقع، تتجمع الروبوتات الأكثر حظرًا حول GPTBot وCCBot وClaudeBot وAmazonbot وBytespider — وتتبع معدلات الحظر حجم الطلب. المصدر
- وصول Bytespider والإنفاذ. وصل Bytespider إلى 40,40% من المواقع المحمية بـCloudflare قبل أن تبدأ Cloudflare حظره في يوليو 2024؛ وانخفضت الحركة 71,45% بعد ذلك. ووصل Meta-ExternalAgent إلى 22,16% من المواقع المحمية — ثانيًا بعد GPTBot (28,97%). المصدر
- نمو حركة روبوتات الذكاء الاصطناعي. تظهر بيانات Cloudflare Radar نموها 65% في ستة أشهر (2025)، مع زيادة طلبات GPTBot بنسبة 305% بين مايو 2024 ومايو 2025. ومنذ يوليو 2025 تحظر نطاقات Cloudflare الجديدة الزواحف المعروفة افتراضيًا، وفعّل أكثر من مليون عميل Cloudflare ميزة حظر روبوتات الذكاء الاصطناعي. المصدر
اختبر نفسك: زواحف الذكاء الاصطناعي
خمسة أسئلة سريعة عن فئات زواحف الذكاء الاصطناعي الثلاث والفخاخ المحيطة بها. اختر إجابة لكل سؤال ثم تحقق منها.
سجل التغييرات
تم التحديث في 22 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 8 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 5 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 30 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 29 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 29 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 28 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 19 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 16 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
- Advanced
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.