تحليل سجلات زاحف الذكاء الاصطناعي
كيفية سحب سجلات الخادم أو CDN وتحليل نشاط بوتات الذكاء الاصطناعي — التحقق من GPTBot وClaudeBot وPerplexityBot ضد الانتحال، واختيار أداة، وقراءة تكرار الزحف، والزحف مقابل العرض، ورموز الحالة.
اللغات
دليل واحد في هذه الصفحة
- بيانات مصدر مرتبطة`openai.com/gptbot.json`
تحليل سجلات زاحف الذكاء الاصطناعي هو كيفية فحص — باستخدام سجلات الطرف الأول الخاصة بك، وليس لوحة تحكم البائع — أي بوتات الذكاء الاصطناعي المزعومة طلبت موقعك وما أعاده الخادم. التحقق خاص بالمزود: تنشر OpenAI ملفات نطاقات IP خاصة بالبوت، وتنشر Anthropic قائمة bots.json الحالية المشتركة؛ وكيل المستخدم بدون طريقة تحقق رسمية حالية يظل ادعاءً، وليس هوية موثقة. حافظ على الاعتماد على HTML الخام كمخاطرة ملحوظة بدلاً من التأكيد على أن كل زاحف رئيسي للذكاء الاصطناعي لا يشغل JavaScript أبدًا؛ تصف أنماط طلبات الأصول العينة المقاسة، وليس عقدًا عامًا للمُصيِّر. لا يزال تكرار الزحف لا يتنبأ بالاستشهاد — الاسترجاع ضروري ولكنه غير كافٍ. تتدرج الأدوات من grep إلى Screaming Frog LFA إلى ELK/Splunk إلى BigQuery/Cloudflare.
الخلاصة — تحليل سجلات زاحف الذكاء الاصطناعي يعني النظر إلى سجلات الوصول الخام لخادمك لمعرفة أي روبوتات ذكاء اصطناعي — مثل GPTBot من OpenAI أو ClaudeBot من Anthropic — زارت موقعك بالفعل، وكم مرة، وما الذي حصلت عليه. سجلاتك هي المكان الوحيد الذي يسجل ذلك. لا يُظهر Google Search Console روبوتات الذكاء الاصطناعي، وGoogle Analytics يرى فقط الأشخاص الذين ينقرون للوصول، وليس الروبوتات نفسها. المشكلة: الكثير من الزيارات تدّعي أنها روبوت ذكاء اصطناعي مشهور ولكنها ليست كذلك، لذا لا يمكنك الوثوق بالاسم وحده.
ما هو ملف السجل
تسجل سجلات الوصول للخادم الطلبات التي وصلت إلى الخادم، بما في ذلك وكيل المستخدم والوقت والمسار وتفاصيل الاستجابة عند تكوينها. Evidence for this claim Server access logs record requests and can include fields such as request path, status, referrer, and user agent. Scope: Apache HTTP Server logging; available fields depend on server configuration. Confidence: high · Verified: Apache: Log files توثق وثائق الزاحف الخاصة بالبائعين وكلاء المستخدم، لكن السلسلة وحدها لا تثبت أن الطالب حقيقي. Evidence for this claim OpenAI publishes user-agent tokens and controls for several of its crawlers. Scope: OpenAI's documented crawlers; a user-agent string is not proof of downstream training, retrieval, citation, or use. Confidence: high · Verified: OpenAI: Crawlers
في كل مرة يطلب فيها أي شيء — متصفح شخص، Googlebot، GPTBot — صفحة من خادمك، يكتب خادمك سطرًا في ملف سجل. يسجل كل سطر الوقت وعنوان IP للزائر وما طلبه و”وكيل المستخدم” (تسمية يستخدمها الزائر لتعريف نفسه، مثل GPTBot) ورمز الاستجابة الذي أرسله خادمك (200 للنجاح، 404 لعدم العثور، وهكذا).
تحليل سجلات زاحف الذكاء الاصطناعي هو مجرد قراءة تلك الأسطر وتصفيتها إلى روبوتات الذكاء الاصطناعي. إنه يجيب على أسئلة لا يمكنك الإجابة عليها بأي طريقة أخرى:
- هل زار روبوت ذكاء اصطناعي موقعي بالفعل؟
- ما الصفحات التي جلبها، وما الصفحات المهمة التي تجاهلها؟
- هل كان الروبوت الحقيقي أم شيئًا يتظاهر بأنه هو؟
- ما الذي حصل عليه — المحتوى الفعلي أم صفحة خطأ؟
إذا كنت تريد القائمة الكاملة لروبوتات الذكاء الاصطناعي وما هو الغرض من كل منها (روبوتات التدريب مقابل روبوتات البحث مقابل روبوتات “جلب هذه الصفحة الآن”) ، فهذا موضوع منفصل — انظر زاحفو الذكاء الاصطناعي. هذه الصفحة تدور حول الكيفية: سحب السجلات وقراءتها.
لماذا لا تغطي لوحات المعلومات الخاصة بك هذا
- Google Search Console لديه تقرير إحصائيات الزحف، لكنه يتعلق فقط بـ Googlebot. لا يُظهر شيئًا عن GPTBot أو ClaudeBot أو PerplexityBot.
- Google Analytics (GA4) يسجل فقط الزوار الذين ينقرون على رابط لموقعك ويصلون مع “مُحيل”. الزاحف الذي يلتقط صفحتك في الخلفية لا يظهر هناك أبدًا.
لذا فإن السجلات هي الحقيقة الأساسية. لا شيء آخر يرى الروبوت.
الشيء الوحيد الذي يغفله المبتدئون
تسمية GPTBot في سجلاتك لا تثبت أنها كانت OpenAI حقًا. يمكن لأي شخص وضع أي سلسلة وكيل مستخدم يريدها على طلب — إنه مثل كتابة عنوان المرسل على ظرف. الكثير من الكاشطات تضع اسم روبوت مشهور على زياراتها لتبدو شرعية. الطريقة الوحيدة للتأكد هي التحقق من عنوان IP للزائر مقابل قائمة العناوين الحقيقية التي تنشرها شركة الذكاء الاصطناعي. خطوة التحقق هذه هي جوهر القيام بذلك بشكل صحيح، وعلامة التبويب متقدم تشرحها بالتفصيل.
الخلاصة — اسحب سجلات الوصول الخاصة بـ Apache/Nginx أو CDN، ثم افعل أربعة أشياء: تحقق (طابق وكيل المستخدم وأكد عنوان IP مقابل القائمة المنشورة لكل مشغل — تتراوح معدلات الانتحال من 5,7% لدى HUMAN Security إلى 81,8% التي اختبرها Duane Forrester بنفسه) ؛ اختر أداة حسب الحجم (grep → Screaming Frog Log File Analyser → ELK/Splunk → BigQuery/Cloudflare) ؛ قس تكرار الزحف حسب الروبوت، والصفحات التي تتم زيارتها، والزحف مقابل العرض، ورموز الحالة؛ وفسر بصدق — الاسترجاع ضروري لكنه غير كافٍ، لذا فإن “المزيد من الزحف = المزيد من الاستشهادات” غير مثبت. هذه هي الطريقة الشقيقة لـ زاحفو الذكاء الاصطناعي (التي تمتلك ما هي الروبوتات) ، وإسناد حركة مرور الذكاء الاصطناعي (جانب النقر) ، ورؤية LLM (الإطار المسترجع ← المذكور ← المستشهد به الذي تراقب هذه الصفحة مرحلته الأولى).
ما تمتلكه هذه المقالة — وما لا تمتلكه
تُظهر السجلات الطلبات، وليس ما إذا كان المحتوى مستخدمًا للتدريب أو الاسترجاع أو الإجابة. Evidence for this claim Server access logs record requests and can include fields such as request path, status, referrer, and user agent. Scope: Apache HTTP Server logging; available fields depend on server configuration. Confidence: high · Verified: Apache: Log files تحقق من الروبوتات باستخدام الآليات المنشورة من المزود حيثما كانت متاحة، وعامل الإسناد كدليل محدود. Evidence for this claim OpenAI publishes user-agent tokens and controls for several of its crawlers. Scope: OpenAI's documented crawlers; a user-agent string is not proof of downstream training, retrieval, citation, or use. Confidence: high · Verified: OpenAI: Crawlers
مقالة زواحف الذكاء الاصطناعي الشقيقة تمتلك بالفعل جدول الزواحف واحدًا تلو الآخر، والتصنيف ثلاثي الفئات (التدريب / البحث بالذكاء الاصطناعي / الجلب المباشر بواسطة المستخدم) ، والتمييز بين أن Google-Extended رمز وليس زاحفًا، ووصفات robots.txt. لن أعيد اشتقاق أي من ذلك هنا. إسناد حركة مرور الذكاء الاصطناعي يمتلك جانب GA4/المُحيل — ما أرسله الزاحف بالعودة. هذه المقالة هي الجانب المقابل من القمع: ما أخذه الزاحف. ورؤية LLM تمتلك إطار العمل المسترجع ← المذكور ← المُستشهد به؛ تحليل السجلات هو كيف تلاحظ مرحلة المسترجع تحديدًا، ولا شيء بعدها.
هذه هي التتمة في عصر الذكاء الاصطناعي لتحليل سجلات SEO الكلاسيكي. عندما راجعتُ مقالة Ahrefs How to Do an SEO Log File Analysis ، كانت الأبعاد هي تكرار الزحف، وعناوين URL التي تم الزحف إليها، ورموز الحالة، والتحقق من الزواحف مقابل عناوين IP المنشورة من Google. نفس الهيكل هنا — لكنه موجه نحو مجموعة زواحف لا تعرض JavaScript في الغالب، ويتم انتحالها باستمرار، وتزحف في دفعات غير منتظمة بدلاً من تدفق ثابت.
الخطوة 1 — احصل على سجلاتك
سجلاتك موجودة في أحد مكانين، أو كليهما:
- سجلات الخادم الأصلي. Apache (
access.log) ، أو Nginx (access.log) ، أو خادم التطبيق الخاص بك. يحتوي كل سطر على الأقل على: الطابع الزمني، وعنوان IP للعميل، وطريقة الطلب + المسار، ورمز الحالة، والبايتات، والمُحيل، ووكيل المستخدم. - سجلات CDN / الحافة. إذا كنت خلف Cloudflare أو Fastly أو Akamai وما إلى ذلك، فإن الكثير من حركة مرور الزواحف تتم معالجتها عند الحافة وقد لا تصل أبدًا إلى خادمك الأصلي — لذا فإن سجل الحافة هو السجل الأكثر اكتمالاً. يكشف Cloudflare عن ذلك عبر Logpush (وواجهة برمجة تطبيقات GraphQL) ؛ وFastly عبر بث السجلات في الوقت الفعلي.
الحقول التي تحتاجها فعليًا لتحليل زواحف الذكاء الاصطناعي: الطابع الزمني، وعنوان IP للعميل، ووكيل المستخدم، ومسار الطلب، ورمز الحالة ، ومن الأفضل أيضًا البايتات والمُحيل.
المشكلة العملية هي الاحتفاظ. يحتفظ العديد من المضيفين بسجلات لبضعة أيام فقط. مقالة Lauren Busby في Search Engine Land تسمي الحل مباشرة — السحب المجدول يحول نافذة قصيرة إلى شيء يمكن تحليله بمرور الوقت: وظيفة SFTP مجدولة، مبنية في أداة سير عمل مثل n8n أو مكتوبة كنص برمجي، كافية لتحويل نافذة احتفاظ قصيرة إلى شيء يمكنك تحليله فعليًا بمرور الوقت (Busby, SEL). قم بإعداد ذلك قبل أن تحتاج إلى البيانات.
حد صادق واحد يجب أن تضعه في الاعتبار من البداية: كما تقول Busby، تُظهر لك ملفات السجلات ما وصل إلى موقعك، لكنها لا تُظهر لك دائمًا ما حاول الوصول (SEL) — الطلبات المحظورة أو التي تمت معالجتها في مكان آخر قد لا تظهر على الإطلاق.
الخطوة 2 — تحقق قبل أن تثق في وكيل المستخدم
هذه هي الخطوة التي تفصل تحليل سجلات زواحف الذكاء الاصطناعي عن النسخة الكلاسيكية، والخطوة التي تتجاهلها معظم الأدلة المنافسة. سلاسل وكيل المستخدم سهلة الانتحال بشكل تافه. نقطتا بيانات مستقلتان حول مدى سوء الأمر:
- HUMAN Security حللت أسبوعين من حركة المرور التي تدعي أنها واحدة من 16 زاحفًا معروفًا للذكاء الاصطناعي ووجدت أن 5,7% منها كانت منتحلة — أي ما يقرب من 1 من كل 18 طلبًا (تم الإبلاغ عنه عبر SEJ).
- Duane Forrester أجرى نفس الفحص على سجلاته الخاصة ووجد نتائج أسوأ بكثير. من بين 33 طلبًا يحمل اسم جلب مباشر، جاء ستة من عنوان IP تنشره الشركة المصنعة وسبعة وعشرون لم تأتِ — أي معدل انتحال 81,8% بين الطلبات التي تمكن من فحصها (SEJ). وكان رقم Googlebot لديه أسوأ من ذلك: من بين 799 طلبًا يحمل اسم Googlebot، جاء 107 فقط من عنوان Google موثق — أما الـ 87% الأخرى تقريبًا فلم تكن من Google (SEJ).
تعامل مع هذه الأرقام كمؤشرات اتجاهية من عينات ومنهجيات مختلفة، وليس كرقم عالمي واحد. الأهم من ذلك، لا تعمم طريقة التحقق من مزود واحد على كل الروبوتات. بعض المشغلين ينشرون نطاقات عناوين IP؛ وآخرون يوثقون رموز وكيل المستخدم دون نطاق عام حالي أو عقد تحقق DNS (SEJ).
طريقة التحقق:
- طابق سلسلة وكيل المستخدم. يعرّف GPTBot عن نفسه على أنه
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.3; +https://openai.com/gptbot; يحمل OAI-SearchBot وChatGPT-User رموزهما الخاصة (وثائق روبوتات OpenAI). - استخدم طريقة التحقق الرسمية الحالية من المزود عندما تكون موجودة. توفر OpenAI
openai.com/gptbot.json،searchbot.json، وchatgpt-user.json. توثيق الزاحف الحالي من Anthropic يقول إن العنوان في قائمتها المنشورة يشير إلى أن الزاحف قادم من Anthropic. استخدم تلك الطريقة الخاصة بالمزود الحالية؛ ولا تعممها كقاعدة عالمية للتحقق من الروبوتات. - لا تخترع حلاً بديلاً. التحقق العكسي ثم الأمامي من DNS صالح لمزود فقط عندما ينشر ذلك المزود نمط اسم المضيف وإجراءات التحقق. تطابق PTR عام يثبت السيطرة على DNS، وليس هوية الروبوت المزعومة. يمكن لمحلل ملفات السجل من Screaming Frog تطبيق القوائم المؤكدة علنًا عند توفرها؛ وتقوم ميزة التحقق عند الاستيراد بإجراء بحث مقابل قوائم IP المؤكدة علنًا لتأكيد أن الروبوتات حقيقية (Screaming Frog).
يجب أن يوجه التحقق سياسة دقيقة واستجابة للحوادث. فضّل رمز الروبوت الموثق من المزود لسياسة الزحف؛ واحتفظ بضوابط الشبكة لحالات إساءة الاستخدام أو الأمان وسمها بشكل منفصل عن الامتثال لروبوتات.
الخطوة 3 — اختر أداتك
قم بتوسيع نطاقها حسب حجم المهمة، تقريبًا من المجاني إلى المدفوع، ومن الحقيقة الأرضية إلى المُدار:
- grep / PowerShell — عدّ سريع لمرة واحدة ومرشّح يتحقق من التحقق. مقال زواحف الذكاء الاصطناعي يحتوي على مقتطف العد الأساسي للبوتات؛ وعلامة التبويب Scripts هنا توسّعه ليشمل التحقق من IP، وتفصيل رموز الحالة، وكشف الزحف مقابل العرض.
- Screaming Frog Log File Analyser — أداة استيراد سطح مكتب مع إعدادات مسبقة مدمجة لبوتات الذكاء الاصطناعي (GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, PerplexityBot, Perplexity-User, CCBot) وتبديل “Verify Bots When Importing”. تعرض علامة التبويب Response Codes تفاصيل 2XX/3XX/4XX/5XX لكل عنوان URL، وتعرض علامة التبويب User Agents الطلبات ومعدلات الأخطاء لكل بوت، وترتب علامة التبويب URLs حسب Num Events (الصفحات الأكثر جلبًا) ، وتتيح لك علامة التبويب IPs التحقيق في المصادر المشبوهة (برنامج تعليمي).
- ELK Stack (Elasticsearch / Logstash / Kibana) أو Splunk — للاستيعاب المستمر على نطاق أوسع مع لوحات المعلومات والتنبيهات، عندما تصبح أداة سطح المكتب ذات الاستيراد الواحد بطيئة جدًا أو تريد مراقبة مستمرة بدلاً من تصديرات دورية.
- BigQuery — للاحتفاظ طويل الأمد والاستعلام بـ SQL على نطاق واسع، ويُغذّى عادةً عبر
Cloudflare Logpush أو سحب GraphQL مجدول من مجموعة بيانات
httpRequestsAdaptiveGroupsالخاصة بـ Cloudflare، بحيث يمكنك الاستعلام عن نشاط البوت حسب الصفحة والتاريخ ورمز الحالة دون إعادة استيراد ملفات مسطحة. - Cloudflare AI Crawl Control (للمواقع خلف Cloudflare) — لوحة تحكم مُدارة لنشاط الزاحف وأنماط الطلبات، والتحقق من البوت، وتتبع الامتثال للتوجيهات، دون بناء خط أنابيب خاص بك (الوثائق).
الخطوة 4 — ما الذي يجب قياسه وكيفية قراءته
تكرار الزحف حسب البوت. عدد الزيارات في اليوم/الأسبوع لكل اسم بوت. تزحف بوتات الذكاء الاصطناعي في دفعات، وليس في تدفقات ثابتة. في دراسة حالة سجلات CDN التي استمرت 48 يومًا من WISLR، كان GPTBot غائبًا لأسابيع، ثم سجّل 187 طلبًا في أسبوع واحد — 152 منها في دفعة مدتها ثلاث دقائق، بذروة 114 طلبًا/الدقيقة (WISLR). اقرأ التكرار كنمط، وليس مجرد إجمالي.
أي الصفحات تتلقى الزيارات — وأيها المهم لا يتلقاها. رتّب حسب عدد الطلبات. يلاحظ Busby أن زواحف الذكاء الاصطناعي تبقى غالبًا سطحية — من الشائع رؤيتها مقتصرة على الصفحات عالية المستوى: الصفحة الرئيسية، والتنقل الأساسي، وعدد صغير من عناوين URL عالية المستوى (SEL) — وتنخفض بشكل حاد للصفحات العميقة حتى عندما تكون تلك الصفحات العميقة الأكثر أهمية للاستشهاد. الصفحة العميقة التي لا تظهر أبدًا في السجلات لا يمكن استرجاعها.
الاعتماد على HTML الخام — قِس، ولا تعمّم. لا تقدم وثائق المزود عقدًا مشتركًا لعرض JavaScript لـ GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot وغيرها من الوكلاء. توقيع واحد ملاحظ لا يزال مفيدًا: في عينة WISLR، جلب ChatGPT-User HTML فقط — صفر طلبات للصور أو CSS أو ملفات JS — بينما سحب Googlebot وOAI-SearchBot الصور أيضًا (WISLR). إذا أظهرت سجلاتك بوتات ذكاء اصطناعي تضرب صفحات يكون HTML الخام فيها غلاف JS شبه فارغ، فهذا خطر اعتماد قابل للفحص، وليس دليلًا على أن كل مزود يتصرف دائمًا بهذه الطريقة. قارن HTML المُسلَّم بالنتائج أو باختبارات الجلب الخاصة بالمزود. (بالنسبة لأساسيات العرض، انظر JavaScript SEO.)
تفصيل رمز الحالة / الحظر. راقب: 200 (نجاح) ، 304 (غير معدّل —
جيد، إعادة زحف فعّالة) ، 404 (روابط معطلة تبعها البوت) ، و403/429
(محظور / محدود المعدل). يذكر Busby تحديدًا أن ملفات السجلات تُظهر حيث
يواجه الزاحفون مشكلات، بما في ذلك استجابات 403 (طلبات محظورة) و429
(تحديد معدل)
(SEL).
تحقق مما إذا كان هذا الحظر مقصودًا أم حادثًا.
robots.txt وllms.txt كإشارة خاصة بهما. تحقق من أي الروبوتات تطلب /robots.txt قبل الزحف على الإطلاق — في عينة WISLR، لم يتحقق GPTBot وMeta-WebIndexer منه عبر 48 يومًا — وما إذا كانت المسارات المحظورة تُزار رغم ذلك. كما سجلت WISLR صفر طلبات إلى /llms.txt من أي روبوت ذكاء اصطناعي خلال تلك الأيام الـ48
(WISLR) ، بما يتوافق مع النتيجة القائلة بأن حوالي 97% من المحتوى غير مقروء والمغطاة في مقالة زاحفات الذكاء الاصطناعي. لا تتوقع طلبات llms.txt في سجلاتك كدليل على أنها “تعمل”.
هل يعني المزيد من الزحف المزيد من الاستشهادات؟ كن صادقًا.
لا توجد بيانات راسخة تدعم “ازحف أكثر، احصل على استشهادات أكثر.” الاسترجاع هو شرط ضروري للاستشهاد لكنه بعيد كل البعد عن كونه كافيًا — الصفحات تُزحف باستمرار ولا تُستشهد بها أبدًا، سواء بسبب العرض من جانب العميل، أو الجدران المدفوعة، أو المحتوى الرقيق أو المكرر، أو ببساطة الخسارة أمام مصدر أفضل في خطوة الاسترجاع/الترتيب في النموذج. الإطار الأساسي موجود في مقالة رؤية LLM: مسترجَع → مذكور → مُستشهَد به ، وتحليل السجلات يراقب فقط تلك المرحلة الأولى.
الطريقة لإغلاق الحلقة بصدق هي الجمع بين جانب إدخال الزحف (سجلاتك) وجانب إخراج الاستشهادات. تقرير أداء الذكاء الاصطناعي في Bing (معاينة عامة، فبراير 2026) هو أول أداة رسمية تكشف بيانات الاستشهادات إلى جانب استعلامات التأسيس الخاصة بها — العبارات الرئيسية التي استخدمها الذكاء الاصطناعي عند استرجاع المحتوى الذي تمت الإشارة إليه في الإجابات المولدة بالذكاء الاصطناعي (Bing Webmaster Blog). السجلات تخبرك بما تم أخذه؛ استعلامات التأسيس وعدد الاستشهادات تخبرك بما نتج عن ذلك. لا شيء منهما وحده يمثل الصورة الكاملة — راجع مركز القياس وإعداد التقارير لفهم كيفية تراكم هذه الطبقات.
تعقيد الزحف الخفي
التحقق ليس تدقيقًا لمرة واحدة. وفقًا لكلينت سبولدينغ من Seer Interactive، بمجرد حظرها، يمكن للزاحفات الخفية أن تظهر مجددًا تحت ترويسات متصفح عامة وعناوين IP غير مرتبطة — هذه الجلسات تبدو بشرية في السجلات، مما يعني تضخم عدد الجلسات، وعدم احتساب حركة مرور الروبوتات بشكل كافٍ، وتصبح تجزئة GEO أقل موثوقية (Seer). ملخصه المباشر: إذا لم تتمكن من رؤية هذه الزاحفات الخفية، فلن تتمكن من قياس تأثيرها. هذا هو بالضبط سبب حاجة تحليل السجلات إلى إعادة تحقق وإعادة معايرة دورية، وليس مجرد تمريرة واحدة.
ملخص الذكاء الاصطناعي
نظرة مختصرة على النسخة المتقدمة:
- تحليل سجلات زاحف الذكاء الاصطناعي = قراءة سجلات الخادم/شبكة توصيل المحتوى الخام لطلبات بوتات الذكاء الاصطناعي للتحقق، باستخدام بيانات الطرف الأول، من البوتات التي تصل إليك، وما إذا كانت حقيقية، وما حصلت عليه. لا ترى GSC (المخصصة لـ Googlebot فقط) وGA4 (المخصصة للإحالات فقط) ذلك.
- النطاق: هذه هي المنهجية. ما هي البوتات موجود في زاحفو الذكاء الاصطناعي ؛ جانب النقر في إسناد حركة مرور الذكاء الاصطناعي ؛ إطار العمل المسترجع ← المذكور ← المُستشهد به في رؤية نماذج اللغة الكبيرة (تلاحظ السجلات فقط المسترجع).
- افصل الهوية الموثقة عن وكيل المستخدم المُدعى. يتم تزوير وكلاء المستخدمين — قاست HUMAN Security 5,7% عبر 16 بوتًا؛ اختبر Duane Forrester بنفسه 81,8% مزيفًا بين طلبات الجلب المباشر لديه (87% لـ Googlebot). طابق وكيل المستخدم و تحقق من عنوان IP المصدر مقابل قائمة رسمية حالية للمشغل عند وجود واحدة (على سبيل المثال،
openai.com/gptbot.jsonأوclaude.com/crawling/bots.jsonالخاصة بـ Anthropic). لا تخترع احتياطيًا عامًا لعكس DNS. - الأدوات حسب الحجم: grep ← Screaming Frog LFA (إعدادات مسبقة للذكاء الاصطناعي + تحقق عند الاستيراد) ← ELK/Splunk ← BigQuery / Cloudflare AI Crawl Control.
- القياس: تكرار الزحف حسب البوت (متقطع، مثل 152 طلب GPTBot من WISLR في 3 دقائق) ، الصفحات التي تم الوصول إليها، الاعتماد على HTML الخام (عينة ChatGPT-User من WISLR جلبت صفر صور/CSS/JS) ، رموز الحالة (403/429) ، وطلبات robots.txt/llms.txt (سجل WISLR صفر ضربات llms.txt في 48 يومًا).
- الزحف ≠ الاستشهاد. الاسترجاع ضروري، لكنه غير كافٍ — “المزيد من الزحف = المزيد من الاستشهادات” غير مثبت. اقرن السجلات باستعلامات التأسيس من Bing لإغلاق الحلقة.
- أعد التحقق دوريًا — الزواحف المخفية المحظورة تظهر مجددًا بشكل يشبه البشر.
الوثائق الرسمية
المصادر الأساسية — ملفات التحقق الخاصة بمشغلي البوتات ووثائق المنصات.
OpenAI
- وثائق بوتات/زواحف OpenAI — سلاسل وكيل المستخدم والسلوك لـ GPTBot وOAI-SearchBot وChatGPT-User وOAI-AdsBot.
- قوائم IP المنشورة للتحقق: gptbot.json ، searchbot.json ، chatgpt-user.json ، adsbot.json.
Anthropic
- هل يزحف Anthropic على البيانات من الويب؟ — أسماء البوتات الحالية، الأغراض، ضوابط robots، والبيان بأن العنوان في قائمته المنشورة يشير إلى زاحف Anthropic.
- قائمة IP لزواحف Anthropic — مصدر التحقق المشترك الحالي لـ ClaudeBot وClaude-SearchBot وClaude-User.
- تقرير إحصائيات الزحف — عرض نشاط الزحف الخاص بـ Google (Googlebot فقط؛ لا يغطي بوتات الذكاء الاصطناعي التابعة لجهات خارجية، ولهذا السبب هناك حاجة إلى السجلات الخام لها).
Cloudflare
- التحكم في زحف الذكاء الاصطناعي — لوحة تحكم مُدارة لنشاط زواحف الذكاء الاصطناعي، والتحقق من البوتات، والامتثال للتوجيهات.
Bing / Microsoft
- تقديم أداء الذكاء الاصطناعي في Bing Webmaster Tools (معاينة عامة) — النظير لنتائج الاستشهاد لتحليل السجلات: إجمالي الاستشهادات، متوسط الصفحات المُستشهد بها، استعلامات التأسيس، ونشاط الاستشهاد على مستوى الصفحة.
اقتباسات من المصدر
تصريحات مسجلة من المشغلين وممارسين مُسمّين.
Anthropic — النطاق الحالي
- تميز صفحة الدعم الحالية لـ Anthropic بين ClaudeBot وClaude-SearchBot و Claude-User، وتوثق كيفية تطبيق ضوابط robots الخاصة بها، وتقول إن عنوانًا في قائمتها المنشورة يشير إلى زاحف Anthropic. المصدر
لورين بوسبي، المؤسس المشارك، Trebletree — Search Engine Land
- “Log files are the closest thing to that missing layer. They don’t summarize or interpret activity. They record it — every request, every URL, every crawler.” (ترجمة) «ملفات السجل هي أقرب شيء إلى تلك الطبقة المفقودة. إنها لا تلخص النشاط أو تفسره. بل تسجله — كل طلب، كل عنوان URL، كل زاحف.»
- “Tools like Screaming Frog Log File Analyzer make it possible to process that data quickly.” (ترجمة) «أدوات مثل Screaming Frog Log File Analyzer تجعل من الممكن معالجة تلك البيانات بسرعة.»
- حول عمق زحف الذكاء الاصطناعي: “It’s common to see them limited to top-level pages – the homepage, primary navigation, and a small number of high-level URLs.” (ترجمة) «من الشائع رؤيتها مقتصرة على الصفحات عالية المستوى — الصفحة الرئيسية، والتنقل الأساسي، وعدد صغير من عناوين URL عالية المستوى.»
- حول ما يظهر: “Log files also surface where crawlers encounter issues. This includes: 403 responses (blocked requests). 429 responses (rate limiting).” (ترجمة) «تكشف ملفات السجل أيضًا عن الأماكن التي تواجه فيها الزواحف مشكلات. ويشمل ذلك: استجابات 403 (طلبات محظورة). استجابات 429 (تحديد المعدل).»
- حول الاحتفاظ: “A scheduled SFTP job – whether built in a workflow tool like n8n, or scripted – is enough to turn a short retention window into something you can actually analyze over time.” (ترجمة) «مهمة SFTP مجدولة — سواء بُنيت في أداة سير عمل مثل n8n، أو عبر برمجة نصية — كافية لتحويل نافذة احتفاظ قصيرة إلى شيء يمكنك تحليله فعليًا بمرور الوقت.»
- الحد الصادق: “Log files show you what reached your site. They don’t always show you what tried to.” (ترجمة) «تُظهر لك ملفات السجل ما وصل إلى موقعك. ولا تُظهر دائمًا ما حاول الوصول.» المصدر
دوين فوريستر — Search Engine Journal
- “Of 33 requests carrying one of those live-fetch names. Six came from an IP the vendor publishes. Twenty-seven did not. That is an 81.8% spoof rate among the requests I could check.” (ترجمة) «من بين 33 طلبًا تحمل أحد أسماء الجلب المباشر تلك. جاء ستة منها من عنوان IP ينشره البائع. وسبعة وعشرون لم تأتِ. هذا معدل انتحال بنسبة 81.8% بين الطلبات التي تمكنت من فحصها.»
- “The real check is not complicated. The major operators publish the actual IP addresses their bots use, as plain files you can open right now, and a request is legitimate only if the name matches and the address sits inside the published list.” (ترجمة) «الفحص الحقيقي ليس معقدًا. ينشر المشغلون الرئيسيون عناوين IP الفعلية التي تستخدمها روبوتاتهم، كملفات نصية يمكنك فتحها الآن، والطلب مشروع فقط إذا تطابق الاسم وكان العنوان داخل القائمة المنشورة.»
- حول Googlebot، للقياس: “Of 799 requests carrying the Googlebot name, only 107 came from a verified Google address. The other 692, roughly 87%, were not Google.” (ترجمة) «من بين 799 طلبًا تحمل اسم Googlebot، جاء 107 فقط من عنوان Google موثق. أما الـ 692 الآخرون، أي حوالي 87%، فلم يكونوا من Google.»
- دعوته للعمل: “Do not take my numbers; take the method… Pull a date range, match the names, verify the IPs against the published lists, and find your real fraction.” (ترجمة) «لا تأخذوا أرقامي؛ خذوا الطريقة… اسحبوا نطاقًا زمنيًا، طابقوا الأسماء، تحققوا من عناوين IP مقابل القوائم المنشورة، واعرفوا النسبة الحقيقية لديكم.» المصدر
كلينت سبولدينج، مدير أول لتحسين محركات البحث التقني، Seer Interactive
- “Once blocked, stealth crawlers can reappear under generic browser headers and unrelated IPs.” (ترجمة) «بمجرد حظرها، يمكن للزواحف الخفية أن تظهر مجددًا تحت ترويسات متصفح عامة وعناوين IP غير ذات صلة.»
- “These sessions look human in logs. That means session counts get inflated, bot traffic gets undercounted, and GEO segmentation becomes less trustworthy.” (ترجمة) «تبدو هذه الجلسات بشرية في السجلات. وهذا يعني أن أعداد الجلسات تتضخم، ويتم التقليل من حساب حركة مرور الروبوتات، ويصبح تقسيم GEO أقل موثوقية.»
- “If you can’t see these stealth crawlers, you can’t measure their impact.” (ترجمة) «إذا لم تتمكن من رؤية هذه الزواحف الخفية، فلن تتمكن من قياس تأثيرها.» المصدر
Screaming Frog — برنامج تعليمي لمحلل ملفات السجل (وثائق المنتج)
- حول التحقق عند الاستيراد: “Search engine bots are often spoofed, and this performs a lookup against publicly confirmed IP lists to confirm they are genuine.” (ترجمة) «غالبًا ما يتم انتحال شخصية روبوتات محركات البحث، ويقوم هذا بإجراء بحث في قوائم عناوين IP المؤكدة علنًا للتأكد من أنها حقيقية.»
- “If you see high request volumes from IPs that don’t verify, you’re likely dealing with fake bot traffic that should be blocked at server level.” (ترجمة) «إذا رأيت أحجام طلبات عالية من عناوين IP لا تتحقق، فمن المحتمل أنك تتعامل مع حركة مرور روبوتات مزيفة يجب حظرها على مستوى الخادم.» المصدر
Bing Webmaster Tools — تقرير أداء الذكاء الاصطناعي (معاينة عامة فبراير 2026)
- استعلامات التأسيس: “Shows the key phrases the AI used when retrieving content that was referenced in AI-generated answers.” (ترجمة) «يعرض العبارات الرئيسية التي استخدمها الذكاء الاصطناعي عند استرجاع المحتوى الذي تمت الإشارة إليه في الإجابات المُنشأة بالذكاء الاصطناعي.»
- إجمالي الاستشهادات: “Shows the total number of citations that are displayed as sources in AI-generated answers during the selected time frame.” (ترجمة) «يعرض العدد الإجمالي للاستشهادات التي تظهر كمصادر في الإجابات المُنشأة بالذكاء الاصطناعي خلال الإطار الزمني المحدد.» المصدر
”هل طلب روبوت الذكاء الاصطناعي هذا حقيقي، وماذا أفعل حياله؟”
مرر سطر سجل واحد مشبوه — أو حركة مرور روبوت كامل — عبر هذا. إنه منطق التحقق من الخطوة 2، محولاً إلى تدفق.
قائمة فحص تحليل سجلات زاحف الذكاء الاصطناعي
مرور قابل للتكرار، من سحب السجلات إلى قراءتها:
- يتم التقاط السجلات بالحقول التي تحتاجها: الطابع الزمني، عنوان IP الخاص بالعميل، وكيل المستخدم، مسار الطلب، رمز الحالة (البايتات + المُحيل مفيدان).
- تسحب من الطبقة الصحيحة — سجلات CDN/الحافة إذا كنت خلف Cloudflare/Fastly (الكثير من حركة مرور الروبوتات لا تصل إلى الأصل أبدًا).
- السحب المجدول (SFTP/n8n/script) يتفوق على نافذة الاحتفاظ بحيث يكون لديك سجل، وليس فقط الأيام القليلة الماضية.
- كل طلب روبوت ذكاء اصطناعي تم التحقق منه: تطابق وكيل المستخدم و فحص عنوان IP المصدر مقابل القائمة المنشورة للمشغل (عكس DNS كاحتياط).
- يتم استبعاد الطلبات المزيفة/غير المؤكدة من مقاييس زحف الذكاء الاصطناعي لديك، وليس احتسابها كالروبوت المسمى.
- يتم قياس خط الأساس لتكرار الزحف لكل روبوت (راقب الأنماط الاندفاعية مقابل الثابتة).
- تحديد الصفحات الأكثر جلبًا — وتأكيد أن الصفحات العميقة المهمة يتم الزحف إليها على الإطلاق.
- فحص الزحف مقابل العرض: هل تسحب روبوتات الذكاء الاصطناعي HTML فقط على الصفحات التي يكون محتواها معروضًا عبر JS؟ (سجل هذا كاختبار اعتماد HTML خام؛ سلوك المزود خاص بالوكيل وقد يكون غير موثق.)
- مراجعة رموز الحالة:
200/304سليمة؛404روابط معطلة؛403/429مؤكدة أنها مقصودة أو تم إصلاحها. - فحص وجود طلب robots.txt (هل تجلبه الروبوتات قبل الزحف؟) ؛ لا زيارات مفاجئة على المسارات المحظورة.
- الاقتران ببيانات جانب الاقتباس (استعلامات تأريض Bing / ميزات الذكاء الاصطناعي في GSC) قبل استخلاص أي استنتاج “هل يعمل”.
- جدولة إعادة التحقق — هذا ليس تدقيقًا لمرة واحدة (الزاحفون الخفيون يعاودون الظهور بمظهر بشري).
ورقة غش تحليل سجلات زاحف الذكاء الاصطناعي
ملفات التحقق (احفظها كإشارة مرجعية)
| المشغل | ملف IP المنشور | ملاحظات |
|---|---|---|
| OpenAI — GPTBot | openai.com/gptbot.json | زاحف التدريب |
| OpenAI — OAI-SearchBot | openai.com/searchbot.json | مفهرس بحث الذكاء الاصطناعي |
| OpenAI — ChatGPT-User | openai.com/chatgpt-user.json | جلب يبدأه المستخدم |
| OpenAI — OAI-AdsBot | openai.com/adsbot.json | إعلانات |
| Anthropic — جميع الروبوتات المسماة | claude.com/crawling/bots.json | قائمة مزود حالية مشتركة؛ طابق UA وعنوان المصدر |
| Google (للمقارنة) | googlebot.json (developers.google.com) | Googlebot فقط — تغطي إحصائيات الزحف في GSC هذا |
رموز الحالة التي يجب مراقبتها
| الرمز | المعنى | اقرأه كـ |
|---|---|---|
200 | موافق | حصل الروبوت على الصفحة |
304 | غير معدل | جيد — إعادة زحف فعالة |
403 | ممنوع | محظور — هل هذا مقصود؟ |
404 | غير موجود | رابط معطل تبعه الروبوت |
429 | طلبات كثيرة جدًا | محدود المعدل — تحقق مما إذا كنت تقصد ذلك |
5xx | خطأ خادم | الخادم يعاني — تتراجع الروبوتات |
تحقق، لا تثق
- وكيل المستخدم وحده = غير مؤكد. طابق UA وبيانات التحقق المنشورة من المزود حيثما أمكن؛ وإلا حافظ على عدم اليقين.
- معدلات الانتحال التي شوهدت في الواقع: 5,7% (HUMAN، 16 روبوتًا) → 81,8% (سجلات الجلب المباشر لـ Forrester) ؛ 87% Googlebot مزيف في نفس التدقيق.
مؤشر اعتماد HTML الخام
- الروبوت الذي يجلب HTML فقط مع صفر طلبات
.js/.css/صورة هو نمط جلب ملاحظ. على صفحة تعتمد على JS، هو إشارة خطر، وليس دليل قدرة عالمي.
حقائق سريعة
- تكرار الزحف ≠ احتمالية الاقتباس. الاسترجاع ضروري، وليس كافيًا.
- استخدم رموز robots الموثقة لسياسة الزحف؛ أبقِ الحظر على مستوى الشبكة كعنصر تحكم منفصل للإساءة/الأمان.
نصوص برمجية لتحليل سجلات زاحف الذكاء الاصطناعي
مقالة زاحفو الذكاء الاصطناعي تحتوي على مقتطف أساسي “عد زيارات الروبوت”. هذه تذهب أبعد: الاستخراج، التحقق، تحليل رموز الحالة، واكتشاف الزحف مقابل العرض.
1. استخراج كل سطر روبوت ذكاء اصطناعي (grep + regex)
macOS / Linux — بديل واحد عبر وكلاء مستخدم الذكاء الاصطناعي الشائعين:
# Pull all AI-bot requests from a combined-format access log
grep -Ei 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Applebot|Amazonbot|Bytespider|CCBot|Meta-ExternalAgent' \
access.log > ai-bots.log
# Count requests per bot (which token, how many hits)
grep -Eoi 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|PerplexityBot|Perplexity-User|CCBot|Bytespider' \
access.log | sort | uniq -c | sort -rnWindows PowerShell:
Select-String -Path .\access.log -Pattern 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|PerplexityBot|CCBot|Bytespider' |
ForEach-Object { ($_ -match '(GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|PerplexityBot|CCBot|Bytespider)') | Out-Null; $Matches[1] } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, Name2. تحقق من عنوان IP GPTBot المزعوم مقابل القائمة المنشورة من OpenAI
وكيل المستخدم وحده لا يثبت شيئًا — تحقق من عنوان IP. هذا يسحب قائمة OpenAI ويختبر ما إذا كان عنوان IP من سجلاتك يقع داخل أي CIDR منشور:
# Requires jq and (for CIDR math) grepcidr — brew/apt install both
IP="203.0.113.45" # the IP from your log line
curl -s https://openai.com/gptbot.json \
| jq -r '.prefixes[].ipv4Prefix // .prefixes[].ipv6Prefix' \
| while read -r cidr; do
echo "$IP" | grepcidr "$cidr" >/dev/null 2>&1 && echo "VERIFIED in $cidr"
done
# No output = the IP is NOT in OpenAI's published range → treat as spoofed.بالنسبة لـ Anthropic، اجلب القائمة الحالية https://claude.com/crawling/bots.json واضبط
مسار jq ليتوافق مع شكله الموثق. إذا كان مشغل آخر لا ينشر خلاصة تحقق حالية،
فاحتفظ بالنتيجة كوكيل مستخدم مُدّعَى.
3. احتياط DNS العكسي + الأمامي (عناوين IP خارج القائمة)
استخدم هذا فقط عندما ينشر المزود المسمى لاحقة اسم مضيف متوقعة وإجراء التحقق العكسي-زائد-الأمامي. إنه ليس دليلًا عامًا على هوية البوت:
IP="203.0.113.45"
HOST=$(host "$IP" | awk '/pointer/ {print $NF}' | sed 's/\.$//')
echo "PTR: $HOST"
host "$HOST" | grep -q "$IP" && echo "FORWARD-CONFIRMED" || echo "MISMATCH → suspect"4. تحليل رموز الحالة لكل بوت
اكتشف حظر 403/429 وأخطاء خطأ عدم العثور التي تواجهها البوتات:
# For GPTBot: tally status codes (combined log format; $9 is the status)
grep -i 'GPTBot' access.log | awk '{print $9}' | sort | uniq -c | sort -rn
# → e.g. "812 200 / 47 404 / 15 403" — the 403s are worth investigating5. إشارة اعتماد HTML الخام — ما أنواع الملفات التي يجلبها البوت؟
إذا كان بوت مُدّعَى يسحب فقط .html// ولا يسحب أبدًا .js/.css/الصور، وكان
محتواك مُصيَّرًا عبر JavaScript، فهذه إشارة اعتماد تستدعي التحقيق:
# What extensions is ChatGPT-User actually requesting?
grep -i 'ChatGPT-User' access.log \
| awk '{print $7}' \
| grep -oE '\.(html?|js|css|png|jpe?g|webp|svg|woff2?)(\?|$)' \
| sort | uniq -c | sort -rn
# All HTML, zero subresources = compare the raw body with provider-specific outcomes.6. وحدة تحكم Chrome DevTools — رصد جالبي الذكاء الاصطناعي على صفحة مباشرة
ليس استعلام سجلات، بل فحص سريع لما تشحنه الصفحة في HTML الخام مقابل ما بعد JavaScript (ما سيراه بوت الذكاء الاصطناعي وما لن يراه). الصقه في وحدة التحكم:
// Compare rendered text length to what's in the initial HTML source.
// A big gap means most content depends on JS; provider behavior must be verified separately.
(async () => {
const raw = await (await fetch(location.href, { cache: "no-store" })).text();
const rawText = new DOMParser().parseFromString(raw, "text/html").body.innerText.trim().length;
const renderedText = document.body.innerText.trim().length;
console.log({ rawText, renderedText, jsDependentRatio: +(1 - rawText / renderedText).toFixed(2) });
})();
// jsDependentRatio near 1 = almost all content is JS-injected; flag dependency, not invisibility.7. إشارة مرجعية — افتح قائمة عناوين IP لكل بوت دفعة واحدة
اسحب هذا كإشارة مرجعية لفتح ملفات التحقق في تبويبات للبحث السريع:
javascript:(function(){["https://openai.com/gptbot.json","https://openai.com/searchbot.json","https://openai.com/chatgpt-user.json","https://claude.com/crawling/bots.json"].forEach(u=>window.open(u,"_blank"));})(); إجراء تشغيلي قياسي: مراجعة سجلات زاحف الذكاء الاصطناعي الشهرية
إجراء متكرر يُنفَّذ على وتيرة (شهريًا لمعظم المواقع؛ أسبوعيًا إذا كان حركة الذكاء الاصطناعي مهمة لك). ينتج خطًا أساسيًا قابلًا للمقارنة في كل مرة.
التحضير
- اسحب نافذة السجلات منذ آخر مراجعة لك من الطبقة الصحيحة (سجلات CDN/الحافة إذا كنت خلف CDN، وسجلات الأصل بخلاف ذلك). تأكد من أن السحب المجدول عبر SFTP/n8n قد نُفِّذ فعلًا — الفجوات هنا تكسر خطوط الاتجاه بصمت.
- حمّلها في أداة السجلات الخاصة بك (Screaming Frog LFA للاستيرادات الدورية؛ BigQuery/ ELK إذا كنت على خط أنابيب).
التحقق (لا تتخطَّه أبدًا)
3. حدّث كل مصدر تحقق منشور حالي من المزود (gptbot.json،
searchbot.json، chatgpt-user.json، adsbot.json، وملف Anthropic
claude.com/crawling/bots.json) — هذه تتغير.
4. فعّل التحقق عند الاستيراد (Screaming Frog) أو شغّل فحص IP-داخل-CIDR (تبويب
البرامج النصية) ضد كل طلب بوت ذكاء اصطناعي.
5. قسّم الحركة إلى مُتحقَّق منها وغير مُتحقَّق منها. أبلغ عن نسبة غير
المُتحقَّق منها — هذا هو معدل الانتحال لهذه الفترة. القفزة هي نتيجة بحد ذاتها.
القياس (الحركة المُتحقَّق منها فقط)
6. تكرار الزحف لكل بوت مقابل الفترة السابقة — لاحظ البوتات الجديدة، والبوتات
المختفية، والاندفاعات.
7. الصفحات الأكثر جلبًا؛ تأكد من أن الصفحات ذات الأولوية/العميقة تُزحف على الإطلاق.
8. فحص اعتماد HTML الخام على 2–3 قوالب ثقيلة بـ JavaScript (هل تسحب البوتات HTML
فقط؟).
9. تحليل رموز الحالة لكل بوت؛ حقق في أي مجموعات 403/429/404 جديدة.
10. وجود طلبات robots.txt / llms.txt وأي زيارات لمسارات محظورة.
التقرير والتنفيذ 11. سجّل أرقام الفترة في جدول مستمر (زيارات مُتحقَّق منها لكل بوت، نسبة الانتحال %، الصفحات الأكثر زيارة، مجموعات الأخطاء) ليكون لديك اتجاه وليس لقطات. 12. اقرنها ببيانات جانب الاستشهاد (استعلامات إرساء Bing / ميزات الذكاء الاصطناعي في GSC) قبل استخلاص أي استنتاج حول الرؤية. 13. سجّل إصلاحات ملموسة: حظر مقصود مقابل عرضي، فجوات تصيير JavaScript، روابط معطلة، قواعد وكيل مستخدم دقيقة للمنتحلين المؤكدين.
ملاحظة الوتيرة: أعد التحقق كل فترة — لا تخزّن قائمة عناوين IP “معروفة الصحة”. الزواحف الخفية تعاود الظهور بعناوين IP جديدة ووكلاء مستخدم متصفح عامة.
دليل التشغيل: “GPTBot (أو ClaudeBot) يتلقى أخطاء حظر أو حدّ للمعدل ولا أعرف إذا كان ذلك مقصودًا”
دليل خطي خطوة بخطوة للحادث الشائع — بوت ذكاء اصطناعي مُتحقَّق منه يواجه أخطاء في سجلاتك. اعمل به بالترتيب.
الخطوة 1 — تأكد أولًا أنه البوت الحقيقي. قبل أي شيء آخر، استخدم طريقة التحقق الرسمية الحالية من المزود المسمى. إذا لم توجد، تبقى الهوية غير مُتحقَّق منها؛ لا ترفعها بصمت إلى حقيقية ولا تخفضها إلى منتحلة. قد يكون خطأ 403 مجرد جدار الحماية WAF الخاص بك يؤدي وظيفته.
الخطوة 2 — تحديد الاستجابة الدقيقة ومصدرها.
اسحب تفصيل رمز الحالة لهذا البوت (تبويب Scripts). هل هو 403 (محظور) ،
429 (محدود المعدل) ، أم 503؟ لاحظ ما إذا كان الحظر عند CDN/WAF الخاص بك،
إعداد الخادم الخاص بك، أو قواعد مشابهة لـ robots.txt.
الخطوة 3 — قرر: هل الحظر مقصود؟
- قصدت حظر هذا البوت (مثل زاحف تدريبي اخترت إلغاء الاشتراك منه) → الـ 403 يعمل كما صُمم. أبقِ سياسة robots الموثقة منفصلة عن أي قاعدة إساءة/أمان على مستوى الشبكة. انتهى.
- لم تقصد حظره (مثل OAI-SearchBot / PerplexityBot وتريد رؤية البحث بالذكاء الاصطناعي) → تابع.
الخطوة 4 — ابحث عن القاعدة العرضية.
الأسباب الشائعة: قاعدة “بوت” WAF واسعة جدًا، حد معدل منخفض جدًا لزاحف
متفجر (تذكر ارتفاع GPTBot بمعدل 114 طلبًا/دقيقة في WISLR — حد أقصى لكل دقيقة
يمكن أن يتعثر على دفعات مشروعة) ، قاعدة robots.txt منع نسيتها، أو حظر جغرافي/ASN
يلتقط نطاقات المشغل.
الخطوة 5 — أصلح بدقة. أضف البوت الموثق إلى القائمة البيضاء بواسطة user-agent + نطاق IP المنشور، أو ارفع سقف حد المعدل لهذا البوت الموثق تحديدًا. لا تخفف الحماية للجميع.
الخطوة 6 — تحقق من الإصلاح في السجلات.
بعد النشر، أعد سحب السجلات لهذا البوت. تريد أن تتحول مجموعة 403/429 إلى
200/304 على الصفحات التي تهتم بها.
الخطوة 7 — أعد التقييم الأساسي وراقب. لاحظ التغيير في ورقة المتابعة الخاصة بك. أعد الفحص في الفترة التالية — وابقَ متيقظًا لظهور البوت مرة أخرى تحت UA مختلف إذا كنت قصدت حظره (زحف خفي).
أخطاء تحليل السجلات التي تؤدي إلى استنتاجات خاطئة
كل منها اعتقاد من الواقع، ولماذا هو خاطئ، وماذا تفعل بدلاً من ذلك.
خرافة: “إذا كان robots.txt الخاص بي يحظر بوتًا، فلن يكون في سجلاتي / إنه ليس مشكلة.”
لماذا هي خاطئة: robots.txt هو طلب، وليس إنفاذًا. أدوات الجلب التي يطلقها المستخدم
تستثني نفسها صراحةً، وقد أُبلغ عن بعض الزواحف التي تتجاوز الحظر (زحف Perplexity الخفي، Cloudflare أغسطس 2025). قد يتم تجاهل الحظر تمامًا.
افعل بدلاً من ذلك: استخدم السجلات للتحقق مما إذا كانت القاعدة محترمة — ابحث عن
زيارات للمسارات المحظورة وما إذا كان البوت يطلب /robots.txt حتى.
خرافة: “user-agent مثل GPTBot / ClaudeBot في سجلاتي يعني أنه حقًا OpenAI / Anthropic.” لماذا هي خاطئة: user-agents قابلة للتزوير بسهولة — قاست HUMAN Security 5,7% مزيفة عبر 16 بوتًا، ووجد Duane Forrester 81,8% مزيفة بين طلبات الجلب المباشر الخاصة به. افعل بدلاً من ذلك: طابق user-agent واستخدم طريقة التحقق الرسمية الحالية للمشغل حيث توجد؛ وإلا فصنف الهوية على أنها غير موثقة.
خرافة: “المزيد من زيارات زواحف الذكاء الاصطناعي = احتمال أكبر للاستشهاد بك.” لماذا هي خاطئة: لا توجد بيانات سببية/ارتباطية راسخة تدعم ذلك. الاسترجاع ضروري لكنه غير كافٍ — الصفحات التي يتم الزحف إليها بكثافة تبقى غير مستشهد بها باستمرار. افعل بدلاً من ذلك: تعامل مع السجلات كرؤية لمرحلة الاسترجاع فقط، واقرنها ببيانات جانب الاستشهاد (استعلامات تأسيس Bing، ميزات الذكاء الاصطناعي في GSC).
خرافة: “كل زاحف ذكاء اصطناعي له نفس سلوك العرض.” لماذا هي خاطئة: لا ينشر المزودون عقدًا مشتركًا واحدًا لجافاسكريبت/الموارد الفرعية، ويختلف السلوك الملاحظ حسب الوكيل والعينة. افعل بدلاً من ذلك: قارن الاستجابة الخام بالصفحة المعروضة، وافحص طلبات الموارد الفرعية حسب البوت المسمى، وصنف النتيجة على أنها ملاحظة وليست عالمية.
خرافة: “بوتات الذكاء الاصطناعي على الأقل تتحقق من llms.txt الخاص بي.”
لماذا هي خاطئة: سجل WISLR لمدة 48 يومًا صفر طلبات /llms.txt من
أي بوت ذكاء اصطناعي، بما يتوافق مع نتيجة ~97% غير المقروءة في مقال زواحف الذكاء الاصطناعي.
افعل بدلاً من ذلك: لا تعامل طلبات llms.txt كتحقق متوقع؛ قس ما تجلبه البوتات فعليًا.
خرافة: “الحظر على الشبكة وسياسة robots هما نفس التحكم.” لماذا هي خاطئة: robots ينقل تفضيلات الزحف؛ جدار الحماية يفرض الوصول إلى الشبكة ويمكن أن يؤثر على حركة مرور غير ذات صلة. افعل بدلاً من ذلك: استخدم قاعدة user-agent الموثقة للسياسة، واحتفظ بحظر الشبكة لاستجابة إساءة/أمان مبررة بشكل منفصل.
حالات حقيقية
Duane Forrester — اختبر معدلات الانتحال بنفسه على سجلاته الخاصة. أجرى فورستر هذه الطريقة بالضبط على موقعه ونشر الأرقام. من بين 33 طلبًا مباشرًا، جاء 6 فقط من عنوان IP منشور من قبل البائع — بمعدل انتحال 81,8%؛ ومن بين 799 طلبًا باسم Googlebot، تحقق من 107 فقط — حوالي 87% مزيف (SEJ). قبل: عند الثقة في وكيل المستخدم، بدت حركة مرور “مساعده الذكي” حقيقية. بعد: عند مطابقة الأسماء مع قوائم عناوين IP المنشورة، كان معظمها انتحالًا. الخلاصة: الطريقة أهم من أرقامه المحددة — كما يقول، اسحب نطاق التاريخ الخاص بك واعثر على النسبة الحقيقية لديك.
WISLR — 48 يومًا من سجلات CDN، توقيع الزحف مقابل العرض.
حلل توني كاستيلو 288 566 سطرًا من سجلات CDN (12 099 طلبًا من الذكاء الاصطناعي/الروبوتات) على مدى 48 يومًا
(WISLR).
نتائج ملموسة: كان GPTBot غائبًا لأسابيع ثم انفجر بـ 152 طلبًا في ثلاث
دقائق (ذروة 114 طلبًا/دقيقة) ؛ جلب ChatGPT-User صفر صور أو CSS أو JS — استخراج
HTML نقي؛ وكانت هناك صفر طلبات /llms.txt عبر النافذة
الكلية. قبل: كنت تفترض زحفًا ثابتًا وروبوتات واعية بـ JS. بعد: تُظهر
السجلات سلوكًا انفجاريًا يعتمد على HTML فقط — n=1، بيانات موقع واحد، لكنها صورة واضحة لما
يكشفه تحليل حقيقي. الخلاصة: نمط الجلب بدون JS هو الدليل المباشر
وراء فحص الزحف مقابل العرض.
Cloudflare — نسبة الزحف إلى الإحالة، على نطاق الشبكة. تُظهر البيانات المجمعة من Cloudflare مدى ضآلة ما يترجمه الزحف إلى حركة مرور: لكل زائر يحيله Anthropic مرة أخرى إلى موقع ويب، تكون روبوتات الزحف الخاصة به قد زارت بالفعل عشرات الآلاف من الصفحات (Cloudflare). قبل: الحدس أن الزحف الكثيف يعني التفاعل. بعد: على نطاق الشبكة تكون النسبة غير متوازنة — التدريب الآن يقود غالبية نشاط روبوتات الذكاء الاصطناعي، وروبوتات التدريب ليست مصممة لإعادة حركة المرور على الإطلاق (Cloudflare). الخلاصة: صفحة يتم الزحف إليها بكثافة مع صفر إحالة أمر طبيعي، وليس علامة على النجاح — وهذا هو بالضبط سبب عدم كون تكرار الزحف مؤشرًا على الاستشهاد.
مطالبات ذكاء اصطناعي جاهزة للاستخدام
مطالبات نسخ ولصق لاستخدام نموذج لغوي كبير لتسريع تحليل سجلات زاحف الذكاء الاصطناعي. تحقق دائمًا من المخرجات مقابل السجلات الأولية — نماذج اللغة الكبيرة تهذي، وخط أنابيب تحقق يثق في تطابق IP مهذى أسوأ من عدم وجوده.
صمّم محلل سجلات يراعي التحقق
Write a Python script that parses combined-format Nginx access logs and, for each
request whose user-agent matches a known AI bot (GPTBot, OAI-SearchBot,
ChatGPT-User, ClaudeBot, Claude-User, PerplexityBot, Perplexity-User, CCBot,
Bytespider), does the following:
1. Extract timestamp, client IP, request path, status code, user-agent.
2. Fetch and cache OpenAI's current IP lists (gptbot.json, searchbot.json,
chatgpt-user.json, adsbot.json) and Anthropic's current bots.json list.
3. Mark an OpenAI or Anthropic request VERIFIED only if the user-agent matches AND
the client IP falls inside the matching provider-published ranges; mark providers
without an official method UNVERIFIED, not spoofed.
4. Output two CSVs: verified requests and unverified ("spoofed") requests.
5. Print a summary: verified vs. unverified count per bot, and the top 20 fetched
paths (verified only).
Do NOT count unverified requests in any per-bot metric. Add clear comments.لخّص تقرير رمز الحالة + الزحف مقابل العرض
I'll paste a table of AI-bot log data (columns: bot, path, status_code,
file_extension). Produce:
- A per-bot status-code breakdown, flagging any 403/429/404 clusters.
- A raw-HTML dependency read: for each bot, the ratio of HTML requests to
JS/CSS/image requests, and a note on whether the bot appears to fetch only HTML
in this sample. Treat HTML-only on a JS-rendered page as a dependency risk, not
proof of a universal no-JavaScript capability.
Keep every conclusion tied to a number from the data — do not infer beyond it.
DATA:
[paste]فرز عنوان IP مشبوه
A request in my logs claims to be [BOT NAME] from IP [IP ADDRESS]. Walk me through
verifying it: which operator IP-list file to check, how to test whether the IP is
in range, and the reverse+forward DNS fallback if it's not on a published list.
Tell me explicitly what result means "verified" vs. "treat as spoofed." Do not
guess whether this specific IP is legitimate — give me the steps to check. أدوات لتحليل سجلات زاحف الذكاء الاصطناعي
تقريبًا مجاني/حقيقة أرضية → مدفوع/مُدار:
- grep / PowerShell — أسرع طريقة للحصول على عدد زيارات الروبوتات وفلتر يتحقق من التحقق عبر سجل الوصول الخام. بدون إعداد؛ انظر علامة التبويب البرامج النصية.
- Screaming Frog Log File Analyser — أداة استيراد سطح مكتب مع إعدادات مسبقة مدمجة لروبوتات الذكاء الاصطناعي وتبديل “التحقق من الروبوتات عند الاستيراد” الذي يتحقق من قوائم عناوين IP المؤكدة علنًا. علامات التبويب: رموز الاستجابة، ووكلاء المستخدم، وعناوين URL (فرز حسب عدد الأحداث) ، وعناوين IP. الأفضل للاستيراد الدوري.
- ELK Stack (Elasticsearch / Logstash / Kibana) أو Splunk — استيعاب مستمر، ولوحات معلومات، وتنبيهات بمجرد أن يصبح الاستيراد من سطح المكتب بطيئًا جدًا أو تريد مراقبة مستمرة.
- BigQuery — الاحتفاظ طويل الأجل وSQL على نطاق واسع، ويتم تغذيته عادةً بواسطة
Cloudflare Logpush أو سحب GraphQL مجدول من
httpRequestsAdaptiveGroups. - Cloudflare AI Crawl Control — للمواقع خلف Cloudflare: عروض مُدارة لنشاط الزاحف، والتحقق من الروبوتات، والامتثال للتوجيهات دون خط أنابيب خاص بك.
- Google Search Console — إحصائيات الزحف — ليس لروبوتات الذكاء الاصطناعي (Googlebot فقط) ، ولكنه النموذج للتفصيل حسب الزاحف + حسب رمز الاستجابة الذي تعيد بناؤه لروبوتات الذكاء الاصطناعي من السجلات الخام.
- Bing Webmaster Tools — أداء الذكاء الاصطناعي — النظير لنتائج الاستشهاد: اربط استعلامات التأسيس وعدد الاستشهادات بسجلات إدخال الزحف الخاصة بك لإغلاق الحلقة.
ارتفاعات مفاجئة في حركة مرور روبوتات الذكاء الاصطناعي بين عشية وضحاها
الأعراض: قفزات مفاجئة في الطلبات التي تحمل وكيل مستخدم لزاحف معروف. السبب المحتمل: انتحال، أو حركة مراقبة، أو تغيير حقيقي في الزحف. الإصلاح: تحقق من عناوين IP المصدر مقابل الطريقة المنشورة الحالية للمشغل قبل نسب الحركة، ثم قسّم حسب ASN والمسار والحالة والوقت.
تُظهر السجلات زحفًا لكن المحتوى لا يُستشهد به أبدًا
الأعراض: تجلب الروبوتات الموثقة صفحات دون مكاسب استشهاد مرئية. السبب المحتمل: الزحف هو مجرد دليل على الأهلية؛ الاسترجاع واختيار الإجابة منفصلان. الإصلاح: تأكد من أن الروبوت تلقى HTML جوهريًا، ثم قيّم قابلية الفهرسة وجودة المقطع وملاءمة الاستعلام والتأكيد خارج الموقع دون اعتبار عدد الزحف كترتيب.
كل طلب يبدو أنه يعيد 200
الأعراض: يتم تسجيل عناوين URL المفقودة والمحتوى المحظور كنجاح. السبب المحتمل: قشرة تطبيق أو قاعدة CDN أو صفحة خطأ مخصصة تعيد 404 ناعم. الإصلاح: عيّن عينات من أجسام الاستجابة والترويسات النهائية، ثم أصلح معالجة الحالة بدلاً من الاعتماد على الحالة وحدها.
الروبوتات الموثقة تتلقى قشرة فارغة
الأعراض: يعرض المتصفح المحتوى، لكن عمليات الجلب المطابقة للسجل تتلقى القليل من HTML المفيد. السبب المحتمل: تعتمد الصفحة على JavaScript من جانب العميل لا ينفذه الزاحف. الإصلاح: قارن المخرجات الخام والمقدمة وقدم المحتوى والروابط الأساسية في HTML عبر SSR أو العرض الثابت أو استراتيجية تسليم موثوقة أخرى.
مقاييس سجلات زاحف الذكاء الاصطناعي
| المقياس | ما يخبرك به | كيفية استخراجه | المعيار أو النطاق الواقعي | الإيقاع |
|---|---|---|---|---|
| الطلبات الموثقة حسب المشغّل | حجم الزحف الفعلي بعد تصفية الانتحال | مطابقة وكيل المستخدم وأدلة توثيق المشغّل، ثم تجميع الطلبات | استخدم خط الأساس الخاص بالموقع؛ تختلف الأحجام حسب الموقع والمشغّل | أسبوعيًا أو شهريًا |
| عناوين URL الأساسية الناجحة الفريدة | مدى الوصول إلى الصفحات المفيدة | تطبيع عناوين URL المطلوبة، وربط الحالة النهائية/العنوان الأساسي، وعدّ النجاحات الموثقة | قارن مع المخزون المؤهل، وليس إجمالي متغيرات URL | شهريًا |
| توزيع رموز الحالة | هدر الزحف، وفشل الوصول، والمحتوى المفقود | تجميع الطلبات الموثقة حسب حالة الاستجابة النهائية وفئة المسار | تحقق من التغييرات غير المتوقعة؛ لا تخترع نسبة عالمية | أسبوعيًا |
| البايتات أو HTML الجوهري المُسلَّم | ما إذا كانت الطلبات الناجحة تحتوي على محتوى مفيد | أخذ عينات من حجم/نص الاستجابة أو ربط بيانات التطبيق | قارن بخط الأساس للقالب؛ رمز 200 وحده غير كافٍ | عند الإصدار وشهريًا |
| علاقة الزحف بالإحالات | ما إذا كان الزحف الموثق يتزامن مع زيارات ملحوظة | مقارنة سجلات الروبوتات مع إحالات الذكاء الاصطناعي المرمزة بشكل منفصل بمرور الوقت | الارتباط وصفي، وليس دليلًا على الاقتباس أو السببية | شهريًا |
موارد تستحق وقتك
كتاباتي ذات الصلة
- كيفية إجراء تحليل ملفات سجل SEO (Ahrefs، مراجعة باتريك ستوكس وميشال بيتشانيك) — القالب الذي يعود إلى ما قبل عصر الذكاء الاصطناعي والذي تعتبر هذه المقالة تكملة خاصة بالذكاء الاصطناعي له: ما يجب قياسه، والأدوات، والتحقق من الروبوتات.
- ما هو تحليل ملفات السجل؟ (قاموس Ahrefs) — الرفيق التعريفي.
- تعرف على الزاحفين الجدد على الويب: روبوتات الذكاء الاصطناعي تقترب من روبوتات محركات البحث — تحليلي لـ Cloudflare Radar لحصة زحف روبوتات الذكاء الاصطناعي.
- روبوتات الذكاء الاصطناعي التي تحظرها ~140 مليون موقع أكثر من غيرها — بيانات معدلات الحظر في robots.txt عبر الويب المفتوح.
- 80% من حركة مرور بحث الذكاء الاصطناعي لدينا تذهب إلى صفحتنا الرئيسية وصفحات المنتجات والأدوات المجانية — تحليل على مستوى نوع الصفحة لنشاط الذكاء الاصطناعي، وهو ما يعادل “الصفحات التي يتم الزحف إليها.”
محادثاتي
- كيف يعمل البحث (SlideShare) — شرح خطوة بخطوة للزحف والعرض والفهرسة والترتيب، وهو خلفية مفيدة لفهم ما تفعله الروبوتات في سجلاتك. (ينطبق إخلاء المسؤولية الدائم: هذا هو فهمي للأنظمة، وليس ضمانًا أنها كاملة أو دقيقة 100%.)
من حول الصناعة
- لماذا يهم تحليل ملفات السجلات لزواحف الذكاء الاصطناعي وظهور البحث — لورين بوسبي (Trebletree) ، Search Engine Land: “السجلات هي الطبقة المفقودة،” نافذة الاحتفاظ، وتأطير 403/429.
- 81.8% من حركة مرور “مساعد الذكاء الاصطناعي” الخاصة بي كانت مزيفة. كان رقم Googlebot أسوأ — دوين فوريستر، Search Engine Journal: دراسة الحالة والمنهجية البارزة للتحقق من الطرف الأول.
- Perplexity، الزحف الخفي للذكاء الاصطناعي، وتأثيراته على GEO وتحليل ملفات السجلات — كلينت سبولدينج، Seer Interactive: لماذا تعود الروبوتات المحظورة لتظهر كبشر.
- كيفية مراقبة روبوتات الذكاء الاصطناعي في محلل ملفات السجلات — Screaming Frog: الجولة العملية للأداة مع التحقق عند الاستيراد.
- فجوة الزحف إلى النقر: بيانات Cloudflare حول روبوتات الذكاء الاصطناعي والتدريب والإحالات — Cloudflare: نسب الزحف إلى الإحالة على مستوى الشبكة والانقسام بين التدريب والبحث.
- هل يزحف Anthropic على البيانات من الويب؟ — وثائق Anthropic الحالية حول غرض الروبوت والتحكم في robots.
- وثائق روبوتات / زواحف OpenAI — سلاسل وكيل المستخدم وملفات IP المنشورة للتحقق.
إحصائيات تستحق الاستشهاد
- معدل الانتحال — 5,7% عبر 16 زاحف ذكاء اصطناعي. وجد تحليل HUMAN Security لمدة أسبوعين لحركة المرور التي تدعي أنها واحدة من 16 زاحف ذكاء اصطناعي معروف أن حوالي 1 من كل 18 طلبًا كان مزيفًا (مصدره البائع، تم نقله عبر SEJ).
- معدل الانتحال — 81,8% في سجلات ممارس واحد. وجد تدقيق Duane Forrester الذاتي أن 27 من 33 طلب جلب مباشر جاءت من عناوين IP لا ينشرها البائعون؛ كان رقم Googlebot الخاص به ~87% مزيفًا (SEJ).
- الزحف إلى الإحالة، ClaudeBot مقابل OpenAI. وضعت بيانات Cloudflare (أسبوع 25 مايو – 1 يونيو 2026) ClaudeBot عند ~11 122 صفحة تم الزحف إليها لكل إحالة وOpenAI عند ~857:1، مقابل Googlebot حوالي 5:1 (Cloudflare).
- التدريب يقود معظم نشاط روبوتات الذكاء الاصطناعي. وفقًا لـ Cloudflare، يقود التدريب الآن ما يقرب من 80% من نشاط روبوتات الذكاء الاصطناعي، ارتفاعًا من 72% قبل عام — سياق لسبب كون الزحف الثقيل مع صفر إحالة أمرًا طبيعيًا (Cloudflare).
- نافذة سجل حقيقية واحدة: 288 566 سطرًا، 12 099 طلب روبوت، 48 يومًا. دراسة حالة WISLR — مع اندفاع GPTBot المكون من 152 طلبًا في 3 دقائق وصفر عمليات جلب للصور/CSS/JS من ChatGPT-User (WISLR).
اختبر نفسك: تحليل سجلات زواحف الذكاء الاصطناعي
خمسة أسئلة سريعة حول سحب وقراءة سجلات روبوتات الذكاء الاصطناعي. اختر إجابة لكل سؤال، ثم تحقق.
سجل التغييرات
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.