تحليل سجلات زاحف الذكاء الاصطناعي

كيفية سحب سجلات الخادم أو CDN وتحليل نشاط بوتات الذكاء الاصطناعي — التحقق من GPTBot وClaudeBot وPerplexityBot ضد الانتحال، واختيار أداة، وقراءة تكرار الزحف، والزحف مقابل العرض، ورموز الحالة.

نُشر أول مرة: 3 يوليو 2026 · آخر تحديث: 6 أغسطس 2026 · Advanced
اللغات
دليل واحد في هذه الصفحة

تحليل سجلات زاحف الذكاء الاصطناعي هو كيفية فحص — باستخدام سجلات الطرف الأول الخاصة بك، وليس لوحة تحكم البائع — أي بوتات الذكاء الاصطناعي المزعومة طلبت موقعك وما أعاده الخادم. التحقق خاص بالمزود: تنشر OpenAI ملفات نطاقات IP خاصة بالبوت، وتنشر Anthropic قائمة bots.json الحالية المشتركة؛ وكيل المستخدم بدون طريقة تحقق رسمية حالية يظل ادعاءً، وليس هوية موثقة. حافظ على الاعتماد على HTML الخام كمخاطرة ملحوظة بدلاً من التأكيد على أن كل زاحف رئيسي للذكاء الاصطناعي لا يشغل JavaScript أبدًا؛ تصف أنماط طلبات الأصول العينة المقاسة، وليس عقدًا عامًا للمُصيِّر. لا يزال تكرار الزحف لا يتنبأ بالاستشهاد — الاسترجاع ضروري ولكنه غير كافٍ. تتدرج الأدوات من grep إلى Screaming Frog LFA إلى ELK/Splunk إلى BigQuery/Cloudflare.

الخلاصة — اسحب سجلات الوصول الخاصة بـ Apache/Nginx أو CDN، ثم افعل أربعة أشياء: تحقق (طابق وكيل المستخدم وأكد عنوان IP مقابل القائمة المنشورة لكل مشغل — تتراوح معدلات الانتحال من 5,7% لدى HUMAN Security إلى 81,8% التي اختبرها Duane Forrester بنفسه) ؛ اختر أداة حسب الحجم (grep → Screaming Frog Log File Analyser → ELK/Splunk → BigQuery/Cloudflare) ؛ قس تكرار الزحف حسب الروبوت، والصفحات التي تتم زيارتها، والزحف مقابل العرض، ورموز الحالة؛ وفسر بصدق — الاسترجاع ضروري لكنه غير كافٍ، لذا فإن “المزيد من الزحف = المزيد من الاستشهادات” غير مثبت. هذه هي الطريقة الشقيقة لـ زاحفو الذكاء الاصطناعي (التي تمتلك ما هي الروبوتات) ، وإسناد حركة مرور الذكاء الاصطناعي (جانب النقر) ، ورؤية LLM (الإطار المسترجع ← المذكور ← المستشهد به الذي تراقب هذه الصفحة مرحلته الأولى).

ما تمتلكه هذه المقالة — وما لا تمتلكه

تُظهر السجلات الطلبات، وليس ما إذا كان المحتوى مستخدمًا للتدريب أو الاسترجاع أو الإجابة. Evidence for this claim Server access logs record requests and can include fields such as request path, status, referrer, and user agent. Scope: Apache HTTP Server logging; available fields depend on server configuration. Confidence: high · Verified: Apache: Log files تحقق من الروبوتات باستخدام الآليات المنشورة من المزود حيثما كانت متاحة، وعامل الإسناد كدليل محدود. Evidence for this claim OpenAI publishes user-agent tokens and controls for several of its crawlers. Scope: OpenAI's documented crawlers; a user-agent string is not proof of downstream training, retrieval, citation, or use. Confidence: high · Verified: OpenAI: Crawlers

مقالة زواحف الذكاء الاصطناعي الشقيقة تمتلك بالفعل جدول الزواحف واحدًا تلو الآخر، والتصنيف ثلاثي الفئات (التدريب / البحث بالذكاء الاصطناعي / الجلب المباشر بواسطة المستخدم) ، والتمييز بين أن Google-Extended رمز وليس زاحفًا، ووصفات robots.txt. لن أعيد اشتقاق أي من ذلك هنا. إسناد حركة مرور الذكاء الاصطناعي يمتلك جانب GA4/المُحيل — ما أرسله الزاحف بالعودة. هذه المقالة هي الجانب المقابل من القمع: ما أخذه الزاحف. ورؤية LLM تمتلك إطار العمل المسترجع ← المذكور ← المُستشهد به؛ تحليل السجلات هو كيف تلاحظ مرحلة المسترجع تحديدًا، ولا شيء بعدها.

هذه هي التتمة في عصر الذكاء الاصطناعي لتحليل سجلات SEO الكلاسيكي. عندما راجعتُ مقالة Ahrefs How to Do an SEO Log File Analysis ، كانت الأبعاد هي تكرار الزحف، وعناوين URL التي تم الزحف إليها، ورموز الحالة، والتحقق من الزواحف مقابل عناوين IP المنشورة من Google. نفس الهيكل هنا — لكنه موجه نحو مجموعة زواحف لا تعرض JavaScript في الغالب، ويتم انتحالها باستمرار، وتزحف في دفعات غير منتظمة بدلاً من تدفق ثابت.

الخطوة 1 — احصل على سجلاتك

سجلاتك موجودة في أحد مكانين، أو كليهما:

  • سجلات الخادم الأصلي. Apache (access.log) ، أو Nginx (access.log) ، أو خادم التطبيق الخاص بك. يحتوي كل سطر على الأقل على: الطابع الزمني، وعنوان IP للعميل، وطريقة الطلب + المسار، ورمز الحالة، والبايتات، والمُحيل، ووكيل المستخدم.
  • سجلات CDN / الحافة. إذا كنت خلف Cloudflare أو Fastly أو Akamai وما إلى ذلك، فإن الكثير من حركة مرور الزواحف تتم معالجتها عند الحافة وقد لا تصل أبدًا إلى خادمك الأصلي — لذا فإن سجل الحافة هو السجل الأكثر اكتمالاً. يكشف Cloudflare عن ذلك عبر Logpush (وواجهة برمجة تطبيقات GraphQL) ؛ وFastly عبر بث السجلات في الوقت الفعلي.
Evidence for this claim Server access logs record requests and can include fields such as request path, status, referrer, and user agent. Scope: Apache HTTP Server logging; available fields depend on server configuration. Confidence: high · Verified: Apache: Log files

الحقول التي تحتاجها فعليًا لتحليل زواحف الذكاء الاصطناعي: الطابع الزمني، وعنوان IP للعميل، ووكيل المستخدم، ومسار الطلب، ورمز الحالة ، ومن الأفضل أيضًا البايتات والمُحيل.

المشكلة العملية هي الاحتفاظ. يحتفظ العديد من المضيفين بسجلات لبضعة أيام فقط. مقالة Lauren Busby في Search Engine Land تسمي الحل مباشرة — السحب المجدول يحول نافذة قصيرة إلى شيء يمكن تحليله بمرور الوقت: وظيفة SFTP مجدولة، مبنية في أداة سير عمل مثل n8n أو مكتوبة كنص برمجي، كافية لتحويل نافذة احتفاظ قصيرة إلى شيء يمكنك تحليله فعليًا بمرور الوقت (Busby, SEL). قم بإعداد ذلك قبل أن تحتاج إلى البيانات.

حد صادق واحد يجب أن تضعه في الاعتبار من البداية: كما تقول Busby، تُظهر لك ملفات السجلات ما وصل إلى موقعك، لكنها لا تُظهر لك دائمًا ما حاول الوصول (SEL) — الطلبات المحظورة أو التي تمت معالجتها في مكان آخر قد لا تظهر على الإطلاق.

الخطوة 2 — تحقق قبل أن تثق في وكيل المستخدم

هذه هي الخطوة التي تفصل تحليل سجلات زواحف الذكاء الاصطناعي عن النسخة الكلاسيكية، والخطوة التي تتجاهلها معظم الأدلة المنافسة. سلاسل وكيل المستخدم سهلة الانتحال بشكل تافه. نقطتا بيانات مستقلتان حول مدى سوء الأمر:

  • HUMAN Security حللت أسبوعين من حركة المرور التي تدعي أنها واحدة من 16 زاحفًا معروفًا للذكاء الاصطناعي ووجدت أن 5,7% منها كانت منتحلة — أي ما يقرب من 1 من كل 18 طلبًا (تم الإبلاغ عنه عبر SEJ).
  • Duane Forrester أجرى نفس الفحص على سجلاته الخاصة ووجد نتائج أسوأ بكثير. من بين 33 طلبًا يحمل اسم جلب مباشر، جاء ستة من عنوان IP تنشره الشركة المصنعة وسبعة وعشرون لم تأتِ — أي معدل انتحال 81,8% بين الطلبات التي تمكن من فحصها (SEJ). وكان رقم Googlebot لديه أسوأ من ذلك: من بين 799 طلبًا يحمل اسم Googlebot، جاء 107 فقط من عنوان Google موثق — أما الـ 87% الأخرى تقريبًا فلم تكن من Google (SEJ).

تعامل مع هذه الأرقام كمؤشرات اتجاهية من عينات ومنهجيات مختلفة، وليس كرقم عالمي واحد. الأهم من ذلك، لا تعمم طريقة التحقق من مزود واحد على كل الروبوتات. بعض المشغلين ينشرون نطاقات عناوين IP؛ وآخرون يوثقون رموز وكيل المستخدم دون نطاق عام حالي أو عقد تحقق DNS (SEJ).

طريقة التحقق:

  1. طابق سلسلة وكيل المستخدم. يعرّف GPTBot عن نفسه على أنه Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.3; +https://openai.com/gptbot; يحمل OAI-SearchBot وChatGPT-User رموزهما الخاصة (وثائق روبوتات OpenAI).
  2. استخدم طريقة التحقق الرسمية الحالية من المزود عندما تكون موجودة. توفر OpenAI openai.com/gptbot.json ، searchbot.json ، و chatgpt-user.json. توثيق الزاحف الحالي من Anthropic يقول إن العنوان في قائمتها المنشورة يشير إلى أن الزاحف قادم من Anthropic. استخدم تلك الطريقة الخاصة بالمزود الحالية؛ ولا تعممها كقاعدة عالمية للتحقق من الروبوتات.
  3. لا تخترع حلاً بديلاً. التحقق العكسي ثم الأمامي من DNS صالح لمزود فقط عندما ينشر ذلك المزود نمط اسم المضيف وإجراءات التحقق. تطابق PTR عام يثبت السيطرة على DNS، وليس هوية الروبوت المزعومة. يمكن لمحلل ملفات السجل من Screaming Frog تطبيق القوائم المؤكدة علنًا عند توفرها؛ وتقوم ميزة التحقق عند الاستيراد بإجراء بحث مقابل قوائم IP المؤكدة علنًا لتأكيد أن الروبوتات حقيقية (Screaming Frog).

يجب أن يوجه التحقق سياسة دقيقة واستجابة للحوادث. فضّل رمز الروبوت الموثق من المزود لسياسة الزحف؛ واحتفظ بضوابط الشبكة لحالات إساءة الاستخدام أو الأمان وسمها بشكل منفصل عن الامتثال لروبوتات.

الخطوة 3 — اختر أداتك

قم بتوسيع نطاقها حسب حجم المهمة، تقريبًا من المجاني إلى المدفوع، ومن الحقيقة الأرضية إلى المُدار:

  • grep / PowerShell — عدّ سريع لمرة واحدة ومرشّح يتحقق من التحقق. مقال زواحف الذكاء الاصطناعي يحتوي على مقتطف العد الأساسي للبوتات؛ وعلامة التبويب Scripts هنا توسّعه ليشمل التحقق من IP، وتفصيل رموز الحالة، وكشف الزحف مقابل العرض.
  • Screaming Frog Log File Analyser — أداة استيراد سطح مكتب مع إعدادات مسبقة مدمجة لبوتات الذكاء الاصطناعي (GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, PerplexityBot, Perplexity-User, CCBot) وتبديل “Verify Bots When Importing”. تعرض علامة التبويب Response Codes تفاصيل 2XX/3XX/4XX/5XX لكل عنوان URL، وتعرض علامة التبويب User Agents الطلبات ومعدلات الأخطاء لكل بوت، وترتب علامة التبويب URLs حسب Num Events (الصفحات الأكثر جلبًا) ، وتتيح لك علامة التبويب IPs التحقيق في المصادر المشبوهة (برنامج تعليمي).
  • ELK Stack (Elasticsearch / Logstash / Kibana) أو Splunk — للاستيعاب المستمر على نطاق أوسع مع لوحات المعلومات والتنبيهات، عندما تصبح أداة سطح المكتب ذات الاستيراد الواحد بطيئة جدًا أو تريد مراقبة مستمرة بدلاً من تصديرات دورية.
  • BigQuery — للاحتفاظ طويل الأمد والاستعلام بـ SQL على نطاق واسع، ويُغذّى عادةً عبر Cloudflare Logpush أو سحب GraphQL مجدول من مجموعة بيانات httpRequestsAdaptiveGroups الخاصة بـ Cloudflare، بحيث يمكنك الاستعلام عن نشاط البوت حسب الصفحة والتاريخ ورمز الحالة دون إعادة استيراد ملفات مسطحة.
  • Cloudflare AI Crawl Control (للمواقع خلف Cloudflare) — لوحة تحكم مُدارة لنشاط الزاحف وأنماط الطلبات، والتحقق من البوت، وتتبع الامتثال للتوجيهات، دون بناء خط أنابيب خاص بك (الوثائق).

الخطوة 4 — ما الذي يجب قياسه وكيفية قراءته

تكرار الزحف حسب البوت. عدد الزيارات في اليوم/الأسبوع لكل اسم بوت. تزحف بوتات الذكاء الاصطناعي في دفعات، وليس في تدفقات ثابتة. في دراسة حالة سجلات CDN التي استمرت 48 يومًا من WISLR، كان GPTBot غائبًا لأسابيع، ثم سجّل 187 طلبًا في أسبوع واحد — 152 منها في دفعة مدتها ثلاث دقائق، بذروة 114 طلبًا/الدقيقة (WISLR). اقرأ التكرار كنمط، وليس مجرد إجمالي.

أي الصفحات تتلقى الزيارات — وأيها المهم لا يتلقاها. رتّب حسب عدد الطلبات. يلاحظ Busby أن زواحف الذكاء الاصطناعي تبقى غالبًا سطحية — من الشائع رؤيتها مقتصرة على الصفحات عالية المستوى: الصفحة الرئيسية، والتنقل الأساسي، وعدد صغير من عناوين URL عالية المستوى (SEL) — وتنخفض بشكل حاد للصفحات العميقة حتى عندما تكون تلك الصفحات العميقة الأكثر أهمية للاستشهاد. الصفحة العميقة التي لا تظهر أبدًا في السجلات لا يمكن استرجاعها.

الاعتماد على HTML الخام — قِس، ولا تعمّم. لا تقدم وثائق المزود عقدًا مشتركًا لعرض JavaScript لـ GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot وغيرها من الوكلاء. توقيع واحد ملاحظ لا يزال مفيدًا: في عينة WISLR، جلب ChatGPT-User HTML فقط — صفر طلبات للصور أو CSS أو ملفات JS — بينما سحب Googlebot وOAI-SearchBot الصور أيضًا (WISLR). إذا أظهرت سجلاتك بوتات ذكاء اصطناعي تضرب صفحات يكون HTML الخام فيها غلاف JS شبه فارغ، فهذا خطر اعتماد قابل للفحص، وليس دليلًا على أن كل مزود يتصرف دائمًا بهذه الطريقة. قارن HTML المُسلَّم بالنتائج أو باختبارات الجلب الخاصة بالمزود. (بالنسبة لأساسيات العرض، انظر JavaScript SEO.)

تفصيل رمز الحالة / الحظر. راقب: 200 (نجاح) ، 304 (غير معدّل — جيد، إعادة زحف فعّالة) ، 404 (روابط معطلة تبعها البوت) ، و403/429 (محظور / محدود المعدل). يذكر Busby تحديدًا أن ملفات السجلات تُظهر حيث يواجه الزاحفون مشكلات، بما في ذلك استجابات 403 (طلبات محظورة) و429 (تحديد معدل) (SEL). تحقق مما إذا كان هذا الحظر مقصودًا أم حادثًا.

robots.txt وllms.txt كإشارة خاصة بهما. تحقق من أي الروبوتات تطلب /robots.txt قبل الزحف على الإطلاق — في عينة WISLR، لم يتحقق GPTBot وMeta-WebIndexer منه عبر 48 يومًا — وما إذا كانت المسارات المحظورة تُزار رغم ذلك. كما سجلت WISLR صفر طلبات إلى /llms.txt من أي روبوت ذكاء اصطناعي خلال تلك الأيام الـ48 (WISLR) ، بما يتوافق مع النتيجة القائلة بأن حوالي 97% من المحتوى غير مقروء والمغطاة في مقالة زاحفات الذكاء الاصطناعي. لا تتوقع طلبات llms.txt في سجلاتك كدليل على أنها “تعمل”.

هل يعني المزيد من الزحف المزيد من الاستشهادات؟ كن صادقًا.

لا توجد بيانات راسخة تدعم “ازحف أكثر، احصل على استشهادات أكثر.” الاسترجاع هو شرط ضروري للاستشهاد لكنه بعيد كل البعد عن كونه كافيًا — الصفحات تُزحف باستمرار ولا تُستشهد بها أبدًا، سواء بسبب العرض من جانب العميل، أو الجدران المدفوعة، أو المحتوى الرقيق أو المكرر، أو ببساطة الخسارة أمام مصدر أفضل في خطوة الاسترجاع/الترتيب في النموذج. الإطار الأساسي موجود في مقالة رؤية LLM: مسترجَع → مذكور → مُستشهَد به ، وتحليل السجلات يراقب فقط تلك المرحلة الأولى.

الطريقة لإغلاق الحلقة بصدق هي الجمع بين جانب إدخال الزحف (سجلاتك) وجانب إخراج الاستشهادات. تقرير أداء الذكاء الاصطناعي في Bing (معاينة عامة، فبراير 2026) هو أول أداة رسمية تكشف بيانات الاستشهادات إلى جانب استعلامات التأسيس الخاصة بها — العبارات الرئيسية التي استخدمها الذكاء الاصطناعي عند استرجاع المحتوى الذي تمت الإشارة إليه في الإجابات المولدة بالذكاء الاصطناعي (Bing Webmaster Blog). السجلات تخبرك بما تم أخذه؛ استعلامات التأسيس وعدد الاستشهادات تخبرك بما نتج عن ذلك. لا شيء منهما وحده يمثل الصورة الكاملة — راجع مركز القياس وإعداد التقارير لفهم كيفية تراكم هذه الطبقات.

تعقيد الزحف الخفي

التحقق ليس تدقيقًا لمرة واحدة. وفقًا لكلينت سبولدينغ من Seer Interactive، بمجرد حظرها، يمكن للزاحفات الخفية أن تظهر مجددًا تحت ترويسات متصفح عامة وعناوين IP غير مرتبطة — هذه الجلسات تبدو بشرية في السجلات، مما يعني تضخم عدد الجلسات، وعدم احتساب حركة مرور الروبوتات بشكل كافٍ، وتصبح تجزئة GEO أقل موثوقية (Seer). ملخصه المباشر: إذا لم تتمكن من رؤية هذه الزاحفات الخفية، فلن تتمكن من قياس تأثيرها. هذا هو بالضبط سبب حاجة تحليل السجلات إلى إعادة تحقق وإعادة معايرة دورية، وليس مجرد تمريرة واحدة.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.