تحليل ملفات السجل
كيفية قراءة سجلات الوصول الخام إلى خادمك لمعرفة ما جلبه Googlebot و Bingbot وزواحف الذكاء الاصطناعي فعليًا، والتحقق من الروبوتات الحقيقية، والعثور على هدر الزحف والصفحات اليتيمة، وفهم سبب كون السجلات الحقيقة التي تقاربها أدوات الزحف و Search Console فقط.
اللغات
دليل واحد في هذه الصفحة
- بيانات مصدر مرتبطةcommon-crawlers.json
تحليل ملفات السجل هو قراءة سجلات الوصول الخام وغير المأخوذة بالعينات لمعرفة عناوين URL التي جلبها Googlebot و Bingbot وزواحف الذكاء الاصطناعي، وعدد مرات الجلب ورموز الحالة. تبدأ إلزاميًا بالتحقق من هوية الروبوت عبر DNS العكسي والأمامي أو نطاقات Google المنشورة، لأن وكلاء المستخدم تُنتحل باستمرار. ثم تبحث عن هدر الزحف، والأكثر والأقل زحفًا، ورموز الحالة، والصفحات اليتيمة، ونسبة الجوال إلى سطح المكتب. تكمل السجلات إحصاءات الزحف في GSC ولا تستبدلها، وهي أنسب للمواقع الكبيرة والتجارة الإلكترونية وعمليات الترحيل.
Evidence for this claim Web-server access logs record HTTP requests and commonly include request, response-status, user-agent, and timing fields depending on configuration. Scope: Apache HTTP Server access-log behavior; other servers vary by configuration. Confidence: high · Verified: Apache HTTP Server: Log Files Evidence for this claim User-agent text alone does not authenticate Googlebot; Google recommends DNS verification or matching published IP ranges. Scope: Google crawler verification, applicable when classifying log traffic. Confidence: high · Verified: Google Search Central: Verify Googlebot Evidence for this claim Cloudflare Radar compares worldwide Cloudflare-observed bot and human HTTP requests to HTML content during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; the site's own verified logs remain the source of truth for site-specific traffic. Confidence: high · Verified: Cloudflare Radar: Bot versus human HTML trafficالخلاصة — يحتفظ خادم الويب بسجل لكل طلب يتلقاه، بما في ذلك زيارات روبوتات محركات البحث مثل Googlebot. ويعني تحليل ملفات السجل قراءة هذا السجل لمعرفة الصفحات التي جلبتها الروبوتات فعليًا، وعدد مرات الجلب، وما إذا واجهت أخطاء. إنه المكان الوحيد الذي يبين ما حدث فعلاً، لكن معظم المواقع الصغيرة لا تحتاج إليه.
The four-week chart compares automated and human requests to HTML content. Bot share is higher in the captured worldwide Cloudflare traffic period.
ما ملف السجل؟
في كل مرة يطلب فيها أي طرف — شخص أو Googlebot أو روبوت عشوائي — صفحة من موقعك، يكتب الخادم سطرًا عنها في ملف. هذا هو سجل الوصول. ويسجل كل سطر تقريبًا المعلومات نفسها:
- من أرسل الطلب (عنوان IP واسم «وكيل مستخدم» مثل
Googlebot)، - ما الذي طلبه (عنوان URL)،
- متى أرسله (طابع زمني)،
- وما الاستجابة (رمز حالة HTTP؛ مثل
200للنجاح و404لعدم العثور).
عند جمع أسابيع من هذه السطور تحصل على سجل كامل وصادق لكيفية زحف محركات البحث إلى موقعك. ليست تقديرات، بل الطلبات الفعلية.
لماذا تقرؤه؟
أدوات SEO الأخرى إما تخمّن طريقة زحف الروبوتات (فتحاكي أداة الزحف محرك بحث وتتبع الموقع)، أو تلخصها (فيعرض Google Search Console عينة مقربة). أما السجلات فتعرض الطلبات الحقيقية واحدًا واحدًا، ما يتيح الإجابة عن أسئلة مثل:
- ما الصفحات التي يزورها Googlebot فعليًا، وما الصفحات التي يتجاهلها؟
- هل يهدر الروبوت وقته على عناوين URL غير مفيدة بدل الصفحات المهمة؟
- هل يصل إلى صفحات معطلة (
404) أو أخطاء خادم (5xx)؟ - هل توجد صفحات لم تصل إليها الروبوتات قط؟
القاعدة الوحيدة التي لا يجوز تجاوزها
يمكن لأي جهة انتحال Googlebot. اسم وكيل المستخدم في سطر السجل مجرد نص؛
يستطيع كاشط وضع Googlebot فيه لتجاوز دفاعاتك. لذلك يجب التحقق من أن
الطلب صادر فعلًا من Google قبل الوثوق بأي سطر (توجد طريقة DNS بسيطة في علامتي
متقدم والنصوص البرمجية). وإلا ستبني استنتاجاتك على حركة مزيفة.
هل تحتاج إلى ذلك أصلًا؟
بصراحة، ربما لا إذا كان موقعك صغيرًا. يفيد تحليل ملفات السجل المواقع الكبيرة ذات عشرات آلاف عناوين URL، ومتاجر التجارة الإلكترونية كثيرة الصفحات المفلترة، والمواقع أثناء الترحيل، والمواقع التي يكتشف Google صفحاتها ولا يفهرسها. إذا كان لديك بضع مئات من الصفحات ويُزحف إليها جيدًا، فاستثمر وقتك في شيء آخر. وهذا هو منطق ميزانية الزحف نفسه: معظم المواقع لا تحتاج إلى القلق بشأنها.
هل تريد سير العمل الكامل للتحقق من الروبوتات والعثور على هدر الزحف والصفحات اليتيمة؟ انتقل إلى علامة متقدم.
Evidence for this claim Web-server access logs record HTTP requests and commonly include request, response-status, user-agent, and timing fields depending on configuration. Scope: Apache HTTP Server access-log behavior; other servers vary by configuration. Confidence: high · Verified: Apache HTTP Server: Log Files Evidence for this claim User-agent text alone does not authenticate Googlebot; Google recommends DNS verification or matching published IP ranges. Scope: Google crawler verification, applicable when classifying log traffic. Confidence: high · Verified: Google Search Central: Verify Googlebotالخلاصة — السجلات هي الحقيقة غير المأخوذة بالعينات عن الزحف: كل طلب وروبوت ورمز حالة. تبدأ إلزاميًا بالتحقق من Googlebot و Bingbot عبر DNS العكسي ثم الأمامي (أو نطاقات IP المنشورة من Google)، لأن وكلاء المستخدم تُنتحل باستمرار. أجرِ حسابات الزحف على المجموعة المتحقق منها فقط. ثم افحص أكثر عناوين URL والأقسام زحفًا وأقلها، والتكرار بمرور الوقت، ورموز الحالة مرتبة بالتكرار، وهدر الزحف (المعلمات والواجهات والبحث الداخلي والصفحات اللانهائية)، والصفحات اليتيمة وغير المزحوفة بمقارنتها مع زحف للموقع، ونسبة Googlebot للجوال إلى سطح المكتب. لا ينشر Bing نطاقات IP رسمية، لذلك يُستخدم DNS إلى
*.search.msn.com. تكمل السجلات إحصاءات الزحف في GSC ولا تستبدلها. وفي 2026 أصبحت روبوتات الذكاء الاصطناعي جزءًا كبيرًا من الحركة.
لماذا تمثل السجلات الحقيقة الأساسية؟
توجد ثلاث طرق «لرؤية» كيفية زحف محركات البحث، وليست متساوية:
- أداة الزحف (Screaming Frog SEO Spider أو Ahrefs Site Audit) تحاكي الزحف؛ فتبين ما يمكن للروبوت العثور عليه، لا ما جلبه Google فعليًا.
- إحصاءات الزحف في GSC تلخص الواقع، لكنها مأخوذة بالعينات ومجمعة ومحدودة (نحو 1 000 صف وحوالي 90 يومًا ومن دون تصدير لكل عنوان URL).
- سجلات الخادم تسجل الواقع: كل طلب ولكل روبوت مع عنوان URL والطابع الزمني ورمز الحالة بدقة.
يلخص دليل Ahrefs الذي راجعته الفكرة: سجلات الخادم هي “the most trustworthy source of information to understand the URLs that search engines have crawled.” (ترجمة) «المصدر الأكثر موثوقية لفهم عناوين URL التي زحفت إليها محركات البحث». لهذا توجد هذه التقنية؛ عندما أريد معرفة ما فعله Googlebot فعلًا أرجع إلى السجلات.
يحمل سطر السجل عادة عنوان IP ووكيل المستخدم ومسار URL والطابع الزمني وطريقة الطلب (GET/POST) ورمز حالة HTTP. وما يلي هو تقسيم ذكي لهذه الحقول.
متى تحتاج إليه فعلًا، ومتى لا تحتاج؟
تحليل ملفات السجل أداة للمواقع الكبيرة: عشرات آلاف عناوين URL، والتجارة
الإلكترونية والتنقل متعدد الواجهات، وعمليات الترحيل، وحالات
Discovered – currently not indexed. وكما كتبت في دليل ميزانية الزحف:
“Most sites don’t need to worry about crawl budget, but there are few cases where
you may want to take a look.” (ترجمة) «لا تحتاج معظم المواقع إلى القلق بشأن
ميزانية الزحف، لكن توجد حالات قليلة تستحق الفحص». وأشار Daniel Waisberg من Google
إلى معنى مشابه؛ فبحسب Search Engine Journal لا يشكل التقرير مصدر قلق كبير للمواقع
ذات أقل من نحو 1 000 صفحة.
إذا كان موقعك المؤلف من بضع مئات من الصفحات يُزحف إليه جيدًا، فتجاوز هذا التحليل وأصلح ما يحقق أثرًا أكبر.
كيفية الحصول على السجلات (الوصول هو الجزء الأصعب)
توجد السجلات في الطبقة التي انتهى عندها الطلب فعليًا:
- Apache و Nginx ← تنسيق Apache «المجمع» وهو الأكثر شيوعًا.
- Microsoft IIS ← تنسيق W3C.
- AWS ELB/ALB ← تنسيق ELB.
- شبكات CDN (Cloudflare و Fastly و Akamai) ← صادراتها الخاصة. في المواقع الواقعة خلف CDN يفوّت سجل الأصل وحده الطلبات المخدّمة من ذاكرة الحافة؛ لذا اسحب السجلات من الطبقة التي وصل إليها الروبوت.
استهدف 30 يومًا على الأقل و90 يومًا بصورة مثالية لالتقاط اختلاف التكرار. وتوقع احتكاكًا؛ فالوصول إلى السجلات غالبًا أصعب خطوة بسبب بوابة DevOps. حتى موظفو Google أشاروا في حلقة ترحيل من Search Off the Record إلى صعوبة الحصول عليها.
لا تسجل الملفات حركة الروبوتات فقط؛ فهي تلتقط كل طلب، وقد تحتوي قيم سلاسل الاستعلام ومعرفات الجلسات أو بيانات حساسة. وتوضح إرشادات OWASP أن بيانات اعتماد المصادقة ورموز الوصول ومعلومات التعريف الشخصية لا ينبغي أن تُسجل مباشرة عادة؛ بل تُزال أو تُقنّع أو تُجزأ. طبّق ذلك على الوصول والتصدير قبل تسليم السجل للتحليل.
الخطوة 1 — تحقق من أن الروبوتات حقيقية قبل أي شيء
لا تختصر هذه الخطوة كما تفعل أدلة كثيرة. Many bots pretend to be Googlebot to get past firewalls (ترجمة) «تتظاهر روبوتات كثيرة بأنها Googlebot لتجاوز الجدران النارية» (Ahrefs). وكيل المستخدم نص غير موثق؛ عامل كل سطر يدعي Googlebot بوصفه ادعاءً يحتاج إلى إثبات.
Googlebot — طريقتان صحيحتان:
- DNS عكسي ثم أمامي (الفحص ثنائي الاتجاه). نفذ بحثًا عكسيًا عن عنوان IP
باستخدام
host، وتأكد أن النطاق هوgooglebot.comأوgoogle.comأوgoogleusercontent.com، وأن اسم المضيف يقع ضمن*.googlebot.com، ثم ابحث أماميًا عنه وتأكد أنه يعود إلى عنوان IP الأصلي. الجولة الكاملة هي التي تمنع انتحال سجل PTR. توجد الأوامر لنظامي macOS/Linux و Windows في علامة النصوص البرمجية. - المطابقة مع نطاقات IP المنشورة من Google. تنشر Google ملفات JSON بنطاقات
CIDR:
common-crawlers.jsonللزواحف الشائعة، إلى جانبspecial-crawlers.jsonوملفات الجالبات التي يشغّلها المستخدم وgoog.json. وكما ذكرت في دليل Googlebot، قدمت Google “a list of public IPs you can use to verify the requests are from Google… You can compare this to the data in your server logs.” (ترجمة) «قائمة عناوين IP عامة للتحقق من أن الطلبات من Google ومقارنتها بسجلاتك».
Bingbot — DNS فقط. الفرق الأساسي أن Bing لا ينشر رسميًا نطاقات IP.
وتقول إرشاداته: “…like other search engines, Bing does not publish a list of IP
addresses or ranges from which we crawl the Internet” (ترجمة) «لا ينشر Bing
قائمة عناوين أو نطاقات IP التي يزحف منها» لأن “the IP addresses or ranges we use
can change any time” (ترجمة) «العناوين أو النطاقات قد تتغير في أي وقت».
لذلك استخدم DNS العكسي والأمامي إلى اسم ينتهي بـ *.search.msn.com مثل
msnbot-157-55-33-18.search.msn.com، أو أداة Verify Bingbot.
أصدرت Microsoft لاحقًا ملف JSON لعناوين bingbot، لكن الإرشاد الرسمي يظل مرتكزًا
على DNS لأن العناوين تتغير.
ثم استبعد المزيف. أجرِ كل حسابات الزحف على المجموعة المتحقق منها فقط. أما «Googlebot» غير الموثق فعادة كاشط أو انتحال، ومكانه مراجعة أمنية لا تحليل هدر الزحف.
الخطوة 2 — ما الذي تبحث عنه؟
بعد قصر البيانات على الطلبات المتحقق منها، اقرأها هكذا:
- أكثر عناوين URL والأقسام زحفًا وأقلها. رتب الطلبات حسب العنوان والدليل؛ فهذا يكشف أين تُنفق ميزانية الزحف، وغالبًا تكون النتيجة مفاجئة.
- تكرار الزحف بمرور الوقت. تتبع العنوان أو القسم لالتقاط الانخفاض (عطل بعد ترحيل) أو الارتفاع (قسم جديد أو فخ ينشئ عناوين بلا نهاية).
- رموز الحالة مرتبة بالتكرار. قارن
200بـ301/302وسلاسلهما و404و5xx. يختلف404يُطلب 5 000 مرة أسبوعيًا عن واحد طُلب مرة؛ رتب الإصلاح حسب تكرار الزحف لا مجرد وجود الخطأ. - هدر الزحف. قد تستهلك الواجهات والمعلمات والبحث الداخلي والتقاويم أو الصفحات اللانهائية حصة كبيرة؛ وتحدد السجلات الأنماط المهدرة بدقة.
- الصفحات اليتيمة وغير المزحوفة. قارن السجلات بزحف للموقع: ما في السجل وليس في الزحف قد يكون يتيمًا أو إعادة توجيه قديمة أو رابطًا خارجيًا؛ وما في الزحف وليس في السجل لم يجلبه Google.
- Googlebot للجوال مقابل سطح المكتب. افصل حسب وكيل المستخدم؛ بعد الفهرسة المتنقلة ينبغي أن تكون الغالبية للهاتف الذكي، وتستحق الغلبة المكتبية الفحص.
- زمن الاستجابة وصحة الزحف. يرتبط ارتفاع المتوسط بانخفاض الزحف. ويلخص SEJ توجيه Waisberg: “Watch out for a consistent increase in average response time. Google says it might not affect crawl rate immediately, but it’s a good indicator that your servers might not be handling all the load.” (ترجمة) «انتبه إلى الارتفاع المستمر في متوسط زمن الاستجابة؛ قد لا يؤثر فورًا في معدل الزحف لكنه مؤشر على أن الخوادم قد لا تتحمل الحمل».
ما الذي لا تخبرك به السجلات؟
حافظ على هذه الحدود حتى لا تبالغ في قراءة البيانات:
- الزحف ≠ الفهرسة. قد يجلب Googlebot عنوانًا يوميًا ويبقى غير مفهرس. تثبت السجلات الجلب فقط؛ قارنها بفهرسة الصفحات وفحص URL في GSC.
- الزحف ≠ الترتيب، والمزيد لا يساعد. كما قلت: “The rate of crawling isn’t going to impact your rankings.” (ترجمة) «معدل الزحف لن يؤثر في ترتيبك». لا تتعامل مع حجم الزحف كرافعة ترتيب.
noindexلا يقلل الزحف. فهو يتحكم في الفهرسة؛ لإيقاف الزحف استخدم robots.txt أو رمز حالة مناسبًا.- الزحف ≠ تدريب النموذج أو الاستشهاد. يثبت الطلب المتحقق منه من GPTBot أو ClaudeBot أو PerplexityBot حدوث الجلب فقط، لا استخدام الصفحة في التدريب أو الاحتفاظ بها أو الاستشهاد بها في إجابة. هذه نتائج منفصلة غير مرصودة.
تعقيد 2026: روبوتات الذكاء الاصطناعي تملأ السجلات
تغيرت الشخصيات في السجل الحديث. في تحليلي لبيانات Cloudflare Radar (تعرّف إلى زواحف الويب الجديدة)، لا تزال روبوتات محركات البحث الأكثر زحفًا، لكن روبوتات الذكاء الاصطناعي في المركز الثاني بوضوح وقد تتجاوزها خلال عامين. تظهر GPTBot و ClaudeBot و PerplexityBot بكثافة، لذلك قد تنافس حصتها محركات البحث عند تقسيم الطلبات الموثقة. وقد أضاف Screaming Frog Log File Analyser شرحًا مخصصًا لمراقبتها.
كيف يتصل ذلك ببقية موضوع الزحف؟
السجلات هي طبقة التشخيص تحت مجموعة الزحف كلها؛ بها تقيس إنفاق ميزانية
الزحف التي يعرّفها Gary Illyes بأنها “the number of URLs Googlebot can and is
willing or is instructed to crawl” (ترجمة) «عدد عناوين URL التي يستطيع Googlebot
زحفها ويرغب فيه أو يُطلب منه زحفها». وهي تكشف فخاخ العناكب بوصفها سيلًا من
عناوين متشابهة من تقويم أو واجهة، وتبين هل غيّرت أعمال تكرار الزحف مثل lastmod
الصحيح والروابط الداخلية سلوك الروبوت. وهي تكمل ولا تستبدل إحصاءات الزحف في GSC:
التقرير مدخل مأخوذ بالعينات، والسجلات تفاصيل غير مأخوذة بالعينات لكل روبوت وعنوان.
ملخص الذكاء الاصطناعي
خلاصة مركزة لنسخة متقدم:
- السجلات هي الحقيقة الأساسية. أدوات الزحف تحاكي و GSC يأخذ عينات، بينما تسجل سجلات الوصول كل طلب وروبوت وعنوان وطابع ورمز حالة.
- تحقق قبل التحليل. وثق Googlebot عبر DNS العكسي والأمامي أو JSON لنطاقات
Google، و Bingbot عبر DNS إلى
*.search.msn.com(لا ينشر Bing نطاقات رسمية). احسب على المجموعة الموثقة فقط. - اقرأ: الأكثر والأقل زحفًا، والتكرار الزمني، ورموز الحالة مرتبة بالتكرار، ومنها 404، والهدر، والصفحات اليتيمة وغير المزحوفة، ونسبة الجوال إلى سطح المكتب، وزمن الاستجابة.
- لا تبالغ: الزحف لا يساوي الفهرسة أو الترتيب، و
noindexلا يوقفه، وطلب روبوت ذكاء اصطناعي يثبت الجلب لا التدريب أو الاستشهاد. - النطاق: أداة للمواقع الكبيرة والتجارة الإلكترونية والترحيل؛ لا تحتاجها معظم المواقع الصغيرة.
- 2026: أصبحت GPTBot و ClaudeBot و PerplexityBot حصة كبيرة ومتنامية.
- تكمل إحصاءات الزحف في GSC؛ استخدم الاثنين.
الوثائق الرسمية
وثائق المصادر الأولية للتحقق من الزواحف وقراءة بيانات الزحف.
- التحقق من طلبات زواحف Google وجالباتها — الطريقتان الرسميتان: DNS العكسي والأمامي يدويًا أو المطابقة مع النطاقات المنشورة.
- كيفية التحقق من Googlebot (مدونة Search Central) — المقالة الأقدم المرافقة.
- common-crawlers.json — عناوين Googlebot والزواحف الشائعة بتنسيق CIDR؛ ومعها special-crawlers.json وuser-triggered-fetchers.json وgoog.json.
- نظرة عامة على زواحف Google وجالباتها — وكلاء المستخدم الذين قد تراهم.
- تقرير إحصاءات الزحف ومدونة إطلاقه — العرض الرسمي المأخوذ بالعينات الذي تكمله السجلات.
Bing / Microsoft
- كيفية التحقق من Bingbot — صفحة التحقق الرسمية.
- كيفية التحقق من أن Bingbot هو Bingbot — طريقة DNS العكسي والأمامي الأساسية وتصريح عدم نشر النطاقات.
- أداة Verify Bingbot — الصق عنوان IP للتحقق.
اقتباسات من المصدر
تصريحات موثقة؛ يقفز كل رابط عميق، حيثما أمكن، إلى موضع الاقتباس.
Google — التحقق من الزواحف
- “Run a reverse DNS lookup on the accessing IP address from your logs, using the
hostcommand.” (ترجمة) «نفّذ بحث DNS عكسيًا على عنوان IP الذي دخل من سجلاتك باستخدام الأمرhost». — وثائق Google Search Central. انتقل إلى الاقتباس - “Verify that the domain name is either
googlebot.com,google.com, orgoogleusercontent.com.” (ترجمة) «تحقق من أن اسم النطاق واحد من هذه النطاقات». انتقل إلى الاقتباس - “Run a forward DNS lookup on the domain name retrieved in step 1 using the
hostcommand on the retrieved domain name.” (ترجمة) «نفّذ بحث DNS أماميًا عن اسم النطاق المستخرج في الخطوة الأولى». انتقل إلى الاقتباس - “Verify that it’s the same as the original accessing IP address from your logs.” (ترجمة) «تحقق من مطابقته عنوان IP الأصلي في السجلات». انتقل إلى الاقتباس
Bing — التحقق وعدم نشر نطاقات IP
- “Perform a reverse DNS lookup using the IP address from the logs to verify that it resolves to a name that end with search.msn.com.” (ترجمة) «نفّذ بحث DNS عكسيًا باستخدام عنوان IP من السجلات وتأكد أن الاسم ينتهي بـ search.msn.com». — مدونة Bing Webmaster. انتقل إلى الاقتباس
- “…like other search engines, Bing does not publish a list of IP addresses or ranges from which we crawl the Internet.” (ترجمة) «لا ينشر Bing قائمة عناوين أو نطاقات IP للزحف»؛ والسبب: “the IP addresses or ranges we use can change any time, so responding to requests differently based on a hardcoded list is not a recommended approach.” (ترجمة) «قد تتغير في أي وقت، لذلك لا يوصى بالاستجابة وفق قائمة ثابتة». انتقل إلى الاقتباس
Patrick Stox — وظيفة السجلات (من عملي في Ahrefs)
- سجلات الخادم هي “the most trustworthy source of information to understand the URLs that search engines have crawled.” (ترجمة) «المصدر الأكثر موثوقية لفهم العناوين التي زحفت إليها محركات البحث». انتقل إلى الاقتباس
- “Many bots pretend to be Googlebot to get past firewalls.” (ترجمة) «تتظاهر روبوتات كثيرة بأنها Googlebot لتجاوز الجدران النارية». انتقل إلى الاقتباس
- “If you want to see hits from all bots and users, you’ll need access to your log files.” (ترجمة) «لرؤية طلبات جميع الروبوتات والمستخدمين تحتاج إلى الوصول إلى ملفات السجل». انتقل إلى الاقتباس
- “The rate of crawling isn’t going to impact your rankings.” (ترجمة) «معدل الزحف لن يؤثر في ترتيبك». انتقل إلى الاقتباس
Gary Illyes من Google — ميزانية الزحف التي تقيسها السجلات
- ميزانية الزحف هي “the number of URLs Googlebot can and is willing or is instructed to crawl.” (ترجمة) «عدد عناوين URL التي يستطيع Googlebot زحفها ويرغب فيه أو يُطلب منه زحفها». اقرأ التغطية
Daniel Waisberg من Google — زمن الاستجابة إشارة إلى صحة الزحف (صياغة SEJ لتوجيهه)
- “Watch out for a consistent increase in average response time. Google says it might not affect crawl rate immediately, but it’s a good indicator that your servers might not be handling all the load.” (ترجمة) «انتبه إلى الارتفاع المستمر في متوسط زمن الاستجابة؛ قد لا يؤثر فورًا في معدل الزحف لكنه مؤشر جيد على أن الخوادم قد لا تتحمل الحمل». انتقل إلى الاقتباس
تحقق من أن الروبوت هو Googlebot الحقيقي (DNS عكسي وأمامي)
وكيل المستخدم مجرد نص، وتنتحل الكواشط Googlebot. الفحص الموثوق هو DNS ثنائي الاتجاه: ابحث عكسيًا عن IP، وتأكد أن اسم المضيف من نطاق Google، ثم ابحث عنه أماميًا وتأكد أنه يعود إلى عنوان IP نفسه.
macOS / Linux (uses host)
# 1) Reverse DNS the IP from your logs — it must end in googlebot.com,
# google.com, or googleusercontent.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows (uses nslookup)
:: 1) Reverse DNS the IP — confirm it ends in a Google domain
nslookup 66.249.66.1
:: 2) Forward DNS the returned hostname — confirm it matches the original IP
nslookup crawl-66-249-66-1.googlebot.comإذا لم يصل البحث العكسي إلى نطاق Google أو لم يُعد البحث الأمامي عنوان IP
الأصلي، فالطلب ليس Googlebot. ولبوت Bingbot نفذ الخطوتين نفسيهما وتوقع
اسمًا ينتهي بـ search.msn.com. ويمكن بدل DNS مطابقة العنوان مع نطاقات Google
المنشورة في common-crawlers.json بتنسيق CIDR.
استخراج طلبات الزواحف وعدّها من سجل خام
أوامر سريعة لسجل وصول Apache/Nginx بالتنسيق المجمع. تختار السطور بحسب وكيل المستخدم؛ تحقق من عناوين IP قبل الوثوق بالأعداد.
# Pull only the lines claiming to be Googlebot
grep -i "googlebot" access.log > googlebot-hits.log
# Count Googlebot hits per URL, most-crawled first
# (combined format: $7 is the request path)
grep -i "googlebot" access.log \
| awk '{print $7}' \
| sort | uniq -c | sort -rn | head -50
# Count Googlebot hits per status code (combined format: $9 is the status)
grep -i "googlebot" access.log \
| awk '{print $9}' \
| sort | uniq -c | sort -rn
# List the URLs Googlebot hit that returned a 404, by frequency
grep -i "googlebot" access.log \
| awk '$9 == 404 {print $7}' \
| sort | uniq -c | sort -rn
# Get the unique IPs claiming Googlebot — the list you then verify by DNS
grep -i "googlebot" access.log | awk '{print $1}' | sort -uعدّل موضعي الحقلين $7 و$9 إذا اختلف تنسيق السجل؛ فـIIS/W3C و ELB يرتبان الحقول بطريقة أخرى.
سير عمل تحليل ملفات السجل
- احصل على السجلات — سجلات الوصول أو صادرات CDN/موازن الحمل؛ واسحب سجل الحافة إذا كان الموقع خلف CDN.
- خذ نافذة كافية — 30 يومًا على الأقل و90 بصورة مثالية.
- تحقق من الروبوتات أولًا — DNS عكسي وأمامي أو نطاقات Google؛ و Bingbot إلى
*.search.msn.com. - استبعد المزيف — احسب على المجموعة الموثقة وأرسل الانتحال إلى مراجعة أمنية.
- رتب الأكثر والأقل زحفًا من عناوين وأقسام.
- تتبع التكرار بمرور الوقت لالتقاط انخفاضات الترحيل وارتفاعات الفخاخ.
- احصِ رموز الحالة —
200وسلاسل301-302و404و5xxورتب بالتكرار. - ابحث عن الهدر — المعلمات والواجهات والبحث الداخلي والصفحات أو التقاويم اللانهائية.
- اعثر على اليتيم وغير المزحوف بمقارنة السجلات مع زحف للموقع.
- افحص نسبة Googlebot للجوال إلى سطح المكتب؛ ينبغي أن تكون الغالبية للهاتف الذكي.
- راقب متوسط زمن الاستجابة؛ قد يخفض اتجاه صاعد الزحف.
- قسّم روبوتات الذكاء الاصطناعي مثل GPTBot و ClaudeBot و PerplexityBot.
- أكد عبر GSC باستخدام إحصاءات الزحف وفحص URL؛ فالزحف لا يساوي الفهرسة.
ما الذي تنشئه في ورقة التحليل؟
سواء استخدمت Screaming Frog Log File Analyser أو BigQuery أو قالب Ahrefs، فأنت تبني العروض نفسها. بعد التحقق من الروبوتات، حلل كل سطر إلى أعمدة وجداول محورية.
الأعمدة المستخرجة من كل سطر
| العمود | موضعه في السجل | أهميته |
|---|---|---|
| عنوان IP | $1 (التنسيق المجمع) | ما تتحقق منه عبر DNS أو نطاق IP |
| هل هو موثق؟ | مشتق | رشّح كل جدول إلى الموثق فقط |
| الروبوت / وكيل المستخدم | سلسلة UA | فصل Googlebot للجوال وسطح المكتب وروبوتات AI |
| مسار URL | $7 | تجميع الزحف حسب العنوان والدليل |
| القسم / الدليل | مشتق من المسار | تجميع إنفاق الزحف حسب جزء الموقع |
| الطابع الزمني | حقل [date] | تتبع التكرار بمرور الوقت |
| الطريقة | GET/POST | اكتشاف أنماط الطلب الغريبة |
| رمز الحالة | $9 | تقسيم 200 و3xx و404 و5xx |
الجداول المحورية المطلوبة
- مرات الزحف لكل URL ولكل دليل تنازليًا.
- مرات الزحف لكل رمز حالة، ثم الرمز × URL لإبراز
404المتكرر. - مرات الزحف لكل يوم/أسبوع حسب القسم.
- مرات الزحف لكل روبوت/وكيل مستخدم لعرض الجوال/سطح المكتب وحصة AI.
- ربط السجلات مع الزحف عبر VLOOKUP أو دمج تصدير Screaming Frog/Ahrefs لإظهار اليتيم وغير المجلوب.
يوفر دليل Ahrefs قالبًا قابلًا للتنزيل لهذه العروض؛ ويربطه دليل تحليل ملفات السجل.
كيفية قراءة ملف سجل: ما الذي تبحث عنه؟
إطار متكرر لأي تحليل: تحقق أولًا، ثم نفذ الجولات الآتية.
1. تحقق ثم حلل. جودة البيانات تساوي جودة هوية الروبوت. استخدم DNS العكسي والأمامي أو نطاقات IP، وحلل المجموعة الموثقة فقط. الروبوت المنتحل يذهب إلى الأمن لا SEO.
2. أين تُنفق الميزانية؟ (الأكثر والأقل زحفًا.) رتب حسب URL والقسم للعثور على الاهتمام المصروف في المكان الخطأ والصفحات المهمة التي لا تحصل على ما يكفي.
3. إلى ماذا تصل الروبوتات؟ (رموز الحالة حسب التكرار.) 200 صحي؛ وسلاسل 3xx و404 و5xx تسريبات. رتب بحسب عدد مرات الوصول لا مجرد وجود الخطأ.
4. ما الذي يُهدر؟ (هدر الزحف.) المعلمات والتنقل متعدد الواجهات والبحث الداخلي والصفحات أو التقاويم اللانهائية مصارف كلاسيكية؛ وتسمي السجلات الأنماط المخالفة.
5. ما المفقود؟ (اليتيم وغير المزحوف.) قارن السجل بزحف: ما في السجل لا الزحف يتيم أو تحويل قديم أو رابط خارجي؛ وما في الزحف لا السجل لم يجلبه Google.
6. من يزحف؟ (تقسيم الروبوتات.) افصل Googlebot للجوال وسطح المكتب، ثم حصة روبوتات الذكاء الاصطناعي التي تنافس محركات البحث.
7. هل الخادم سليم؟ (زمن الاستجابة.) ارتفاع المتوسط إنذار مبكر لاحتمال خفض الزحف.
أدوات تحليل ملفات السجل
- Screaming Frog SEO Log File Analyser — أداة سطح المكتب الأساسية؛ تتحقق تلقائيًا من روبوتات البحث وتكشف عناوين IP المنتحلة، وتوفر مرشحات User-Agent و Verification-Status. استورد زحف SEO Spider واستخدم “Not In URL Data” للعثور على اليتيم: “URLs which were discovered in your logs, but are not present in the crawl data imported.” (ترجمة) «عناوين اكتُشفت في السجلات وليست في بيانات الزحف المستوردة». ولها دليل مراقبة روبوتات AI. الأداة
- BigQuery ومعه Splunk / ELK Stack / Logflare / logz.io — للتخزين والاستعلام واسع النطاق.
- Ahrefs — لمقارنة السجلات بزحف Site Audit والعثور على اليتيم وتأكيد ما وصل إليه الروبوت.
- Semrush Log File Analyzer وOnCrawl وBotify وJetOctopus — منصات أخرى، والثلاثة الأخيرة للمؤسسات.
- GSC Crawl Stats — مدخل رسمي مجاني مأخوذ بالعينات؛ مكمل للسجلات لا بديل عنها.
- Verify Bingbot — الصق IP للتحقق: bing.com/toolbox/verify-bingbot.
أخطاء يجب تجنبها
- الثقة في نص
Googlebotبلا تحقق. الخطأ: وكيل المستخدم نص غير موثق ويمكن لأي جهة انتحاله. البديل: DNS عكسي وأمامي أو نطاقات Google قبل إدخال السطر في الحساب. - اعتبار GSC Crawl Stats الصورة الكاملة. الخطأ: مأخوذ بالعينات ومقرب ومحدود بنحو 1 000 صف و90 يومًا بلا تصدير لكل URL. البديل: اجعل السجلات الحقيقة و GSC مدخلًا مكملًا.
- سحب سجل الأصل فقط خلف CDN. الخطأ: يفوّت كل طلب خدمته ذاكرة الحافة. البديل: اسحب من طبقة CDN/الحافة التي وصل إليها الروبوت.
- إصلاح
404و5xx بحسب الوجود لا التكرار. الخطأ: طلب شهري لا يساوي 5 000 طلب أسبوعيًا. البديل: رتب رموز الحالة بحسب عدد الطلبات. - مطاردة حجم الزحف كأنه رافعة ترتيب. الخطأ: المزيد لا يرفع الترتيب؛ إنه إشارة تشخيصية. البديل: استخدم التكرار لاكتشاف الانخفاض والفخاخ، لا كمؤشر يجب تعظيمه.
- استخدام
noindexلإيقاف الزحف. الخطأ: يتحكم في الفهرسة ويجب على Google الجلب لرؤيته. البديل: استخدم robots.txt أو رمز حالة إذا كان الهدف منع الزحف. - تسمية عنوان «يتيمًا» من السجل وحده. الخطأ: قد يكون تحويلًا قديمًا أو رابطًا خارجيًا. البديل: قارنه بزحف حديث قبل الاستنتاج.
مؤشرات الأداء الدائمة لتحليل السجلات
حصة الروبوتات المتحقق منها
- المقياس: طلبات Googlebot/Bingbot الموثقة ÷ كل الطلبات التي تدعيهما في وكيل المستخدم.
- ما يبينه: مقدار الحركة المنسوبة للروبوتات وهي في الواقع كواشط منتحلة.
- طريقة الاستخراج: مرر كل IP عبر DNS العكسي والأمامي أو JSON للنطاقات واحسب النجاح.
- المعيار: لا رقم عالمي؛ تعتمد النتيجة على شدة الكشط. الانخفاض هو الإشارة، لا حد ثابت.
- الدورية: مع كل نافذة سجلات جديدة.
حصة هدر الزحف
- المقياس: نسبة طلبات الروبوت الموثقة إلى المعلمات والواجهات والبحث الداخلي والصفحات أو التقاويم اللانهائية.
- ما يبينه: مقدار الميزانية المصروفة على عناوين غير مفيدة.
- طريقة الاستخراج: قسم الطلبات الموثقة حسب أنماط URL وسلاسل الاستعلام ومسارات البحث.
- المعيار: لا رقم عالمي؛ أنشئ خط أساس لموقعك وتتبع الاتجاه.
- الدورية: نافذة 30–90 يومًا وبعد تنظيف robots.txt أو المعلمات أو الصفحات.
مزيج رموز الحالة مرجحًا بالتكرار
- المقياس: حصة
200و3xxو404و5xxمن طلبات الروبوت الموثقة. - ما يبينه: أين تُهدر الطلبات على أخطاء وهل يزداد الوضع سوءًا.
- طريقة الاستخراج: احصِ حقل الحالة في السطور الموثقة.
- المعيار: لا هدف عالمي؛ راقب الاتجاه، وارتفاع
404/5xxإشارة قابلة للعمل. - الدورية: 30–90 يومًا أو فورًا بعد الترحيل.
نسبة Googlebot للجوال إلى سطح المكتب
- المقياس: حصة طلبات Googlebot الموثقة من وكيل Smartphone مقابل Desktop.
- ما يبينه: هل يزحف Google إلى الموقع وفق الهاتف أولًا كما هو متوقع.
- طريقة الاستخراج: قسم وكيل Googlebot إلى Smartphone و Desktop.
- المعيار: ينبغي أن تكون الغالبية للهاتف الذكي في معظم المواقع؛ الغلبة المكتبية تستحق الفحص وليست فشلًا وحدها.
- الدورية: كل نافذة سجلات.
عدد الصفحات اليتيمة وغير المزحوفة
- المقياس: العناوين في السجل لا الزحف، والعناوين في الزحف لا السجل.
- ما يبينه: الصفحات صعبة الوصول والصفحات المرتبطة التي لم يجلبها Google.
- طريقة الاستخراج: اربط قائمة عناوين الطلبات الموثقة بتصدير زحف من Screaming Frog أو Ahrefs.
- المعيار: يعتمد على الحجم وعمر الترحيل؛ تتبع العدد بمرور الوقت بدل مقارنته برقم خارجي.
- الدورية: ربع سنوية للمواقع الكبيرة أو فورًا بعد الترحيل.
مطالبات جاهزة للنسخ لتحليل السجلات
هذه المطالبات لتفسير بيانات استخرجتها وتحققت منها، لا لتوليد بيانات سجل؛ لا تسمح للذكاء الاصطناعي باختراع السطور أو الإحصاءات.
لخّص هدر الزحف من عينة URL
Here is a list of URL paths that verified Googlebot hits landed on, one per
line, from my server logs. Group them into patterns (query parameters,
faceted navigation, internal search, pagination/calendars, or "looks like a
real page"), and tell me which pattern has the most URLs. Don't invent URLs
that aren't in the list — only group what I've pasted.
[paste your URL list here]المتوقع: مجموعات مسماة مع أعداد وتحديد أكبر مرشح لهدر الزحف؛ اعتبره نقطة بداية للتحقق من المسارات الفعلية لا حكمًا نهائيًا.
رتب تفصيل رموز الحالة
I have this table of HTTP status codes and how many times verified Googlebot
hit each one over the last 30 days. Rank them by which I should fix first,
weighting frequency over severity — a 404 hit 5,000 times matters more than a
500 hit twice. Explain the reasoning in one line per row.
status_code, hit_count
[paste your table here]المتوقع: الصفوف نفسها مرتبة بحسب أولوية الإصلاح مع سبب موجز؛ راجع المنطق وفق سياق موقعك.
اكتب طلب وصول إلى السجلات لفريق DevOps
Write a short, plain-English email to my DevOps/hosting team asking for
30-90 days of raw web server access logs (Apache/Nginx combined format, or
our CDN's edge logs if we're behind one) for [site name]. Explain in one
sentence why I need it (verifying real Googlebot/Bingbot crawl activity vs
GSC's sampled report) and ask what export format and delivery method works
for them.المتوقع: مسودة قصيرة تضيف إليها اسم الموقع وتراجعها قبل الإرسال؛ الأداة لا ترسل نيابة عنك.
اشرح نتيجة التحقق عبر DNS
I ran a reverse DNS lookup on an IP from my server logs and then a forward
DNS lookup on the hostname it returned. Here's the raw output from the
`host` command. Tell me plainly whether this confirms the request came from
real Googlebot or Bingbot, and point to exactly which line proves or
disproves it.
[paste your host/nslookup output here]المتوقع: حكم واضح مرتبط بسطر محدد؛ اعتبره رأيًا ثانيًا، والقاعدة هي نطاق Google/Bing وعودة البحث الأمامي إلى عنوان IP الأصلي.
موارد تستحق وقتك
كتاباتي ذات الصلة
- كيفية إجراء تحليل SEO لملفات السجل [قالب] — دليل Ahrefs الأساسي الذي يستند إليه هذا المقال.
- متى ينبغي القلق بشأن ميزانية الزحف؟ — متى يستحق التحليل وقتك.
- ما Googlebot وكيف يعمل؟ — خلفية الزواحف والتحقق من IP.
- تعرّف إلى الزواحف الجديدة — سبب اختلاف سجلات 2026.
- دليل المبتدئين إلى SEO التقني — موضع الزحف والسجلات في الصورة الكبرى.
محاضراتي
- كيف يعمل البحث (SlideShare) — شرح للزحف و Googlebot بوصفه أكثر من 1 000 نظام وزواحف متخصصة تتشارك ميزانية واحدة، وهو فحص معقول للسجل إلى جانب التحقق الصحيح لا بدلًا منه. تنبيه دائم: «هذا فهمي للأنظمة ولن يكون كاملًا أو دقيقًا 100%.»
من الآخرين
- دليل مستخدم Screaming Frog Log File Analyser ودليل روبوتات AI.
- دليل Search Engine Land لتحليل السجلات بقلم Kody Wirth.
- Search Engine Journal عن إحصاءات الزحف وتوجيه Daniel Waisberg.
- Search Engine Journal عن الفهرسة وميزانية الزحف مع Gary Illyes و Martin Splitt.
- Search Engine Roundtable عن عناوين Bingbot — دقة ملف JSON مقابل إرشاد DNS.
- Conductor عن تحليل السجلات — شرح مبسط.
- r/TechSEO — مجتمع تشخيص الزحف والفهرسة.
مقاطع فيديو
- Google Search Central على YouTube — شروح Martin Splitt للزحف والعرض وسلسلة كيف يعمل بحث Google؛ خلفية مفيدة عن الروبوتات التي تتحقق من طلباتها. القناة
اختبر نفسك
خمسة أسئلة عن التحقق من الروبوتات وقراءة ما تثبته السجلات فعلًا.
سجل التغييرات
تم التحديث في 22 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 9 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 30 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 18 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.