الحظر بسبب الوصول الممنوع (403)
ما معنى حالة «الحظر بسبب الوصول الممنوع (403)» في تقرير فهرسة الصفحات في Google Search Console، ولماذا يحصل Googlebot على 403 بينما لا يحصل عليه متصفحك، وكيف تختلف عن 401، وكيف تشخّصها وتصلحها وتتحقق من الإصلاح.
اللغات
عدد الأدلة في هذه الصفحة: 2
- بيانات مصدر مرتبطةgooglebot.json
- أداة مباشرة ذات صلةHTTP Status & Redirect Checker
تعني حالة «الحظر بسبب الوصول الممنوع (403)» في تقرير فهرسة الصفحات في GSC أن Googlebot زحف عنوان URL وأعاد خادمك HTTP 403. لن تفهرس Google الصفحة، وتزيلها إن كانت مفهرسة. تصف مساعدة فهرسة الصفحات لدى Google 403 بأنها بيانات اعتماد قُدمت ثم رُفضت — وهذه صياغة تقرير Google لا التعريف الكامل؛ إذ يعرّف RFC 9110 403 على نحو أوسع وقد لا تتعلق الحالة ببيانات الاعتماد. إذا كان العنوان عامًا وقابلًا للفهرسة، فتعامل مع 403 كمشكلة ينبغي اكتشافها؛ وإذا كان خاصًا عمدًا فقد تكون 403 تؤدي وظيفتها — أصلح إشارات الاكتشاف بدلًا من ذلك. وبالنسبة إلى العناوين العامة، يُبلّغ كثيرًا عن جدار حماية أو CDN أو WAF بوصفه السبب، وهو ما يفسر تحميل الصفحة عندك وعودة 403 لدى Google. تتعامل Google مع 401 و403 بالطريقة نفسها للفهرسة، وتقول لا تستخدم أيًا منهما للحد من الزحف — استخدم 429 أو 503. تحقق من Googlebot الحقيقي (DNS عكسي/نطاقات IP المنشورة/فئة العميل الصحيحة) قبل السماح، وقيد أي استثناء، ثم أكد 200 عبر URL Inspection وValidate Fix.
الخلاصة — تعني حالة «الحظر بسبب الوصول الممنوع (403)» في Google Search Console أن Googlebot حاول قراءة صفحتك فقال خادمك: «لا، ليس مسموحًا لك» (HTTP 403). لن تُفهرس الصفحة. وإذا كان يفترض أن تكون عامة، فهذه مشكلة ينبغي إصلاحها — وغالبًا ما يكون جدار حماية أو CDN أو إضافة أمان تحظر Google بالخطأ، ولذلك تبدو الصفحة سليمة في متصفحك لكنها محجوبة عن Google. أما إذا كان من المفترض أن تبقى خاصة، فقد تكون 403 تؤدي وظيفتها تمامًا — وعندها يختلف الإصلاح.
ما الذي تعنيه هذه الحالة
تعني تسمية التقرير أن Google تلقّت استجابة HTTP 403 أثناء طلب عنوان URL. Evidence for this claim The Page Indexing report identifies URLs where Google encountered a forbidden-access response. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report وتتعامل Google مع استجابات 4xx المستمرة، باستثناء 429، بوصفها محتوى غير متاح للفهرسة. Evidence for this claim Google treats 4xx responses other than 429 as if the content does not exist for indexing. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: HTTP status codes
عندما تفتح تقرير فهرسة الصفحات في Search Console وترى «Blocked due to access forbidden (403)»، فالمعنى بسيط: طلب Googlebot الصفحة من خادمك، فرفض الخادم الطلب بخطأ 403 Forbidden.
بما أن Google تلقت 403، فلا تستطيع قراءة محتوى الصفحة، ولذلك لن تفهرسها — وإذا كانت الصفحة موجودة في Google من قبل، فستسقط من النتائج.
هل ينبغي إصلاحها فعلًا؟
قبل ملاحقة قاعدة معينة، قرر ما الذي يفترض أن يفعله عنوان URL:
- يفترض أن يكون عامًا وقابلًا للفهرسة — 403 خطأ. واصل القراءة؛ فبقية الصفحة هي مسار الإصلاح.
- يفترض أن يكون عامًا لكن غير قابل للفهرسة — لا تعتمد على robots.txt لهذا الغرض؛ فحظر robots.txt حاجز منفصل له سبب تقرير خاص، ولا يستطيع وحده إنتاج HTTP 403. أرسل الاستجابة العادية
200واستخدم توجيهnoindexبدلًا منه. - يفترض أن يبقى خاصًا — قد تكون 403 وسيلة تحكم صحيحة وعاملة في الوصول. الإصلاح ليس قاعدة الجدار الناري، بل التأكد من أن عنوان URL غير موجود في خريطة موقعك أو روابطك الداخلية حيث تستمر Google في اكتشافه.
لماذا تُحمّل عندك ولا تُحمّل لدى Google؟
هذا هو الجزء المربك في حالة الصفحة «العامة المفترض أن تكون كذلك». تنقر عنوان URL في متصفحك فيُحمّل بلا مشكلة، فكيف تحصل Google على حجب 403؟
يرسل متصفحك إشارات لا يرسلها الزاحف: cookies، وuser-agent لمتصفح «عادي»، والقدرة على اجتياز التحدي (في حواجز JavaScript أو CAPTCHA). ويبدو طلب Googlebot مختلفًا عادةً في معظم هذه الجوانب — بلا cookies ومع user-agent لزاحف — وهو ما يكفي غالبًا لتشغيل قاعدة روبوتات موجهة إلى أدوات الكشط على الزاحف وحده بينما يمر الزوار الحقيقيون. الصفحة ليست معطلة غالبًا؛ بل تحظر قاعدةٌ الزائر الخطأ. (توضح العدسة المتقدمة طريقة تأكيد الفرق الدقيق بدل التخمين.)
جدار الحماية أو CDN سبب يُبلّغ عنه كثيرًا
بالنسبة إلى عناوين URL التي ينبغي أن تكون عامة، يُعد جدار الحماية أو CDN أو أداة الأمان (مثل Cloudflare أو WAF أو إضافة أمان WordPress) التي تحظر Googlebot بالخطأ أحد الأسباب التي يُبلّغ عنها كثيرًا — مع عدم وجود رقم مستقل متحقق منه يبين معدل حدوثه بالضبط. وتشمل الأسباب الأخرى قواعد الحجب حسب user-agent أو البلد، وحماية hotlink، ووضع محتوى خلف تسجيل دخول رغم أنه يفترض أن يكون عامًا.
كيف تبدأ الإصلاح
- في Search Console، استخدم URL Inspection على عنوان URL متأثرًا وانقر Test live URL للتأكد من أن Google تتلقى 403 فعلًا.
- افحص إعدادات CDN أو الجدار الناري أو إضافة الأمان (وسجلاتها) بحثًا عن أي شيء يحظر Googlebot أو نطاقات IP الخاصة به.
- تأكد من أنه Googlebot فعلًا قبل السماح له، وأبقِ الاستثناء ضيقًا — أي للمسار والقاعدة المحددين، لا سماحًا شاملًا. تنتحل روبوتات كثيرة اسم Googlebot. (توضح علامتا Advanced وScripts طريقة التحقق.)
- بعد إصلاح القاعدة، ينبغي أن تعيد الصفحة استجابة عادية
200. ثم استخدم Validate Fix في التقرير — تحدث إعادة الفهرسة تلقائيًا بعد إعادة زحف Google للاستجابة 200، مع عدم وجود جدول زمني مضمون.
ومن الحالات الشقيقة التي ينبغي معرفتها: “Blocked due to unauthorized request (401)” — وهي الفكرة نفسها لكن للصفحات خلف جدار تسجيل الدخول. الآلية مختلفة والنتيجة واحدة والإصلاح متشابه في الغالب.
تريد حلقة التشخيص والإصلاح الكاملة، وتفاصيل WAF، وأوامر التحقق من Googlebot؟ انتقل إلى علامة Advanced.
الخلاصة — تعني 403 في تقرير فهرسة الصفحات أن Googlebot تلقى HTTP 403 لعنوان URL، لذلك لن تفهرسه Google (وتزيله إن كان مفهرسًا). تصف مساعدة فهرسة الصفحات لدى Google حالة 403 على أنها بيانات اعتماد قُدمت ثم رُفضت — وهذه صياغة التقرير لدى Google، لا التعريف الكامل لـHTTP؛ إذ يعرّف RFC 9110 حالة 403 على نحو أوسع بأنها «فهم الطلب ثم رفضه»، مع بيانات اعتماد أو من دونها، لذلك تعامل صياغة Google معاملة الإرشاد لا البرهان على سوء الإعداد. قرر أولًا هل ينبغي أن يكون عنوان URL عامًا وقابلًا للفهرسة أصلًا — فبالنسبة إلى العناوين العامة، يُبلّغ كثيرًا عن جدار حماية/CDN/WAF يحظر Googlebot دون قصد، وهو ما يفسر تحميل الصفحة عندك وعودة 403 لدى Google؛ لكن 403 على عنوان يفترض أن يبقى خاصًا قد تعمل كما صُممت. تتعامل Google مع 401 و403 بالطريقة نفسها للفهرسة، وتقول صراحةً لا تستخدم 401/403 للحد من معدل الزحف — استخدم 429 (أو 503). تحقق من Googlebot الحقيقي (reverse DNS / نطاقات IP المنشورة / فئة العميل الصحيحة) قبل السماح، وقيد أي استثناء بالمسار والقاعدة المحددين، ثم أكد 200 عبر URL Inspection → Test live URL وشغّل Validate Fix.
ماذا تقول Google فعلًا عن 403 — وماذا يقول HTTP فعلًا؟
تبلغ التسمية عن الاستجابة المرصودة، لا عن WAF أو CDN أو قاعدة الوصول المحددة التي سببتها. Evidence for this claim The Page Indexing report identifies URLs where Google encountered a forbidden-access response. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report وتأتي نتيجة الفهرسة من معالجة Google العامة لأخطاء 4xx. Evidence for this claim Google treats 4xx responses other than 429 as if the content does not exist for indexing. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: HTTP status codes
تصف وثائق تقرير فهرسة الصفحات لدى Google الحالة هكذا: يعني HTTP 403 أن user agent قدم بيانات اعتماد لكنه لم يُمنح الوصول — لكن Googlebot لا يقدم بيانات اعتماد أبدًا، ولذلك تقول Google إن خادمك يعيد الخطأ على نحو غير صحيح. لن تُفهرس الصفحة. وإذا أردت فهرستها، فإصلاح Google هو إما السماح للمستخدمين غير المسجلين أو السماح صراحةً بطلبات Googlebot بلا مصادقة.
هذه صياغة وثيقة المساعدة لدى Google، لكنها ليست تعريف HTTP الكامل. يعرّف RFC 9110 حالة 403 على نحو أوسع: فهم الخادم الطلب ورفض تنفيذه. وقد تكون بيانات الاعتماد جزءًا من السبب — لكن RFC تصرح بأن الطلب قد يكون محظورًا لأسباب لا علاقة لها ببيانات الاعتماد إطلاقًا: سياسة، أو قاعدة تحكم في الوصول، أو قرار أمني من edge، أو أي سبب يختاره مالك الخادم. لذلك ليست الخلاصة المفيدة «كل 403 إلى Googlebot يعني قاعدة معطلة بالتعريف»، بل «اكتشف هل يفترض أن يكون هذا العنوان قابلًا للوصول، ثم اعثر على القاعدة الدقيقة التي أعادت 403». وفي صفحة يفترض أن تكون عامة وقابلة للفهرسة، تكون 403 إلى Googlebot غالبًا شيئًا يجب إصلاحه. أما الصفحة الخاصة أو المحظورة عمدًا، فقد تكون 403 قرار وصول صحيحًا وعاملًا — وتكون المشكلة عادة أن Google ما كان ينبغي أن تكتشف عنوان URL أصلًا (انظر فحص النية أدناه)، لا أن الجدار الناري خاطئ.
مهما كانت الحالة، توضح وثائق Google المنفصلة لحالات HTTP نتيجة الفهرسة بصرامة: لا تستخدم محتوى عناوين URL التي تعيد رموز 4xx، وتُعامل جميع أخطاء 4xx باستثناء 429 بالطريقة نفسها (يبلغ الزاحف النظام التالي بأن المحتوى غير موجود)، كما أن مسار الفهرسة يزيل عنوان URL من الفهرس إذا كان مفهرسًا سابقًا. Evidence for this claim Google treats 4xx responses other than 429 as if the content does not exist for indexing. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: HTTP status codes
قرر ما الذي يفترض أن يفعله عنوان URL قبل إصلاح أي شيء
لا تحتاج كل صفوف هذا التقرير إلى الإصلاح نفسه. صنّف عنوان URL ضمن أربع مجموعات أولًا:
- عام ومقصود فهرسته. 403 غير مقصودة — اعمل عبر حلقة التشخيص ← الإصلاح ← التحقق أدناه.
- عام لكن غير مقصود فهرسته. لا تلجأ إلى robots.txt لحل ذلك — فحظر robots.txt حاجز زحف منفصل له سبب «blocked by robots.txt» في فهرسة الصفحات؛ ولا ينتج HTTP 403 الذي يبلغ عنه هذا الصف. أرسل الاستجابة العادية
200واستخدم توجيهnoindex(أو إعادة توجيه/إزالة صحيحة) بدلًا منه. - خاص أو محظور عمدًا. قد تكون 403 نتيجة صحيحة مقصودة لمورد لا ينبغي للطالب الوصول إليه. وإذا ظهرت في هذا التقرير، فالمشكلة العملية عادة أن العنوان قابل للاكتشاف — في خريطة موقعك أو روابطك الداخلية أو غير ذلك — لا أن قاعدة الوصول خاطئة. نظّف إشارة الاكتشاف بدل فتح الباب.
- عنوان لا ينبغي أن يوجد، أو لا تريد تأكيد وجوده. اختر الاستجابة وفق سياسة أمان التطبيق، لا وفق اختصار SEO — فكل من 403 (أو 404 إذا كنت لا تريد تأكيد وجود العنوان) يمكن أن يكون مشروعًا هنا. Evidence for this claim A robots.txt disallow is a separate crawl gate and Page indexing reason; it does not itself generate the HTTP 403 response required for the Blocked due to access forbidden (403) reason. Scope: verified Search Console properties Confidence: high · Verified: Page indexing report
كل ما يلي يفترض الحالة الأولى: عنوان URL تريد فعلًا زحفه وفهرسته.
403 مقابل 401 — كيف تميزهما؟
هاتان حالتان شقيقتان في التقرير، وتطمس معظم الشروحات الفرق بينهما بقاعدة عامة («403 = لا توجد بيانات اعتماد مطلوبة، 401 = جدار تسجيل دخول») لا يمكن الاعتماد عليها وحدها — فقد تعيد طبقة مصادقة مهيأة خطأً 403 أيضًا، وتضعه في هذا الصف. الاستجابة نفسها هي الإشارة الحقيقية:
- 401 (غير مصرح به) — وفق RFC 9110، يعني 401 تحديدًا افتقاد بيانات اعتماد مصادقة صالحة، ويجب أن تحمل الاستجابة ترويسة تحدي
WWW-Authenticate(مصادقة HTTP أو جدار تسجيل دخول). لقد أُبلغت Google بأنها تحتاج إلى المصادقة ولم تستطع ذلك. - 403 (الوصول ممنوع) — رفض أوسع. يعرّفه RFC 9110 بأنه “the server understood the request but refuses to fulfill it,” (الترجمة العربية) «فهم الخادم الطلب لكنه يرفض تنفيذه»، مع بيانات اعتماد أو من دونها. عمليًا، يكون هذا الصف غالبًا حجبًا من جدار حماية/CDN/WAF أو قاعدة أمان، لكنه قد يكون أيضًا تطبيقًا يعيد 403 بسبب فحص مصادقة معطل، أو محدد معدل، أو قرار تحكم في الوصول مقصودًا. Evidence for this claim A 401 response means valid authentication credentials are missing and must include a WWW-Authenticate challenge; a 403 is a refusal that can occur with or without credentials. Scope: 401 and 403 responses Confidence: high · Verified: RFC 9110: HTTP Semantics
لكي تميز بينهما في عنوان URL معين، افحص الحالة والترويسات المعادة — هل تحمل الاستجابة ترويسة WWW-Authenticate؟ — بدل افتراض الآلية من تسمية التقرير وحدها. النتيجة واحدة (لا فهرسة) وغالبًا ما يتداخل الإصلاح (السماح لـGooglebot المتحقق منه أو فتح المحتوى للمستخدمين المجهولين)، لذلك طبّق حلقة التشخيص نفسها على أي من الصفين بعد معرفة ما تراه.
ماذا تفعل 403 بالفهرسة؟
تترتب ثلاثة أشياء بعد حصول Googlebot على 403:
- يُتجاهل المحتوى. لا تستخدم Google محتوى عناوين URL ذات رموز
4xx، لذلك لا يمكن فهرسة شيء من الصفحة. - يُزال العنوان إذا كان مفهرسًا. قد تزيل 403 صفحة كانت تتصدر النتائج سابقًا — فالمشكلة ليست «لن تُضاف» فقط، بل «ستسقط».
- ينخفض تكرار الزحف. تزحف Google إلى عناوين URL ذات
4xxتدريجيًا مرات أقل مع الوقت، لذلك تُزار 403 طويلة الأمد أقل وتتعافى أبطأ بعد إصلاحها.
لماذا يحصل Googlebot على 403 بينما لا يحصل عليه متصفحك؟
هذا هو السؤال الذي يدور بالناس في حلقات. تُحمّل الصفحة في متصفحك، إذن يبدو أن المحتوى سليم — لكن Google تبلغ عن 403. والتفسير المرجح أن متصفحك وGooglebot يرسلان طلبات مختلفة جدًا، وقد تشغل قاعدة إدارة روبوتات مبنية لإيقاف أدوات الكشط للزاحف بينما تخدم البشر طبيعيًا — لكن تعامل مع ذلك على أنه فرضية تحتاج إلى تأكيد لا نتيجة محسومة، لأن السمة المهمة تختلف من موقع إلى آخر:
- يرسل متصفحك cookies وuser-agent حقيقيًا لمتصفح ويمكنه حل تحدي JavaScript أو CAPTCHA؛ أما طلب Googlebot فعادة لا يحمل ذلك — لا cookies، وuser-agent لزاحف، ولا يستطيع حل تحدٍّ تفاعلي (مع أن Google-InspectionTool يصير JavaScript فعلًا ويبلغ عن الناتج المصيّر، لذلك ليست عبارة “Googlebot has no JavaScript” (الترجمة العربية) «Googlebot لا يملك JavaScript» دقيقة لكل جزء).
- وبعيدًا عن اختلافات العميل، قد يختلف الطلبان أيضًا في عنوان IP/الفئة المصدرية، والجغرافيا، والطريقة، وreferrer، وحالة الذاكرة المؤقتة، والقاعدة التي أطلقت الحجب — وقد يكون أي واحد منها هو المحفز الحقيقي.
لا تخمّن أي سمة سببت الحجب. قارن سجلات edge وorigin الدقيقة لطلب محجوب فعلي بسجل زيارة متصفح عادية — معرّف القاعدة نفسه، وترويسات الاستجابة، والطريقة، وUA، وعنوان IP المصدر وفئته المتحققة، والجغرافيا، وcookies، وreferrer، وحالة الذاكرة المؤقتة، ونتيجة التحدي — وغيّر سمة واحدة كل مرة حتى تجد ما يقلب الاستجابة. هكذا تؤكد أن 403 انتقائية بدل افتراض ذلك.
الأسباب الشائعة
- إدارة روبوتات CDN/WAF. قد تتحدى Cloudflare (Bot Fight Mode / Super Bot Fight Mode وBrowser Integrity Check وManaged Challenge) أو Akamai أو Imperva/Incapsula أو Sucuri أو AWS WAF العملاء غير المتصفحين، بما في ذلك Googlebot، أو تعيد لهم 403. بالنسبة إلى عناوين URL العامة، هذا أحد الأسباب التي يُبلّغ عنها كثيرًا، وغالبًا ما يكون غير مقصود — مع عدم وجود رقم مستقل متحقق منه يحدد نسبة الحالات التي يفسرها.
- جدار خادم/قواعد أمان. قد تعتبر mod_security أو OWASP CRS أو fail2ban أو الجدران النارية على مستوى المضيف نمط Googlebot مسيئًا.
- قواعد user-agent أو referrer أو hotlink. قواعد تعيد 403 لأي طلب يفتقد user-agent أو referrer شبيهًا بالمتصفح.
- حجب جغرافي أو IP. استبعاد نطاقات IP التي يزحف منها Googlebot (يزحف Googlebot أساسًا من عناوين IP أمريكية)، بحيث يلتقطه حجب بلد دون ضجيج.
- جدران تسجيل الدخول أو بيانات الاعتماد. طلب cookies أو تسجيل دخول لرؤية محتوى يفترض أن يكون عامًا — وهذا يتداخل مع حالة 401.
- قواعد تحديد معدل تعيد 403 بعد N طلبات. لا تفعل ذلك — انظر أدناه.
لا تستخدم 403 لخنق Googlebot
هذه هي الممارسة المضادة التي تستحق التسمية. يعيد أشخاص (وبعض شبكات CDN) حالات 403 أو404 لإبطاء Googlebot وتقليل حمل الخادم. وقد أوضحت Google أن ذلك لا يعمل ولا ينبغي فعله: لا تستخدم رمزي الحالة 401 و403 للحد من معدل الزحف. لا أثر لهما في معدل الزحف — بل يزيلان الصفحة من الفهرس. وإذا كنت تحتاج حقًا إلى تراجع Googlebot، فأعد 429 (أو خطأ 5xx مثل 503)؛ فهذه الرموز تقرؤها Google باعتبارها «تمهل»، ويكون أثرها مؤقتًا لا دائمًا.
كيف تشخّص الحالة
- URL Inspection → Test live URL. مرر عنوان URL متأثرًا عبر Search Console واستخدم Test live URL للتأكد من أن Google تتلقى 403 حاليًا (لا تقريرًا قديمًا). وتذكر أن هذا الاختبار هو Google-InspectionTool، أي عميل Google محدد — ونجاح الاختبار يعني أن InspectionTool عبر في تلك اللحظة، لا أن Googlebot المجدول سيسلك مسار WAF أو الجغرافيا أو الذاكرة المؤقتة أو تحديد المعدل نفسه في زحفه التالي.
- أعد الإنتاج كـGooglebot. لا تختبر من متصفحك المعتاد — اجلب عنوان URL مع user-agent الخاص بـGooglebot، ويفضل من خارج شبكتك ومن أكثر من منطقة (تزحف Google غالبًا من عناوين IP أمريكية، لكنها قد تنتقل إلى دول أخرى إذا حُجبت طلبات الولايات المتحدة، لذلك لا يثبت نجاح منطقة واحدة الوصول العالمي)، لتشغيل القاعدة نفسها. (الأوامر في علامة Scripts.)
- اقرأ سجلات CDN/WAF/الجدار الناري. اعثر على القاعدة الدقيقة التي أطلقت على طلب Googlebot — وقارن ترويسات الاستجابة ومعرّف القاعدة والمحفز (user-agent أو IP أو التحدي أو تحديد المعدل) بسجل زيارة المتصفح العادية بدل افتراض السمة التي سببت الحجب.
- تحقق من Googlebot الحقيقي وفئته. قبل السماح لأي شيء، أكد أن الطلبات Googlebot فعلًا عبر DNS عكسي ثم أمامي أو نطاقات IP المنشورة لدى Google، وافحص أي عميل Google أنشأ الطلب — فـGooglebot العادي والزواحف الخاصة وجالبات المستخدم (مثل Google-InspectionTool) تستخدم أقنعة مضيف وقوائم IP مختلفة، وقد يجعل التحقق مقابل القائمة الخطأ طلبًا حقيقيًا يبدو منتحلًا.
كيف تصلح الحالة
- قيد استثناءً ضيقًا لـGooglebot المتحقق منه في WAF/الجدار الناري — عبر الهوية المتحققة (DNS عكسي ثم أمامي، مع مطابقة فئة العميل الصحيحة) أو نطاقات IP الحالية المنشورة لزواحف Google، لا عبر الثقة بسلسلة user-agent وحدها. أبقِ الاستثناء ضيقًا: للمسارات المحددة التي تحتاجه وللقاعدة المحددة التي تحجب، مع إبقاء ضوابط الأمان الأخرى وحدود المعدل والتسجيل، وتعيين تاريخ انتهاء/مراجعة حتى لا تبقى قائمة سماح قديمة بعد زوال سببها. اطلب من مزود CDN/الجدار تأكيد السماح لـGooglebot، وأتمت فحص قواعد الحجب مقابل الشبكات الفرعية الحالية المنشورة من Google حتى لا تعيد ترقية نطاق IP مستقبلية الحجب دون ملاحظة.
- افتح المحتوى العام للمستخدمين المجهولين. إذا جاءت 403 من متطلب تسجيل دخول/cookie على محتوى يفترض أن يكون عامًا، فأزل المتطلب (وهذا أيضًا الإصلاح المشترك مع حالة 401 الشقيقة).
- استبدل تحديد معدل 403 بـ429. إذا أعادت قاعدة 403 بعد حد من الطلبات، فغيّرها لتعيد 429 (أو 503) حتى تقرأ Google «تمهل» بدل «ابتعد».
تحقق من الإصلاح وأعد الفهرسة
بمجرد إصلاح القاعدة، ينبغي أن يعيد عنوان URL الاستجابة 200. ثم:
- URL Inspection → Test live URL للتأكد من أن الاستجابة الحية تعيد الآن
200. - اطلب الفهرسة لعناوين URL ذات الأولوية، و/أو انقر Validate Fix على صف «Blocked due to access forbidden (403)» في تقرير فهرسة الصفحات.
- تحدث إعادة الفهرسة تلقائيًا بعد أن تعيد Google زحف استجابة
200— ولا يوجد ضمان رسمي لسرعتها بالضبط، وما زال على العنوان اجتياز زحف عادي قبل أن يعود. لا تحتاج إلى تشغيل أي شيء يدويًا بعد إزالة الحجب وتأكيد الاستجابة السليمة ومنح Google وقتًا لإعادة الزحف. Evidence for this claim The Page Indexing report identifies URLs where Google encountered a forbidden-access response. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report
لمعرفة الصورة الأوسع لأسباب عدم الفهرسة التي تظهر هنا وطريقة تجميع التقرير لها، راجع نظرة عامة على تقرير فهرسة الصفحات؛ أما الحالة الشقيقة، «Blocked due to unauthorized request (401)»، فهي نسخة 401 من المشكلة نفسها.
ملخص الذكاء الاصطناعي
خلاصة مركزة من النسخة المتقدمة:
- ما هي؟ «Blocked due to access forbidden (403)» في تقرير فهرسة الصفحات في GSC = زحف Googlebot لعنوان URL وإعادة الخادم HTTP 403. لن تفهرسها Google، وتزيلها إن كانت مفهرسة سابقًا.
- صياغة Google مقابل صياغة HTTP. تصف وثيقة المساعدة لدى Google 403 بأنها بيانات اعتماد قُدمت ثم رُفضت — وهذه صياغة تقرير Google، لا تعريف HTTP الكامل. يعرّف RFC 9110 403 على نحو أوسع: رفض يستطيع الخادم إصداره مع بيانات اعتماد أو دونها ولأي سبب.
- قرر نية العنوان أولًا. عام ومقصود فهرسته ← أصلح 403. عام لكن غير مقصود فهرسته ← استخدم
noindexلا robots.txt (فهو حاجز منفصل ولا يستطيع وحده إنتاج 403). خاص عمدًا ← قد تكون 403 صحيحة؛ نظّف طريقة اكتشاف Google للعنوان بدلًا من ذلك. - سبب يُبلّغ عنه كثيرًا (للعناوين العامة). قد يحظر جدار حماية/CDN/WAF (Cloudflare أو Akamai أو Imperva/Incapsula أو Sucuri أو AWS WAF) أو إضافة أمان Googlebot، وغالبًا دون قصد — مع عدم وجود رقم متحقق منه يحدد معدل انطباق هذا السبب بعينه.
- لماذا تُحمّل عندك ولا تُحمّل لدى Google؟ يحمل متصفحك عادة cookies وuser-agent حقيقيًا ويحل التحديات، بينما لا يحمل طلب Googlebot ذلك — لكن أكد المحفز الفعلي بمقارنة السجلات بدل الافتراض.
- 401 مقابل 403. افحص الاستجابة: تتطلب 401 تحدي
WWW-Authenticate؛ أما 403 فرفض أوسع قد يحدث مع بيانات اعتماد أو دونها. وتعامل Google مع الحالتين بالطريقة نفسها للفهرسة، وغالبًا ما يتداخل الإصلاح. - لا تخنق الزحف به. لا تستخدم 401/403 للحد من معدل الزحف — فهما يزيلان الصفحة من الفهرس فقط. استخدم 429 (أو 503) لإشارة «تمهل».
- التشخيص. URL Inspection → Test live URL (يؤكد وصول Google-InspectionTool في تلك اللحظة، لا المسار الدقيق لـGooglebot المجدول)؛ أعد الإنتاج بصفة Googlebot من أكثر من منطقة؛ قارن سجلات WAF/الجدار سطرًا بسطر؛ وتحقق من Googlebot الحقيقي وفئة العميل قبل السماح.
- الإصلاح والتحقق. قيد استثناءً ضيقًا لـGooglebot المتحقق منه (أو افتح المحتوى)؛ استبدل تحديد معدل 403 بـ429؛ أكد
200في Test live URL؛ وشغّل Validate Fix. تحدث إعادة الفهرسة تلقائيًا بعد إعادة زحف Google لـ200، من دون جدول زمني مضمون.
الوثائق الرسمية
وثائق أولية من محركات البحث.
- تقرير فهرسة الصفحات — التقرير نفسه، بما في ذلك مدخلا «Blocked due to access forbidden (403)» و«Blocked due to unauthorized request (401)» ومعنى كل منهما.
- كيف تؤثر رموز حالة HTTP وأخطاء الشبكة وDNS في بحث Google — كيف تتعامل Google مع
4xx(تجاهل المحتوى وإزالة العنوان من الفهرس) وقاعدة عدم استخدام 401/403 للحد من معدل الزحف. - التحقق من Googlebot وزواحف Google الأخرى — DNS عكسي ثم أمامي ونطاقات IP المنشورة للسماح بـGooglebot الحقيقي لا بمنتحل.
- نظرة عامة على زواحف وجالبات Google — كل user-agent لدى Google وملفات JSON لنطاقات IP المطابقة.
- لا تستخدم 404 لإرضاء الجميع (مدونة Search Central، 2023) — طلب Google من مالكي المواقع وشبكات CDN التوقف عن استخدام 403/404 لخنق Googlebot، وما ينبغي استخدامه بدلًا منه.
Bing / Microsoft
- Bing Webmaster Tools — التحكم في الزحف — لا يستطيع bingbot، مثل Googlebot، فهرسة صفحة يتلقى عليها 403؛ فتحقق من أن قواعد الجدار/CDN لا تحظر bingbot (تحل أسماء المضيفين إلى
*.search.msn.com)، واستخدم Crawl Control لإدارة السرعة بدل الحجب.
معيار HTTP
- RFC 9110 — دلالات HTTP، §15.5.2 (401) و§15.5.4 (403) — تعريفات البروتوكول التي تصحح صياغة وثيقة المساعدة الأضيق المرتبطة ببيانات الاعتماد لدى Google: يتطلب 401 تحدي
WWW-Authenticate، بينما 403 رفض أوسع قد يحدث مع بيانات اعتماد أو دونها.
اقتباسات من المصدر
تصريحات موثقة من Google. كل رابط عميق يقفز إلى المقطع المقتبس في صفحة المصدر.
Google — ماذا تعني 403 للفهرسة (تقرير فهرسة الصفحات)
- “HTTP 403 means that the user agent provided credentials, but was not granted access. However, Googlebot never provides credentials, so your server is returning this error incorrectly. The page will not be indexed.” (الترجمة العربية) «يعني HTTP 403 أن user agent قدم بيانات اعتماد لكنه لم يُمنح الوصول. لكن Googlebot لا يقدم بيانات اعتماد أبدًا، ولذلك يعيد خادمك هذا الخطأ على نحو غير صحيح. لن تُفهرس الصفحة.» — مساعدة Google Search Console، «تقرير فهرسة الصفحات». انتقل إلى الاقتباس
Google — كيف تُعالج أخطاء 4xx (بما فيها 403)
- “Google doesn’t use the content from URLs that return
4xxstatus codes.” (الترجمة العربية) «لا تستخدم Google المحتوى من عناوين URL التي تعيد رموز الحالة 4xx.» — وثائق Google Search Central. انتقل إلى الاقتباس - “All
4xxerrors, except429, are treated the same: Google crawlers inform the next processing system that the content doesn’t exist.” (الترجمة العربية) «تُعامل جميع أخطاء 4xx، باستثناء 429، بالطريقة نفسها: تُبلغ زواحف Google نظام المعالجة التالي بأن المحتوى غير موجود.» انتقل إلى الاقتباس
Google — لا تستخدم 401/403 للحد من معدل الزحف
- “Don’t use
401and403status codes for limiting the crawl rate.” (الترجمة العربية) «لا تستخدم رمزي الحالة 401 و403 للحد من معدل الزحف.» — وثائق Google Search Central. انتقل إلى الاقتباس
قائمة فحص تشخيص 403 ← إصلاحه ← التحقق منه
شغّل هذه القائمة على أي عنوان URL يظهر له «Blocked due to access forbidden (403)»:
- حدد نية العنوان — عام/قابل للفهرسة، عام/غير قابل للفهرسة، خاص عمدًا، أو لا ينبغي اكتشافه أصلًا. تحتاج الحالة العامة القابلة للفهرسة وحدها إلى بقية القائمة.
- أكد أنه حي لا قديم — يعرض URL Inspection → Test live URL حالة
403الحالية (وهذا يؤكد وصول Google-InspectionTool، لا بالضرورة المسار الدقيق لـGooglebot المجدول). - أعد الإنتاج بصفة Googlebot — اجلب العنوان مع user-agent الخاص بـGooglebot (ومن خارج شبكتك، ويفضل من أكثر من منطقة)، لا من متصفحك العادي.
- اعثر على القاعدة — قارن سجلات CDN/WAF/الجدار/الإضافة للطلب المحجوب بسجل زيارة متصفح عادية (معرّف القاعدة والمحفز: user-agent أو IP أو تحدٍّ أو تحديد معدل)، بدل افتراض السبب.
- تحقق من Googlebot الحقيقي وفئة العميل — DNS عكسي ثم أمامي (يجب أن ينتهي المضيف بـ
googlebot.comأوgoogle.comأوgoogleusercontent.com) أو طابق قائمة نطاقات IP للفئة الصحيحة، قبل السماح لأي شيء. - قيد استثناءً ضيقًا لـGooglebot المتحقق منه — للمسارات والقواعد المحددة، بالهوية/نطاق IP، مع تسجيل وتاريخ انتهاء/مراجعة — لا سماحًا شاملًا ولا ثقة بسلسلة user-agent وحدها.
- افتح المحتوى العام — إذا كانت 403 متطلب تسجيل دخول/cookie على محتوى يفترض أن يكون عامًا، فأزل المتطلب.
- استبدل أي تحديد معدل 403 بـ
429(أو503) — لا تستخدم 401/403 لإبطاء الزحف. - أكد
200— يعيد URL Inspection → Test live URL الآن200. - تحقق — انقر Validate Fix على صف 403 و/أو Request indexing للعناوين ذات الأولوية؛ ثم تحدث إعادة الفهرسة تلقائيًا عند إعادة الزحف.
- حصّن المستقبل — أتمت فحص قواعد الحجب مقابل النطاقات الفرعية المنشورة لـGoogle حتى لا يعيد تحديث نطاقات IP الحجب دون ملاحظة.
النماذج الذهنية
1. اسأل «هل ينبغي أن تكون الصفحة عامة؟» قبل «من الذي أعدّ إعداداته خطأ؟» تصف صياغة Google للمساعدة 403 بأنها بيانات اعتماد أُرسلت ورُفضت، لكن RFC 9110 يعرّفها على نحو أوسع — طلبًا فهمه الخادم ورفضه لأي سبب، مع بيانات اعتماد أو دونها. في صفحة يفترض أن تكون عامة وقابلة للفهرسة، تكون 403 إلى Googlebot غالبًا قاعدة تعمل على الزائر الخطأ — تعامل معها بوصفها «اعثر على القاعدة» لا «احكم على الصفحة». أما الصفحة الخاصة عمدًا، فقد تؤدي 403 وظيفتها؛ وإصلاحها هو إزالة العنوان من مسار اكتشاف Google، لا فتح الجدار الناري.
2. الزائر نفسه بملامح مختلفة — أكد أي فرق مهم. قد تُحمّل الصفحة عندك وتعيد 403 لدى Google لأن متصفحك يحمل cookies وuser-agent حقيقيًا ويحل التحديات التي لا يحملها طلب Googlebot. لكن لا تفترض أي سمة شغلت القاعدة — قارن السجلات وغيّر سمة واحدة في كل مرة. شخّص عبر إنشاء طلب Googlebot لا طلبك، ودع السجلات تخبرك بالسبب بدل التخمين.
3. تحقق من الهوية، ثم قيد الاستثناء. يمكن لأي شخص انتحال user-agent الخاص بـGooglebot. الترتيب دائمًا: أكد الهوية وفئة العميل (DNS عكسي / قائمة نطاق IP المطابقة) ← ثم اسمح — وحتى حينها، قيد الاستثناء بالمسار والقاعدة المحددين مع التسجيل وتاريخ انتهاء/مراجعة، لا بقائمة سماح Google شاملة. السماح اعتمادًا على user-agent وحده أو على نطاق واسع يفتح ثقبًا أمام أدوات الكشط التي تتظاهر بأنها Google.
4. 403 أداة خنق خاطئة.
إذا كان هدفك إبطاء Googlebot، فلن تفعل 401/403 ذلك — بل تزيلان الصفحة من الفهرس. رموز «تمهل» هي 429 و5xx/503. اختر الرمز المطابق لنيتك: «اذهب نهائيًا» (إزالة من الفهرس) مقابل «عد لاحقًا» (خنق مؤقت).
5. 403 و401 ابنا عم، وتفرقهما الاستجابة.
تتطلب 401 تحدي WWW-Authenticate — جدار تفويض حقيقي. أما 403 فرفض أوسع قد يحدث مع بيانات اعتماد أو دونها، فلا تستنتج الآلية من التسمية وحدها؛ افحص الاستجابة الفعلية. وبعد معرفة الحالة، تشتركان في النتيجة (لا فهرسة) وغالبًا في الإصلاح (السماح لـGooglebot المتحقق منه أو فتح المحتوى) — شخّصهما بالحلقة نفسها.
ورقة غش 403
الحالات الشقيقة في فهرسة الصفحات
| الحالة | ما الذي تلقته Google | ما الذي تعنيه عادةً |
|---|---|---|
| Blocked due to access forbidden (403) | HTTP 403 (رفض — قد يتضمن بيانات اعتماد أو لا) | غالبًا جدار حماية/CDN/WAF/قاعدة أمان تحظر Googlebot؛ وقد تكون أيضًا صفحة محظورة عمدًا أو فحص مصادقة مهيأ خطأً |
| Blocked due to unauthorized request (401) | HTTP 401 (تحدي WWW-Authenticate مطلوب) | صفحة خلف جدار تسجيل دخول/مصادقة HTTP |
| عنوان URL محجوب بسبب مشكلة 4xx أخرى | بعض رموز 4xx | شخّص عبر URL Inspection |
حالات الحالة والزحف — اختر الرمز الصحيح
| الهدف | الرمز المعاد | الأثر |
|---|---|---|
| حظر روبوت سيئ/غير مرغوب | 403 | الصفحة غير مفهرسة؛ وتسقط من الفهرس إن كانت مفهرسة |
| مطالبة Googlebot بالإبطاء | 429 (أو 503) | خنق مؤقت — إشارة «تمهل» المدعومة |
| الصفحة زالت فعلًا | 404 / 410 | تسقط من الفهرس مع الوقت |
| ينبغي فهرسة الصفحة | 200 | قابلة للزحف والفهرسة |
ما الذي تفعله 403 بصفحة يفترض فهرستها
- يُتجاهل المحتوى (لا تستخدم Google محتوى
4xx). - يُزال عنوان URL من الفهرس إذا كان مفهرسًا سابقًا.
- ينخفض تكرار الزحف ما دامت 403 مستمرة.
مرجع سريع للتحقق من Googlebot
- نفّذ Reverse-DNS لعنوان IP ← يجب أن ينتهي المضيف بـ
googlebot.comأوgoogle.comأوgoogleusercontent.com. - نفّذ Forward-DNS لذلك المضيف ← يجب أن يعيد عنوان IP نفسه.
- أو طابق عنوان IP مع ملفات JSON الحالية المنشورة لنطاقات زواحف Google للفئة الصحيحة — فـGooglebot العادي والزواحف الخاصة وجالبات المستخدم (مثل Google-InspectionTool) تنشر قوائم منفصلة.
أعد إنتاج 403 بصفة Googlebot
لا تختبر من متصفحك العادي — فلن تشغّل قاعدة الروبوتات. اجلب عنوان URL باستخدام user-agent الخاص بـGooglebot لترى ما تراه Google.
macOS / Linux
# Fetch headers only, as Googlebot's user-agent — look at the status line
curl -s -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" \
-I https://www.example.com/page/
# A "HTTP/1.1 403 Forbidden" here reproduces what Googlebot is getting.Windows (PowerShell)
# -SkipHttpErrorCheck so PowerShell shows the 403 instead of throwing
$ua = "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"
Invoke-WebRequest -Uri "https://www.example.com/page/" -Method Head `
-UserAgent $ua -SkipHttpErrorCheck | Select-Object StatusCode, StatusDescriptionإذا أعاد هذا الطلب 403 بينما أعاد طلب متصفح عادي 200، فقد أكدت حجبًا خاصًا بالروبوت. ملاحظة: قد يعتمد WAF متقدم أيضًا على عنوان IP، لذلك أجرِ اختبار إعادة الإنتاج الكامل من خارج شبكتك.
تحقق من أن الروبوت هو Googlebot فعلًا قبل السماح له
تنتحل حركة كثيرة user-agent الخاص بـGooglebot. أكد الهوية بفحص DNS عكسي ثم أمامي قبل السماح لعنوان IP عبر جدار الحماية.
macOS / Linux
# 1) Reverse DNS the IP from your logs — must end in googlebot.com / google.com
host 66.249.66.1
# → ... domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comإذا لم ينتهِ البحث العكسي بنطاق Google، أو لم يطابق البحث الأمامي عنوان IP، فليس الروبوت Googlebot — لا تسمح له. ويمكنك أيضًا مطابقة عنوان IP بالنطاقات المنشورة لدى Google عبر googlebot.json. انتبه إلى أن googlebot.json يغطي Googlebot العادي فقط — فزواحف الحالات الخاصة وجالبات المستخدم (مثل Google-InspectionTool) تنشر ملفات نطاق IP منفصلة، لذا طابق القائمة مع العميل الفعلي الذي تتحقق منه. أكد الهوية أولًا، ثم قيد الاستثناء بالمسار والقاعدة المحددين؛ لا تسمح أبدًا اعتمادًا على user-agent وحده ولا تفتح استثناءً شاملًا.
تشخيص 403: حجب WAF أم جدار تسجيل دخول أم إساءة استخدام تحديد المعدل؟
الفرع الأول يفحص الاستجابة نفسها — فـ403 بلا ترويسة WWW-Authenticate أو مطالبة تسجيل دخول تشير بعيدًا عن حالة 401 الشقيقة ونحو رفض من قاعدة أمان أو تحكم في الوصول. ومن هناك تتبع الفروع حلقة التشخيص ثم الإصلاح الموجودة في علامة Advanced؛ تعامل مع كل نتيجة على أنها فرضية يجب تأكيدها في سجلاتك، لا حقيقة يقينية. انقر للمتابعة.
Why is Googlebot getting a 403, and what fixes it?
تابع مجموعة 403 لا مجرد وجودها
الرقم الوحيد الجدير بالمراقبة هو عدد عناوين URL الموجودة في صف «Blocked due to access forbidden (403)» في تقرير فهرسة الصفحات مع مرور الوقت، لا مجرد وجود الصف — فاللقطة الواحدة لا تخبرك هل نجح الإصلاح فعلًا أم تتراكم 403 جديدة.
عدد مجموعة 403 عبر الزمن
- المقياس — عدد عناوين URL تحت صف «Blocked due to access forbidden (403)» في تقرير فهرسة الصفحات في GSC، متتبعًا أسبوعًا بعد أسبوع.
- ما الذي يخبرك به — هل نجح إصلاح قائمة السماح أو قاعدة الجدار فعلًا وهل تتسلل 403 جديدة. بعد السماح لـGooglebot المتحقق منه أو فتح مسار عام، ينبغي أن يقترب العدد من الصفر للعناوين التي أصلحتها. وإذا بقي ثابتًا، فهذا مقبول فقط عندما تكون قد قررت عمدًا أن هذه العناوين لا ينبغي أن تُزحف؛ أما ارتفاعه فيعني غالبًا أن قاعدة WAF/CDN أو تحديث نطاق IP بدأ يلتقط Googlebot حديثًا.
- طريقة الاستخراج — تقرير فهرسة الصفحات في GSC، مع تصفية صف 403؛ وافحص عناوين URL منفردة عبر URL Inspection → Test live URL للتأكد من أنها ليست لقطة قديمة.
- المعيار/النطاق الواقعي — لا يوجد هدف عام؛ فهذا يتوقف على عدد عناوين URL التي تريد فهرستها فعلًا. المعيار الصادق: صفر 403 بين العناوين التي تريد فهرستها، وعدّ ثابت (غير متزايد) في غيرها. أنشئ خط أساس لعددك قبل الحكم على اتجاه المنحنى.
- الدورية — أسبوعيًا بعد الإصلاح مباشرةً حتى يستقر العدد؛ ثم شهريًا بوصفه فحص تراجع، لأن CDN أو تحديث نطاقات IP الخاصة بـGooglebot قد يعيد الحجب دون ملاحظة.
دليل تشغيل: شخّص وأصلح وتحقق
مسار 403 حلقة قصيرة مرتبة — لا تقفز إلى السماح قبل إعادة إنتاج الحجب بصفة Googlebot وتأكيد هوية ما توشك على السماح له بالمرور.
1. أكد أنها حية لا قديمة. شغّل URL Inspection → Test live URL في GSC على عنوان URL المتأثر لتؤكد أن Google تتلقى 403 حاليًا لا تقريرًا مخزنًا مؤقتًا.
2. أعد إنتاجها بصفة Googlebot لا كذاتك. اجلب العنوان باستخدام user-agent الخاص بـGooglebot، ويفضل من خارج شبكتك ومن أكثر من منطقة — فمتصفحك العادي يرسل cookies وuser-agent حقيقيًا ويستطيع اجتياز تحديات JS/CAPTCHA التي لا يستطيع طلب Googlebot عادةً اجتيازها، لذلك قد لا يشغل القاعدة نفسها. قارن إدخالات السجلات الناتجة جنبًا إلى جنب بدل افتراض الفرق الذي سبب الحجب.
3. اعثر على القاعدة. اقرأ سجلات CDN/WAF/الجدار للقاعدة الدقيقة التي أطلقت على طلب Googlebot — يخبرك معرّف القاعدة ومحفزها (user-agent أو IP أو تحدٍّ أو تحديد معدل) بما ينبغي تغييره.
4. تحقق من Googlebot الحقيقي وفئته قبل السماح. أكد أن الطلبات التي ستسمح بها Googlebot فعلًا عبر DNS عكسي ثم أمامي أو قائمة نطاق IP المطابقة لفئة العميل (Googlebot العادي والزواحف الخاصة وجالبات المستخدم تنشر قوائم منفصلة) — وإلا فتفتح ثقبًا للمنتحلين أو تتحقق مقابل القائمة الخطأ.
5. أصلح وفق السبب. قاعدة WAF/CDN ← قيد استثناءً ضيقًا لـGooglebot المتحقق منه بالمسار والقاعدة، وفق الهوية/نطاق IP. متطلب تسجيل دخول/cookie على محتوى عام ← أزله. قاعدة تحديد معدل تعيد 403 ← استبدلها بـ429 (أو 503).
6. تحقق. أكد أن URL Inspection → Test live URL يعيد 200 الآن، ثم انقر Validate Fix على صف 403 و/أو Request indexing للعناوين ذات الأولوية. تحدث إعادة الفهرسة تلقائيًا بعد إعادة زحف Google لاستجابة 200 — وإذا لم يتجه عدد مجموعة 403 إلى الانخفاض بعد أسبوعين تقريبًا، فعد إلى الخطوة 2 وأعد الاختبار بدل تخمين سبب جديد.
مطالبات AI جاهزة للاستخدام
مطالبات للنسخ واللصق لتصنيف 403 من مخرجات التشخيص الخام. تساعدك على فرز السبب المرجح بسرعة — لكن أكد النتيجة دائمًا مقابل إعداد الخادم/الجدار الناري الفعلي قبل تغيير أي شيء.
صنّف السبب المرجح من مخرجات curl
I'm diagnosing a "Blocked due to access forbidden (403)" status in Google
Search Console. Below is the raw output of a request made with Googlebot's
user-agent (curl -A "...Googlebot..." -I). Based on this output alone,
classify the most likely cause as one of: (1) CDN/WAF bot-management
challenging or blocking non-browser clients, (2) server firewall / mod_security
rule flagging the crawl pattern as abuse, (3) user-agent or referrer/hotlink
rule, (4) geo/IP blocking excluding Googlebot's IP ranges, (5) a login/cookie
requirement on content that should be public, (6) a rate-limit rule misusing
403 instead of 429. Explain which specific header or detail in the output
pointed you to that answer, and tell me what's missing if you can't tell for
sure.
CURL OUTPUT:
[paste]صنّف السبب من سطر سجل WAF/الجدار الناري
I'm investigating why Googlebot is getting a 403 on a page I want indexed.
Below is a log line (or a few) from my WAF/CDN showing a blocked request. Tell
me whether this looks like a bot-identity rule (blocking by user-agent or IP
range), a challenge/CAPTCHA rule, or a rate-limit rule misusing 403, and what
I'd need to allowlist — by IP range or reverse-DNS — to let verified Googlebot
through without disabling the rule entirely.
LOG LINE(S):
[paste]تحقق من سلامة الإصلاح قبل نشره
I'm about to allowlist a set of IPs as "Googlebot" in my WAF, because a page
I want indexed is currently returning 403 to the crawler. Here's the evidence
I have that these requests are genuinely Googlebot: [describe reverse-DNS or
IP-range check]. Point out anything I might be missing — e.g. whether I should
verify by both reverse and forward DNS, whether I should match Google's
published IP-range JSON instead, or whether allowlisting by user-agent alone
would leave a hole for spoofers. اختبر نفسك: «الحظر بسبب الوصول الممنوع (403)»
خمسة أسئلة عن معنى 403، واختلافه عن 401، وطريقة تشخيصه وإصلاحه. اختر إجابة لكل سؤال ثم تحقق.
أدوات تشخيص 403 وإصلاحه
- أداة فحص حالة HTTP — ألصق عنوان URL المتأثر (أو مجموعة عناوين) لتأكيد رمز الحالة 403 ورؤية سلسلة الاستجابة كاملةً، واكتشاف أي إعادة توجيه تسبق الحجب.
- Googlebot Verifier — تحقق من أن عنوان IP الذي يدعي أنه Googlebot حقيقي (النطاقات المنشورة مع تأكيد reverse-DNS) قبل السماح له عبر قاعدة WAF أو جدار ناري.
- Google Search Console — URL Inspection → Test live URL — أقرب طريقة لرؤية الاستجابة الدقيقة التي يتلقاها Googlebot الآن.
curl -A "...Googlebot..."— أسرع طريقة لجلب عنوان URL باستخدام user-agent الخاص بـGooglebot وقراءة سطر الحالة الخام.- سجل أحداث جدار WAF/CDN لديك (Cloudflare وAkamai وSucuri وغيرها) — اعثر على القاعدة المحددة التي تعيد 403 إلى نطاقات IP الخاصة بـGooglebot.
أثبت أن الإصلاح نجح فعلًا
بعد السماح لـGooglebot المتحقق منه أو فتح المحتوى العام أو استبدال قاعدة تحديد المعدل بـ429، تفصل هذه الفحوص بين «تغير الإعداد» و«تمكن Google فعلًا من الوصول إلى الصفحة». شغّلها بالترتيب.
الاختبار 1 — يعيد طلب user-agent الخاص بـGooglebot الآن 200
- الاختبار المطلوب — اجلب عنوان URL المتأثر باستخدام user-agent الخاص بـGooglebot (أو افحصه باستخدام أداة فحص حالة HTTP).
- النتيجة المتوقعة — يقرأ سطر الحالة
HTTP/1.1 200 OK. - تفسير الفشل — استمرار
403يعني أن قاعدة firewall/WAF لم تُحدّث فعليًا، أو أنك سمحت بنطاق IP الخطأ. أما401بدل403فيعني أنك بدلت حجبًا بجدار مصادقة — افحص ذلك المسار منفصلًا. - نافذة المراقبة — فورية — يجيب الخادم بمجرد أن يصبح تغيير القاعدة حيًا.
- مُشغّل التراجع — إذا كشف فتح المسار محتوى كان ينبغي إبقاؤه مقيدًا، فأعد الحجب واسمح لـGooglebot المتحقق منه عبر IP/reverse-DNS في قاعدة أضيق بدلًا من ذلك.
الاختبار 2 — تؤكد Google أنها تستطيع الآن الوصول إلى الصفحة
- الاختبار المطلوب — شغّل URL Inspection → Test live URL في Google Search Console على عنوان URL المتأثر.
- النتيجة المتوقعة — ينجح الاختبار المباشر ويعرض محتوى الصفحة — بلا خطأ «وصول ممنوع». ويؤكد ذلك أن Google-InspectionTool يستطيع حاليًا الوصول إلى الصفحة، لا أن كل Googlebot سيأخذ المسار نفسه.
- تفسير الفشل — إذا ظل Test live URL يبلغ عن 403 بعد نجاح جلب user-agent الخاص بـGooglebot، فاشتبه في قاعدة مرتبطة بنطاقات IP المنشورة لدى Google تحديدًا لا بسلسلة user-agent — افحص سجل الجدار بحثًا عن قاعدة ثانية.
- نافذة المراقبة — من فوري إلى بضع دقائق بعد الإصلاح.
- مُشغّل التراجع — لا ينطبق — هذا اختبار للقراءة فقط؛ وإذا ظل فاشلًا فارجع إلى فرع فشل الاختبار 1 بدل التراجع عن شيء.
الاختبار 3 — تزول حالة 403 من تقرير فهرسة الصفحات
- الاختبار المطلوب — استخدم Validate Fix على مشكلة «Blocked due to access forbidden (403)» في تقرير فهرسة الصفحات، وراقب عدد المجموعة خلال الأسابيع التالية (انظر علامة كيفية القياس).
- النتيجة المتوقعة — ينتقل عنوان URL خارج مجموعة 403، وإذا كان مفهرسًا سابقًا فقد يعود إلى الفهرس مع الوقت عندما تعيد Google زحف الصفحة التي أصبحت 200.
- تفسير الفشل — إعادة الفهرسة تلقائية لكنها ليست فورية؛ فلا تعتبر التحقق البطيء فشلًا جديدًا. وإذا لم يتجه عدد مجموعة 403 إلى الانخفاض بعد أسبوعين تقريبًا، فأعد الاختبار 1 للتأكد من بقاء الإصلاح — فقد تعيد ذاكرة CDN أو تحديث نطاق IP الخاص بـGooglebot الحجب دون ملاحظة.
- نافذة المراقبة — من أيام إلى بضعة أسابيع، مع تتبع عدد مجموعة 403.
- مُشغّل التراجع — لا تعاود النظر في القاعدة نفسها إلا إذا بدأ الاختبار 1 يفشل مجددًا — لا تطارد توقيت تقرير فهرسة الصفحات.
موارد تستحق وقتك
الرسمية
- تقرير فهرسة الصفحات (Google) — مدخلا 403 و401 حرفيًا.
- كيف تؤثر رموز حالة HTTP في بحث Google — معالجة
4xxوقاعدة عدم استخدام 401/403 للحد من معدل الزحف. - التحقق من Googlebot (Google) — DNS عكسي ونطاقات IP المنشورة.
- لا تستخدم 404 لإرضاء الجميع (Google، 2023) — لا تستخدم 403/404 لخنق Googlebot.
كتاباتي ذات الصلة
- الدليل المبتدئ إلى SEO التقني — مكان مشاكل وصول الزحف مثل هذه ضمن الصورة الأكبر.
- Robots.txt وSEO: كل ما تحتاج إلى معرفته — الطريقة الشائعة الأخرى التي تُحجب بها الصفحات عن الزحف دون قصد.
من آخرين
- r/TechSEO — مجتمع تصحيح الزحف/الفهرسة، بما في ذلك نقاشات حجب Googlebot بواسطة CDN.
- تحذر Google من استخدام حالات 403 أو404 للحد من معدل زحف Googlebot (Search Engine Land) — تغطية إرشاد Gary Illyes «لا تستخدم 404 لإرضاء الجميع» وما ينبغي استخدامه بدلًا منه (429/503).
- Google: لا تستخدم استجابات خطأ 403/400 لتحديد معدل Googlebot (Search Engine Journal) — نقل SEJ لمنشور Illyes نفسه مع سياق إضافي.
- السبب الأكثر شيوعًا لحجب Googlebot هو الجدران/CDN (Search Engine Roundtable) — شرح Google Search Relations أن أغلب عمليات حجب Googlebot قواعد CDN/جدار ناري غير مقصودة.
- روبوتات تنتحل Googlebot (johnmu.com) — يوضح John Mueller لماذا يجب التحقق من Googlebot عبر DNS العكسي قبل السماح، لا الثقة بسلسلة user-agent وحدها.
- كيفية إصلاح «الحظر بسبب الوصول الممنوع (403)» (Onely) — شرح عملي لتفاصيل WAF/CDN وحلقة التشخيص ← الإصلاح.
سجل التغييرات
تم التحديث في 22 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 8 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 17 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.