تضخم الفهرس
تضخم الفهرس هو تراكم عناوين URL منخفضة القيمة أو مكررة في فهرس محركات البحث. تعرّف إلى أسبابه وطرق تشخيصه واختيار العلاج الصحيح من noindex وcanonical والحذف والدمج.
اللغات
تضخم الفهرس مصطلح في قطاع SEO يصف فهرسة محركات البحث لصفحات منخفضة القيمة أو مكررة، مثل عناوين التصفية والمعلمات ونتائج البحث الداخلي وصفحات الوسوم ونسخ البروتوكول. وهو ليس عقوبة ولا تحدده كثرة الصفحات وحدها؛ بل قد يهدر الزحف ويوزع الإشارات بين نسخ متقاربة. شخّصه بتقرير فهرسة الصفحات في Google Search Console وسجلات الخادم وأدوات الزحف، ولا تعتمد العدد التقريبي في `site:`. اختر العلاج بحسب قصد الصفحة: `noindex` للصفحات التي لا ينبغي ظهورها مع إبقائها قابلة للزحف، و`rel=canonical` للنسخ المكررة، و`404` أو `410` للمحتوى المحذوف، والدمج للصفحات الضعيفة المتقاربة. ولا يمنع robots.txt صفحة مفهرسة من البقاء في الفهرس، كما أن أداة الإزالة مؤقتة.
الخلاصة — يحدث تضخم الفهرس عندما تفهرس محركات البحث عددًا كبيرًا من الصفحات منخفضة القيمة في موقعك لا يبحث عنها أحد، مثل روابط التصفية ونتائج البحث الداخلي وصفحات الوسوم والنسخ شبه المكررة. وهو ليس عقوبة، بل مشكلة إهدار وقت Google وتوزيع إشاراتك على نسخ متعددة. ويتعلق بالجودة لا بعدد صفحات موقعك.
ما تضخم الفهرس؟
“تضخم الفهرس” مصطلح يستخدمه مختصو SEO، وليس Google، لوصف احتفاظ محرك بحث بعدد كبير من صفحات موقعك التي لا تستحق فعلًا الوجود في الفهرس. ومن أمثلتها صفحات نتائج البحث الداخلي، وكل تركيبة ممكنة من عوامل تصفية متجر، وصفحات الوسوم الفارغة، والنسخ المهيأة للطباعة، والصفحة نفسها المتاحة عبر خمسة روابط مختلفة قليلًا.
الكلمة الأساسية هي منخفضة القيمة. تكون الصفحة جزءًا من التضخم إذا لم يبحث عنها أحد ولم تساعد أحدًا على العثور على محتواك الجيد. ولا يحسم عدد الصفحات ذلك؛ فقد يكون موقع صغير فوضويًا وموقع ضخم نظيفًا تمامًا.
هل يمثل مشكلة فعلًا؟
عادة أقل مما يخشاه الناس. لا توجد “عقوبة تضخم الفهرس”. لن تخفض Google ترتيب موقعك كله لأنها فهرست بعض الروابط الرديئة. وما يحدث فعليًا أبسط:
- إهدار الزحف. تنفق محركات البحث وقتًا في جلب الروابط الرديئة بدل صفحاتك المهمة والجديدة.
- توزيع الإشارات. عندما يوجد المحتوى نفسه في عدة روابط، تتوزع الروابط الواردة والاهتمام بدل أن تتراكم في صفحة قوية واحدة.
نادراً ما يهم ذلك في موقع صغير، لكنه يتراكم في متجر أو ناشر كبير تُنتج قوالبه آلاف الروابط.
أسبابه
الأسباب المعتادة:
- روابط التصفية والترتيب، أي التنقل متعدد الأوجه؛ فكل تركيبة تنشئ رابطًا جديدًا.
- معلمات URL للترتيب والتصفية ووسوم التتبع ومعرّفات الجلسات.
- صفحات نتائج البحث الداخلي التي يفهرسها محرك البحث.
- صفحات أرشيف الوسوم والتصنيفات والمؤلفين التي لا تضم محتوى فعليًا.
- ترقيم الصفحات، مثل الصفحة 2 و3 و4 من قائمة.
- النسخ المكررة، مثل http وhttps، وwww ودونه، ومع الشرطة المائلة الختامية ودونها.
- أخطاء 404 الزائفة، وهي صفحات تقول “غير موجود” لكنها تعيد حالة “OK” فيواصل المحرك التعامل معها.
كيفية الفحص
لا تثق ببحث site:example.com؛ فالعدد فيه تقدير تقريبي فقط. استخدم Google Search Console ← تقرير فهرسة الصفحات للاطلاع على ملخص Google للصفحات المفهرسة وغير المفهرسة والأسباب المبلغ عنها، مع تذكر أن قوائم الروابط النموذجية فيه محدودة. Evidence for this claim Search Console's Page Indexing report summarizes indexed and non-indexed pages and groups non-indexed pages by reason, with limited example rows. Scope: Google Search Console reporting; it is not an exhaustive downloadable URL inventory. Confidence: high · Verified: Google: Page indexing report
كيفية الإصلاح باختصار
طابق الأداة مع حالة الصفحة:
- لا قيمة لها في البحث ولا ينبغي أن تظهر؟ أضف
noindexوأبقها قابلة للزحف كي ترى Google الوسم. Evidence for this claim Google recommends noindex to prevent indexing while allowing crawling, canonical signals for duplicates, and 404/410 for removed pages. Scope: The appropriate control depends on the page's intended state. Confidence: high · Verified: Google: Block indexing with noindex Google: Canonicalization Google: HTTP status codes - نسخة مكررة من صفحة مهمة؟ أشر عبر
rel=canonicalإلى الصفحة الأصلية. - زالت فعلًا؟ أعد
404أو410. - عدة صفحات ضحلة حول موضوع واحد؟ ادمجها في صفحة جيدة واحدة.
هل تريد جدول القرار الكامل وطرق التشخيص والمزالق التي توقع الجميع، مثل سبب عدم إزالة حجب الصفحة في robots.txt لها من Google؟ انتقل إلى تبويب Advanced.
الخلاصة — “تضخم الفهرس” مصطلح في SEO لا تستخدمه Google؛ والمشكلة الفعلية هي فهرسة روابط ضحلة أو مكررة أو منخفضة القيمة، مثل التنقل متعدد الأوجه والمعلمات والبحث الداخلي وأرشيفات الوسوم وترقيم الصفحات وأخطاء 404 الزائفة ونسخ البروتوكول. إنها مشكلة كفاءة زحف وتخفيف إشارات، وليست عقوبة. تقول Bing: “Duplicate content doesn’t trigger search penalties on its own” (ترجمة) «لا يؤدي المحتوى المكرر بمفرده إلى عقوبات بحث»، ويقول مولر: “We don’t have a duplicate content penalty.” (ترجمة) «ليس لدينا عقوبة للمحتوى المكرر». تتعلق المشكلة بالجودة لا بعدد الصفحات. شخّصها عبر تقرير فهرسة الصفحات في GSC، إذ إن
site:تقدير تقريبي، وسجلات الخادم وأدوات الزحف. Evidence for this claim Search Console's Page Indexing report summarizes indexed and non-indexed pages and groups non-indexed pages by reason, with limited example rows. Scope: Google Search Console reporting; it is not an exhaustive downloadable URL inventory. Confidence: high · Verified: Google: Page indexing report عالج كل رابط بحسب قصده: يزيلnoindexالصفحة من الفهرس مع إبقائها قابلة للزحف، ويدمجrel=canonicalإشارات النسخ المكررة مع كونه تلميحًا لا أمرًا، ولا يوقف robots.txt إلا الزحف ولا يزيل الروابط المفهرسة، واستخدم404أو410للصفحات الزائلة وادمج المحتوى الضحل. Evidence for this claim Google recommends noindex to prevent indexing while allowing crawling, canonical signals for duplicates, and 404/410 for removed pages. Scope: The appropriate control depends on the page's intended state. Confidence: high · Verified: Google: Block indexing with noindex Google: Canonicalization Google: HTTP status codes أما أداة الإزالة فمؤقتة لنحو 6 أشهر.
ما المقصود فعلًا بتضخم الفهرس؟
لنبدأ بالتأطير الذي تخطئ فيه معظم المقالات: “تضخم الفهرس” مصطلح في قطاع SEO، وليس مصطلحًا لدى Google. لا تستخدم Google هذه العبارة، بل تصف مكوناتها: روابط مكررة، وروابط منخفضة القيمة أو غير مهمة، وأخطاء 404 زائفة، ومساحات لا نهائية، وتنقل متعدد الأوجه. فلا تنسب العبارة إلى Google ولا تعاملها ككيان مسمى تطارده وتعاقب عليه.
التعريف العملي الذي أرتاح إليه: يحدث تضخم الفهرس عندما تفهرس محركات البحث صفحات في موقعك لا قيمة لها في البحث. ينصب التركيز على القيمة لا الحجم؛ فقد يكون موقع من 500 صفحة نظيفًا، وقد يكون معظم موقع من 100 000 صفحة تضخمًا. إنها مشكلة جودة ترتدي زي عدد الصفحات.
هل يمثل تضخم الفهرس مشكلة فعلًا؟ الإجابة الصادقة
هو في الغالب أقل خطرًا مما يظن الناس، والأهم أنه ليس عقوبة. وهذه أكثر فكرة مبالغ فيها في المجال. تقول Bing بوضوح: “Duplicate content doesn’t trigger search penalties on its own.” (ترجمة) «لا يؤدي المحتوى المكرر بمفرده إلى عقوبات بحث». وقال مولر الشيء نفسه عن Google منذ سنوات: “We don’t have a duplicate content penalty. It’s not that we would demote a site for having a lot of duplicate content.” (ترجمة) «ليس لدينا عقوبة للمحتوى المكرر، ولا نخفض موقعًا لأنه يضم قدرًا كبيرًا من المحتوى المكرر».
فما تكلفته الفعلية؟ أمران عمليان:
-
إهدار الزحف. يذكر دليل Google للمواقع الكبيرة أنه إذا كانت روابط كثيرة مكررة أو غير مرغوبة، فإن “this wastes a lot of Google crawling time on your site.” (ترجمة) «يهدر هذا قدرًا كبيرًا من وقت زحف Google في موقعك». ومن جهة البنية التحتية: “If Google spends too much time crawling URLs that it shouldn’t, Google’s crawlers might decide that it’s not worth the time to look at the rest of your site.” (ترجمة) «إذا أمضت Google وقتًا أطول مما ينبغي في زحف روابط لا ينبغي زحفها، فقد تقرر برامج زحفها أن تفحص بقية موقعك لا يستحق الوقت». هذه هي الآلية: تحرم الروابط الرديئة الصفحات المهمة من الزحف وتبطئ اكتشاف المحتوى الجديد.
-
تخفيف الإشارات. توضح Bing نتيجة النسخ شبه المكررة: “signals such as clicks, links, impressions, and engagement are often diluted.” (ترجمة) «غالبًا ما تتخفف إشارات مثل النقرات والروابط ومرات الظهور والتفاعل». فإذا وزعت قيمة صفحة واحدة على خمسة روابط شبه متطابقة، لن يرتب أي منها بقوة صفحة واحدة مدمجة.
متى يهم فعلًا؟ في المواقع الكبيرة أو المعتمدة على القوالب: التجارة الإلكترونية مع الأوجه والمعلمات ومتغيرات المنتجات، والناشرون مع الوسوم والأرشيفات وترقيم الصفحات، وأي CMS ينشئ روابط تلقائيًا مثل صفحات وسوم WordPress والمؤلفين والخلاصات والبحث الداخلي. أما في موقع ثابت صغير فهو غالبًا ضجيج.
والاختبار الصادق الذي أطبقه على عملي: راجعت مرة مدونة Ahrefs مباشرة ووجدت أكثر من 4 700 صفحة مزحوفة، لكن نحو 1 600 فقط كانت ترتب. وكانت الفجوة، أي “صفحات الزومبي”، تتألف من صفحات خلاصات التعليقات والتصنيفات والمؤلفين وترقيم الصفحات. وكان حكمي هادئًا: معظمها لم يضر SEO، لكنه استهلك ميزانية الزحف، ولذلك كان العلاج فرز الأولويات لا الذعر، مثل عرض عناصر أكثر في الصفحة لتقليل حجم ترقيم الصفحات. ابدأ كل تحقيق بسؤال “هل يهم هذا فعلًا؟” قبل أي تغيير.
أسباب تضخم الفهرس
فيما يلي المصادر المعتادة، مرتبة تقريبًا بحسب شيوع تسببها في المشكلة:
- التنقل متعدد الأوجه. هو المصدر الأول. قال غاري إيليس في تدوينة Google عن الزحف في ديسمبر إن التنقل متعدد الأوجه “is by far the most common source of overcrawl issues site owners report to us,” (ترجمة) «هو بفارق كبير أكثر مصادر مشكلات الزحف المفرط التي يبلغنا بها مالكو المواقع شيوعًا»، وذلك تحديدًا “because it can generate a near-infinite number of URLs.” (ترجمة) «لأنه يستطيع إنشاء عدد شبه لا نهائي من الروابط». وهو “will always consume server resources,” (ترجمة) «سيستهلك موارد الخادم دائمًا»، كما أن الزحف المفرط “slows down the discovery of your important, new content.” (ترجمة) «يبطئ اكتشاف محتواك المهم والجديد».
- معلمات URL للترتيب والتصفية والتتبع والجلسات؛ فقد تكون كل قيمة معلمة رابطًا جديدًا قابلًا للزحف والفهرسة بلا محتوى فريد.
- صفحات نتائج البحث الداخلي التي تفهرسها المحركات، وهي نادرًا ما تحمل قيمة بحث مستقلة.
- أرشيفات وخلاصات الوسوم والتصنيفات والمؤلفين المنشأة تلقائيًا والضحلة غالبًا.
- ترقيم الصفحات، مثل الصفحات 2 و3 و4، مضروبًا في التصنيفات والأرشيفات.
- نسخ البروتوكول والمضيف، مثل http وhttps، وwww ودونه، والشرطة الختامية ودونها. وتسرد وثيقة canonical في Google هذه الحالات تحديدًا: اختلاف المنطقة والجهاز والبروتوكول HTTP/HTTPS ووظائف الموقع مثل نتائج الترتيب والتصفية.
- أخطاء 404 الزائفة والمساحات اللانهائية، مثل التقويمات والتمرير اللانهائي وصفحات “غير موجود” التي تعيد
200. تقول Google: “soft 404 pages will continue to be crawled, and waste your budget.” (ترجمة) «سيستمر زحف صفحات 404 الزائفة وتهدر ميزانيتك». - الصفحات المنشأة آليًا والضحلة، أي كل ما تنتجه القوالب مع قدر ضئيل من المحتوى الفريد.
وتقدم Google تذكيرًا مفيدًا عن الحجم: “The web is a nearly infinite space, exceeding Google’s ability to explore and index every available URL.” (ترجمة) «الويب مساحة شبه لانهائية تتجاوز قدرة Google على استكشاف كل رابط متاح وفهرسته». فإذا كانت قوالبك تستطيع إنشاء روابط لا نهائية، فلن تنقذك Google من تصميمك.
كيفية تشخيص تضخم الفهرس
تقرير فهرسة الصفحات في GSC هو المرجع الموثوق للعدد. تقول Google إن الإجماليات “complete and accurate from Google’s perspective.” (ترجمة) «كاملة ودقيقة من منظور Google». استخدمه بدل عامل site:. والأهم من العدد الخام توزيع أسباب عدم الفهرسة. ومن الفئات التي تكشف نمط التضخم:
- Crawled - currently not indexed — “The page was crawled by Google but not indexed.” (ترجمة) «زحفت Google الصفحة لكنها لم تفهرسها». والتراكم الكبير هنا إشارة تقليدية للتضخم.
- Discovered - currently not indexed — “The page was found by Google, but not crawled yet.” (ترجمة) «عثرت Google على الصفحة لكنها لم تزحفها بعد». تعرف Google روابط لم تصل إليها.
- Duplicate without user-selected canonical — “This page is a duplicate of another page, although it doesn’t indicate a preferred canonical page.” (ترجمة) «هذه الصفحة نسخة من صفحة أخرى، لكنها لا تحدد صفحة canonical مفضلة».
- Duplicate, Google chose different canonical than user — “Google thinks another URL makes a better canonical.” (ترجمة) «ترى Google أن رابطًا آخر canonical أفضل».
- Soft 404 — “it returns a user-friendly ‘not found’ message but not a 404 HTTP response code.” (ترجمة) «تعيد رسالة “غير موجود” مفهومة للمستخدم، لكنها لا تعيد رمز استجابة HTTP 404».
ومن الحالات ذات الصلة في التقرير نفسه: “Alternate page with proper canonical tag” (ترجمة) «صفحة بديلة تتضمن وسم canonical صحيحًا»، و”Page with redirect” (ترجمة) «صفحة تتضمن إعادة توجيه»، و”Blocked by robots.txt” (ترجمة) «محجوبة بملف robots.txt»، و”Excluded by ‘noindex’ tag” (ترجمة) «مستبعدة بوسم noindex»؛ وهي أسماء الحالات الدقيقة كما تعرضها Google.
هناك تفصيل مهم في “Crawled - currently not indexed”: وصفها مولر بأنها إشارة إلى جودة الموقع عمومًا، لا خللًا في صفحة بعينها. قال: “You can’t force pages to be indexed — it’s normal that we don’t index all pages on all websites. It’s not an issue with ‘that page’, it’s more site-wide. Creating a good site structure and making sure the site is of the highest quality possible is essentially the direction.” (ترجمة) «لا يمكنك إجبار الصفحات على الفهرسة؛ فمن الطبيعي ألا نفهرس كل صفحات كل المواقع. ليست المشكلة في “تلك الصفحة” بل على مستوى الموقع، والاتجاه الصحيح هو إنشاء بنية جيدة وضمان أعلى جودة ممكنة». وأضاف: “If there are overall issues with your site, you need to look at the rest of your site, not the URLs that didn’t end up getting indexed.” (ترجمة) «إذا كانت في موقعك مشكلات عامة، فانظر إلى بقية الموقع لا إلى الروابط التي لم تُفهرس». لكن لا تبالغ في تفسير الحالة؛ فقد قال أيضًا: “It’s not meant to highlight low quality content issues.” (ترجمة) «ليس المقصود منها إبراز مشكلات المحتوى منخفض الجودة».
وتشمل بقية أدوات التشخيص:
- عامل
site:للفحص السريع فقط، مثلsite:example.com inurl:?أوsite:example.com/tag/لاكتشاف نمط من التضخم. لا تستشهد به عددًا دقيقًا، وطابقه مع GSC. - تحليل ملفات السجل لمعرفة أين يقضي Googlebot وقته فعليًا. فإذا ذهبت نسبة كبيرة من الطلبات إلى روابط المعلمات أو الأوجه أو الخلاصات، فهذا زحف مهدور.
- أدوات زحف المواقع، مثل Ahrefs Site Audit وScreaming Frog، لاكتشاف الصفحات الضحلة والمكررة واليتيمة وروابط المعلمات القابلة للفهرسة ومجموعات النسخ شبه المكررة، ثم مقارنة الروابط القابلة للزحف والفهرسة بخريطة XML والصفحات التي تحصل على زيارات فعلًا.
- الفجوة بين المزحوف والمرتب، وهي طريقتي: قارن عدد الصفحات القابلة للفهرسة أو المزحوفة بعدد الصفحات التي ترتب أو تستقبل زيارات. والفرق قائمة مرشحي الزومبي أو التضخم التي تحتاج إلى فرز.
كيفية الإصلاح: اختر الأداة الصحيحة
Use noindex for a page that stays live but should not appear in search, canonical for a duplicate of a useful URL, 404 or 410 for a permanently gone URL, and consolidation when several thin pages serve one intent. Use robots.txt only to stop wasteful crawling because it does not deindex the URL.
© Patrick Stox LLC · CC BY 4.0 ·
لا يوجد إصلاح واحد. تعالج كل صفحة بحسب ماهيتها وقيمتها. يلخص جدول القرار، المعروض كاملًا في تبويب Cheat Sheets، المسألة كلها؛ وهذه حجة كل وسيلة:
noindex: الإزالة من الفهرس. استخدمه عندما لا تكون للصفحة قيمة بحث ولا ينبغي أن تظهر، مثل نتائج البحث الداخلي وصفحات الشكر وصفحات الوسوم أو عوامل التصفية الضحلة. فهو يزيلها من النتائج. تقول Google: “Google will drop that page entirely from Google Search results, regardless of whether other sites link to it.” (ترجمة) «ستزيل Google الصفحة كليًا من نتائج Google Search، بصرف النظر عن روابط المواقع الأخرى إليها». ويمنع noindex فهرسة صفحات الأوجه بصورة مؤكدة. أما التحذير الحاسم: فيجب أن تبقى الصفحة قابلة للزحف كي يعمل noindex. تقول Google: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file.” (ترجمة) «لكي تكون قاعدة noindex فعالة، يجب ألا تكون الصفحة أو المورد محجوبًا بملف robots.txt». فإذا حجبتها أولًا لن ترى Google الوسم.
rel=canonical: دمج النسخ المكررة ذات القيمة. استخدمه للنسخ شبه المكررة التي تحمل روابط أو قيمة، مثل نسخ المعلمات والطباعة والبروتوكول أو المضيف. رابط canonical هو “the URL of a page that Google chose as the most representative from a set of duplicate pages,” (ترجمة) «رابط الصفحة التي اختارتها Google بوصفها الأكثر تمثيلًا من مجموعة صفحات مكررة»، وتحديده وسيلة لدمج الإشارات. لكنه تلميح لا أمر: “indicating a canonical preference is a hint, not a rule,” (ترجمة) «الإشارة إلى تفضيل canonical تلميح وليست قاعدة»، كما أن “Google may choose a different page as canonical than you do, for various reasons.” (ترجمة) «قد تختار Google صفحة canonical مختلفة عن اختيارك لأسباب متعددة». وهناك قاعدة حاسمة أكررها دائمًا: لا تجمع noindex وrel=canonical في الصفحة نفسها، فهما تعليمان متعارضان.
disallow في robots.txt: إيقاف الزحف فقط. استخدمه لإبعاد برامج الزحف عن أحجام ضخمة من الروابط الرديئة القابلة للزحف التي لا تحتاج إلى فهرستها ولا إلى إشاراتها، مثل تركيبات الأوجه اللانهائية. وبشأن التنقل متعدد الأوجه تحديدًا يقول إيليس: “If you don’t need these URLs indexed, use robots.txt to disallow crawling.” (ترجمة) «إذا لم تكن بحاجة إلى فهرسة هذه الروابط، فاستخدم robots.txt لمنع زحفها». لكن افهم ما يفعله وما لا يفعله؛ فهو “is not a mechanism for keeping a web page out of Google,” (ترجمة) «ليس آلية لإبقاء صفحة ويب خارج Google»، كما أن “a page that’s disallowed in robots.txt can still be indexed if linked to from other sites.” (ترجمة) «قد تظل الصفحة الممنوعة في robots.txt مفهرسة إذا ربطت بها مواقع أخرى». إنه يوقف الزحف ولا يزيل الروابط المفهرسة من الفهرس.
404 و410: صفحات زالت فعلًا. أعد هاتين الحالتين للصفحات التي ينبغي ألا تعود موجودة. 410 إشارة أقوى قليلًا إلى الزوال، أما 404 فهي “a strong signal not to crawl that URL again.” (ترجمة) «إشارة قوية إلى عدم زحف ذلك الرابط مرة أخرى».
الدمج أو التشذيب: صفحات ضحلة كثيرة حول موضوع واحد. اجمعها في صفحة قوية واحدة، وأعد توجيه البقية بـ301، أو احذفها. تصوغ Google الأمر هكذا: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (ترجمة) «ادمج المحتوى المكرر لتركيز الزحف على المحتوى الفريد بدل الروابط الفريدة». وهذا أفضل إصلاح طويل الأمد للمحتوى الضحل.
أداة Removals: حل مؤقت فقط. تزيل أداة Removals في GSC رابطًا من النتائج بسرعة، لكنها ضماد مؤقت: “Requests made in the Removals tool last for about 6 months.” (ترجمة) «تستمر الطلبات المقدمة عبر أداة Removals نحو 6 أشهر». اربطها دائمًا بطريقة دائمة مثل noindex أو 404/410 أو الحذف.
قاعدة التسلسل التي توقع الجميع في الخطأ
لإزالة رابط منخفض القيمة مفهرس بالفعل نهائيًا، طبق noindex أو 404/410 وأبقه قابلًا للزحف حتى تعيد Google معالجته. لا تضف disallow في robots.txt إلا بعد خروجه من الفهرس إذا أردت عندها توفير الزحف. الحجب أولًا يحبسه في الفهرس؛ إذ لا تستطيع Google قراءة noindex في صفحة لا تستطيع زحفها، وقد يبقى الرابط في النتائج، وأحيانًا بلا مقتطف، إلى أجل غير محدد.
خرافات شائعة ينبغي تفنيدها
- “Google penalizes index bloat / duplicate content.” (ترجمة) «تعاقب Google تضخم الفهرس أو المحتوى المكرر». لا؛ ليست هناك عقوبة، بل زحف مهدور وإشارات مخففة.
- “robots.txt will remove pages from the index.” (ترجمة) «يزيل robots.txt الصفحات من الفهرس». لا؛ يوقف الزحف فقط، وقد تفهرس الروابط الممنوعة عبر الروابط الواردة.
- “noindex saves crawl budget.” (ترجمة) «يوفر noindex ميزانية الزحف». لا؛ يجب أن تطلب Google الصفحة أولًا كي ترى noindex.
- “You can noindex AND robots.txt-block the same page to be safe.” (ترجمة) «يمكن الجمع بين noindex والحجب في robots.txt احتياطًا». لا؛ فإذا حُجبت الصفحة تعذر على Google قراءة noindex وقد تبقى مفهرسة.
- “rel=canonical forces consolidation.” (ترجمة) «يفرض rel=canonical الدمج». لا؛ إنه تلميح وقد تختار Google canonical مختلفًا.
- “The
site:operator gives an exact indexed count.” (ترجمة) «يعطي عاملsite:عددًا دقيقًا للصفحات المفهرسة». لا؛ هو تقدير. ثق بتقرير فهرسة الصفحات في GSC. - “More indexed pages = better.” (ترجمة) «المزيد من الصفحات المفهرسة أفضل». لا؛ الجودة أهم من الكمية، فالروابط منخفضة القيمة تهدر الزحف وتخفف الإشارات.
الوقاية: ابنِ حواجز حماية
أفضل إصلاح هو منع نشوء التضخم أصلًا:
- noindex على مستوى قوالب CMS للأنواع التي ينبغي ألا ترتب، مثل البحث الداخلي وصفحات التصفية الضحلة وبعض الأرشيفات؛ اضبطه مرة في القالب لا لكل صفحة.
- انضباط المعلمات؛ قرر مسبقًا المعلمات التي تنشئ روابط قابلة للفهرسة وتلك التي تستخدم canonical أو تُحجب.
- روابط متسقة؛ اختر بروتوكولًا ومضيفًا واتفاقية للشرطة المائلة الختامية وطبقها.
- عمليات تدقيق دورية؛ أعد فحص الفجوة بين المزحوف والمرتب كل ربع سنة كي لا يتسلل التضخم مجددًا.
يقع هذا الموضوع بجوار موضوعات شقيقة: ميزانية الزحف، وهي المورد الذي يهدره تضخم الفهرس، وتحديد canonical، وهو وسيلة الدمج الأساسية، والتنقل متعدد الأوجه، وهو المصدر الأكثر شيوعًا. وللصورة الأوسع عن دخول الصفحات إلى الفهرس وبقائها خارجه، راجع محور الفهرسة.
ملخص الذكاء الاصطناعي
خلاصة مكثفة للنسخة المتقدمة:
- “تضخم الفهرس” مصطلح SEO لا تستخدمه Google. المشكلة الفعلية فهرسة روابط ضحلة أو مكررة أو منخفضة القيمة، مثل التنقل متعدد الأوجه والمعلمات والبحث الداخلي وصفحات الوسوم والأرشيفات وترقيم الصفحات وأخطاء 404 الزائفة ونسخ البروتوكول والمضيف.
- يتعلق بالجودة لا بعدد الصفحات. قد يكون موقع صغير فوضويًا وموقع ضخم نظيفًا.
- ليس عقوبة. تقول Bing: “Duplicate content doesn’t trigger search penalties on its own.” (ترجمة) «لا يؤدي المحتوى المكرر بمفرده إلى عقوبات بحث». ويقول مولر: “We don’t have a duplicate content penalty.” (ترجمة) «ليس لدينا عقوبة للمحتوى المكرر». التكلفتان الفعليتان هما إهدار الزحف، إذ تحرم الروابط الرديئة صفحاتك الجيدة، وتخفيف الإشارات بين النسخ شبه المكررة.
- يهم أساسًا في المواقع الكبيرة أو المعتمدة على القوالب مثل التجارة الإلكترونية والناشرين وأنظمة CMS المنشئة تلقائيًا. تحقق أولًا من أنه مشكلة فعلية.
- شخّصه بتقرير فهرسة الصفحات في GSC، وهو المرجع الموثوق “complete and accurate” (ترجمة) «الكامل والدقيق». راقب فئتي “Crawled - currently not indexed” و”Duplicate”، واستخدم
site:تقديرًا تقريبيًا فقط، مع السجلات وأدوات الزحف وفجوة المزحوف مقابل المرتب. - عالج حسب القصد:
noindexللإزالة مع إبقاء الصفحة قابلة للزحف؛ وrel=canonicalلدمج النسخ المكررة مع كونه تلميحًا لا قاعدة، ولا تجمعه مع noindex؛ وrobots.txt لإيقاف الزحف فقط، فهو لا يزيل الروابط المفهرسة؛ و404/410للصفحات الزائلة؛ والدمج للمحتوى الضحل. - التسلسل: لإزالة رابط مفهرس، طبق noindex أو 404/410 وأبقه قابلًا للزحف حتى يخرج، ثم احجبه في robots.txt إن لزم. الحجب أولًا يحبسه في الفهرس.
- أداة Removals مؤقتة لنحو 6 أشهر، فاربطها بإصلاح دائم.
- امنع المشكلة عبر noindex على مستوى قوالب CMS، وانضباط المعلمات، واتساق الروابط، والتدقيق الدوري.
الوثائق الرسمية
وثائق المصادر الأولية من محركات البحث.
- تحسين ميزانية الزحف — الآلية الأساسية لإهدار التضخم للزحف، ودمج النسخ المكررة، وحالات soft 404s، وسبب عدم استخدام noindex لتوفير الزحف.
- إدارة ميزانية الزحف — منظور البنية التحتية: الويب “شبه لانهائي”، وزحف الروابط الرديئة يكلفك بقية موقعك.
- زحف ديسمبر: التنقل متعدد الأوجه — غاري إيليس عن الأوجه بوصفها المصدر الأول للزحف المفرط، ومتى تحجبها أو تحسنها.
- منع الفهرسة باستخدام noindex — وظيفة noindex وضرورة بقاء الصفحة قابلة للزحف.
- مقدمة إلى robots.txt — سبب كون disallow غير صالح لإزالة الفهرسة.
- تحديد canonical للروابط وتحديد canonical — تعريف canonical وأسباب التكرار وكونه “تلميحًا لا قاعدة”.
- تقرير فهرسة الصفحات — العدد المرجعي وحالات عدم الفهرسة التي تشير إلى التضخم.
- إزالة معلومات من Google — أداة Removals وسبب كونها مؤقتة.
Bing وMicrosoft
- هل يضر المحتوى المكرر SEO والظهور في بحث الذكاء الاصطناعي؟ — إعادة تأطير Bing للروابط المكررة أو منخفضة القيمة بوصفها مشكلة كفاءة زحف وتخفيف إشارات لا عقوبة.
اقتباسات من المصدر
تصريحات موثقة من Google وBing، ويقود كل رابط مباشرة إلى المقطع المقتبس في صفحة المصدر.
Google: لا عقوبة، بل زحف مهدور وإشارات مخففة
- “this wastes a lot of Google crawling time on your site.” (ترجمة) «يهدر هذا قدرًا كبيرًا من وقت زحف Google في موقعك». — وثائق Google Search Central. الانتقال إلى الاقتباس
- “If Google spends too much time crawling URLs that it shouldn’t, Google’s crawlers might decide that it’s not worth the time to look at the rest of your site.” (ترجمة) «إذا أمضت Google وقتًا أطول مما ينبغي في زحف روابط لا ينبغي زحفها، فقد تقرر برامج زحفها أن فحص بقية موقعك لا يستحق الوقت». الانتقال إلى الاقتباس
- “The web is a nearly infinite space, exceeding Google’s ability to explore and index every available URL.” (ترجمة) «الويب مساحة شبه لانهائية تتجاوز قدرة Google على استكشاف كل رابط متاح وفهرسته». الانتقال إلى الاقتباس
Google وغاري إيليس: التنقل متعدد الأوجه، المصدر الأول
- “faceted navigation is by far the most common source of overcrawl issues site owners report to us.” (ترجمة) «التنقل متعدد الأوجه هو بفارق كبير أكثر مصادر مشكلات الزحف المفرط التي يبلغنا بها مالكو المواقع شيوعًا». — غاري إيليس، Google، Crawling December لعام 2024. الانتقال إلى الاقتباس
- “Because it can generate a near-infinite number of URLs.” (ترجمة) «لأنه يستطيع إنشاء عدد شبه لا نهائي من الروابط». — غاري إيليس، Google. الانتقال إلى الاقتباس
- “This overcrawling slows down the discovery of your important, new content.” (ترجمة) «يبطئ هذا الزحف المفرط اكتشاف محتواك المهم والجديد». — غاري إيليس، Google. الانتقال إلى الاقتباس
- “If you don’t need these URLs indexed, use robots.txt to disallow crawling.” (ترجمة) «إذا لم تكن بحاجة إلى فهرسة هذه الروابط، فاستخدم robots.txt لمنع زحفها». — غاري إيليس، Google. الانتقال إلى الاقتباس
Google: أدوات noindex وrobots.txt وcanonical
- “Google will drop that page entirely from Google Search results, regardless of whether other sites link to it.” (ترجمة) «ستزيل Google الصفحة كليًا من نتائج Google Search، بصرف النظر عن روابط المواقع الأخرى إليها». — وثائق Google Search Central عن noindex. الانتقال إلى الاقتباس
- “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file.” (ترجمة) «لكي تكون قاعدة noindex فعالة، يجب ألا تكون الصفحة أو المورد محجوبًا بملف robots.txt». الانتقال إلى الاقتباس
- “it is not a mechanism for keeping a web page out of Google.” (ترجمة) «ليس آلية لإبقاء صفحة ويب خارج Google». — وثائق Google Search Central عن robots.txt. الانتقال إلى الاقتباس
- “A page that’s disallowed in robots.txt can still be indexed if linked to from other sites.” (ترجمة) «قد تظل الصفحة الممنوعة في robots.txt مفهرسة إذا ربطت بها مواقع أخرى». الانتقال إلى الاقتباس
- “a canonical URL is the URL of a page that Google chose as the most representative from a set of duplicate pages.” (ترجمة) «رابط canonical هو رابط الصفحة التي اختارتها Google بوصفها الأكثر تمثيلًا من مجموعة صفحات مكررة». الانتقال إلى الاقتباس
- “indicating a canonical preference is a hint, not a rule.” (ترجمة) «الإشارة إلى تفضيل canonical تلميح وليست قاعدة». الانتقال إلى الاقتباس
- “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (ترجمة) «ادمج المحتوى المكرر لتركيز الزحف على المحتوى الفريد بدل الروابط الفريدة». الانتقال إلى الاقتباس
- “a 404 status code is a strong signal not to crawl that URL again.” (ترجمة) «رمز الحالة 404 إشارة قوية إلى عدم زحف ذلك الرابط مرة أخرى». الانتقال إلى الاقتباس
Google: التشخيص في تقرير فهرسة الصفحات وأداة Removals
- “The indexed + not indexed totals above the chart are complete and accurate from Google’s perspective.” (ترجمة) «إجماليا الصفحات المفهرسة وغير المفهرسة أعلى الرسم كاملان ودقيقان من منظور Google». الانتقال إلى الاقتباس
- “The page was crawled by Google but not indexed. It may or may not be indexed in the future.” (ترجمة) «زحفت Google الصفحة لكنها لم تفهرسها، وقد تُفهرس مستقبلًا أو لا». — حالة “Crawled - currently not indexed”. الانتقال إلى الاقتباس
- “Requests made in the Removals tool last for about 6 months.” (ترجمة) «تستمر الطلبات المقدمة عبر أداة Removals نحو 6 أشهر». الانتقال إلى الاقتباس
Google وجون مولر: جودة على مستوى الموقع لا عقوبة
- “you can’t force pages to be indexed — it’s normal that we don’t index all pages on all websites. It’s not an issue with ‘that page’, it’s more site-wide. Creating a good site structure and making sure the site is of the highest quality possible is essentially the direction.” (ترجمة) «لا يمكن فرض فهرسة الصفحات؛ فمن المعتاد ألا تفهرس Google كل صفحة في كل موقع. ولا تتعلق المسألة بصفحة منفردة، بل بالموقع عمومًا، لذا ينبغي تحسين بنيته والارتقاء بجودته قدر الإمكان». — جون مولر، ممثل Google لشؤون البحث، 2021. الانتقال إلى الاقتباس
- “If there are overall issues with your site, you need to look at the rest of your site, not the URLs that didn’t end up getting indexed.” (ترجمة) «إن كانت المشكلة عامة في الموقع، فافحص بقية الموقع بدل التركيز على الروابط التي لم تدخل الفهرس». — جون مولر، Google. الانتقال إلى الاقتباس
- “We don’t have a duplicate content penalty. It’s not that we would demote a site for having a lot of duplicate content.” (ترجمة) «لا تطبق Google عقوبة للمحتوى المكرر، ولا تخفض موقعًا لمجرد كثرة المحتوى المكرر فيه». — جون مولر، Google. الانتقال إلى الاقتباس
Bing وفابريس كانيل وكريشنا مادهافان: لا عقوبة بل تخفيف للإشارات
- “Duplicate content doesn’t trigger search penalties on its own.” (ترجمة) «لا يؤدي المحتوى المكرر بمفرده إلى عقوبات بحث». — فابريس كانيل وكريشنا مادهافان، Microsoft Bing، 2025. الانتقال إلى الاقتباس
- “signals such as clicks, links, impressions, and engagement are often diluted.” (ترجمة) «غالبًا ما تتخفف إشارات مثل النقرات والروابط ومرات الظهور والتفاعل». — Microsoft Bing. الانتقال إلى الاقتباس
قائمة تحقق لتدقيق تضخم الفهرس
اتبع هذه الخطوات عندما تشتبه في وجود تضخم، لكن خفف التوتر أولًا؛ فمعظم المواقع لا تواجه مشكلة حقيقية:
- تأكدت من النطاق عبر تقرير فهرسة الصفحات في GSC لا عامل
site:، وسجلت ما إذا كانت فئتا “Crawled - currently not indexed” و”Duplicate” كبيرتين على نحو غير معتاد. - حسبت الفجوة بين المزحوف والمرتب بمقارنة الصفحات القابلة للفهرسة أو المزحوفة بتلك التي ترتب أو تحصل على زيارات، وأنشأت قائمة مرشحين من الفرق.
- فحصت سجلات الخادم بحثًا عن زحف يذهب إلى روابط المعلمات أو الأوجه أو الخلاصات أو البحث.
- شغلت أداة زحف للموقع، مثل Ahrefs Site Audit أو Screaming Frog، لاكتشاف الصفحات الضحلة والمكررة واليتيمة وروابط المعلمات القابلة للفهرسة.
- حددت أنماط المصدر الموجودة: التنقل متعدد الأوجه، ومعلمات URL، والبحث الداخلي، وأرشيفات وخلاصات الوسوم والتصنيفات والمؤلفين، وترقيم الصفحات، ونسخ البروتوكول والمضيف، وأخطاء 404 الزائفة، والمساحات اللانهائية، والصفحات الضحلة أو المنشأة آليًا.
- اخترت لكل نمط الأداة الصحيحة بحسب القصد، بالرجوع إلى جدول القرار في تبويب Cheat Sheets.
- أكدت أن الروابط التي تحمل
noindexلا تزال قابلة للزحف وليست محجوبة أيضًا في robots.txt. - أكدت عدم جمع
noindexوrel=canonicalفي أي صفحة. - طبقت
noindexأو404/410أولًا على الروابط الرديئة المفهرسة وأبقيتها قابلة للزحف، ولم أجدول حجب robots.txt إلا بعد خروجها. - لم أعتمد أداة Removals إصلاحًا دائمًا، فهي تستمر نحو 6 أشهر.
- وضعت حواجز وقاية: noindex في قالب CMS، وقواعد للمعلمات، وروابط متسقة، وإعادة تدقيق ربع سنوية.
النماذج الذهنية
1. الجودة لا الكمية. لا يعني تضخم الفهرس “صفحات كثيرة جدًا”، بل “صفحات مفهرسة لا قيمة لها في البحث”. لا يكون سؤال التدقيق “كم صفحة لدي؟”، بل “أي هذه الصفحات تستحق مكانها في الفهرس؟”.
2. الكفاءة مع تخفيف الإشارات، لا عقوبة. لا توجد عقوبة لتضخم الفهرس ولا للمحتوى المكرر. التكلفتان الفعليتان هما الزحف المهدور، إذ تحرم الروابط الرديئة صفحاتك الجيدة، والإشارات المخففة، إذ تتوزع القيمة بين النسخ شبه المكررة. صغ كل توصية حول هذين الأثرين لا حول الخوف من خفض الترتيب.
3. بوابة “هل يهم هذا أصلًا؟” طبقها قبل لمس أي شيء: هل الموقع كبير أو معتمد على القوالب؟ هل يتأخر زحف الصفحات المهمة أو الجديدة وفهرستها؟ هل تتضخم فئة “Crawled - currently not indexed” أو “Duplicate” في GSC؟ إذا لم يتحقق شيء من ذلك، فالتضخم تجميلي غالبًا، ومن الأفضل أن تنفق وقتك في مكان آخر.
4. طابق الأداة مع قصد الرابط.
الإصلاح كله قرار توجيه لكل نوع من الروابط: بلا قيمة ← noindex؛ نسخة مكررة ذات قيمة ← rel=canonical؛ روابط رديئة ضخمة لا تريد حتى جلبها ← robots.txt؛ زالت فعلًا ← 404/410؛ صفحات ضحلة كثيرة ← الدمج. راجع جدول القرار في Cheat Sheets.
5. التسلسل مهم: أزل الفهرسة قبل الحجب.
لإزالة رابط مفهرس، أبقه قابلًا للزحف وهو يحمل noindex أو يعيد 404/410 حتى تعيد Google معالجته؛ ولا تحجبه في robots.txt إلا بعد زواله. إذا حجبت أولًا حبسته في الفهرس.
6. العدد المرجعي في GSC.
عامل site: تقدير تقريبي لاكتشاف الأنماط. أما تقرير فهرسة الصفحات فهو مصدر العدد، وأسباب عدم الفهرسة فيه هي أداة التشخيص الفعلية.
جدول قرار الإصلاح: noindex أم canonical أم robots.txt أم 404/410 أم الدمج؟
| الحالة | الاستخدام | السبب أو التحذير |
|---|---|---|
| صفحة بلا قيمة بحث ولا ينبغي أن تظهر، مثل البحث الداخلي وصفحة الشكر وصفحات الوسوم أو التصفية الضحلة | noindex | يزيلها من الفهرس. يجب أن تبقى قابلة للزحف، فلا تحجبها أيضًا في robots.txt. |
| نسخة مكررة أو شبه مكررة ذات قيمة أو روابط، مثل نسخ المعلمات والطباعة وhttp/https وwww | rel=canonical، أو 301 إن أمكن إلغاء النسخة نهائيًا | يدمج الإشارات. وهو تلميح لا قاعدة وقد تتجاوزه Google. لا تجمعه مع noindex. |
| حجم ضخم من الروابط الرديئة القابلة للزحف لا تريد فهرستها ولا إشاراتها، مثل تركيبات الأوجه اللانهائية | disallow في robots.txt | يوقف الزحف، لكنه لا يزيل الروابط المفهرسة وقد تبقى بلا مقتطف. استخدم noindex أولًا إذا كانت مفهرسة. |
| صفحة زالت فعلًا | 404 / 410 | 410 إشارة أقوى قليلًا إلى الزوال، و404 “إشارة قوية إلى عدم زحف الرابط مرة أخرى”. |
| صفحات ضحلة كثيرة حول موضوع واحد | الدمج أو التشذيب | اجمعها في صفحة قوية واحدة وأعد توجيه البقية بـ301 أو احذفها. أفضل إصلاح طويل الأمد للمحتوى الضحل. |
| حاجة مؤقتة إلى إخراج صفحة سريعًا من النتائج | أداة Removals في GSC | تستمر نحو 6 أشهر؛ اربطها بطريقة دائمة مثل noindex أو 404 أو الحذف. |
قاعدة التسلسل: لإزالة رابط منخفض القيمة مفهرس بالفعل نهائيًا، طبق noindex أو 404/410 وأبقه قابلًا للزحف حتى تعيد Google معالجته؛ ثم أضف disallow في robots.txt بعد خروجه من الفهرس. الحجب أولًا يحبسه مفهرسًا.
ورقة تشخيص سريعة
| الطريقة | ما الذي توضحه؟ | التحذير |
|---|---|---|
| تقرير فهرسة الصفحات في GSC | الإجماليات المرجعية للمفهرس وغير المفهرس وأسباب عدم الفهرسة | استخدمه بدل site:، وراقب فئتي “Crawled - currently not indexed” و”Duplicate” |
عامل site: | انطباع تقريبي عن نمط التضخم، مثل inurl:? أو /tag/ | تقدير فقط، لا عدد دقيق |
| تحليل ملفات السجل | أين ينفق Googlebot الزحف فعلًا | تحقق من أنه Googlebot الحقيقي |
| أداة زحف للموقع، مثل Ahrefs أو Screaming Frog | روابط ضحلة ومكررة ويتيمة ومعلمات قابلة للفهرسة | طابق النتائج مع خريطة الموقع والزيارات |
| الفجوة بين المزحوف والمرتب | قائمة مرشحي الزومبي أو التضخم | الفرق مرشحون للفرز، لا للحذف الآلي |
أدوات العثور على تضخم الفهرس وإصلاحه
- Google Search Console: تقرير فهرسة الصفحات — العدد المرجعي وأسباب عدم الفهرسة. ابدأ هنا؛ فهو الحقيقة الأساسية لا
site:. - فحص URL في GSC — يوضح كيفية زحف رابط منفرد وعرضه وفهرسته وcanonical الذي اختارته Google.
- أداة Removals في GSC — تخرج رابطًا من النتائج سريعًا بصورة مؤقتة لنحو 6 أشهر؛ اربطها بإصلاح دائم.
- Ahrefs Site Audit وScreaming Frog SEO Spider — تحاكي الزحف لتكشف الصفحات الضحلة والمكررة واليتيمة وروابط المعلمات القابلة للفهرسة ومجموعات النسخ شبه المكررة؛ قارنها بخريطة الموقع والصفحات التي تكسب زيارات.
- تحليل ملفات سجل الخادم — يوضح أين يذهب الزحف، عبر Screaming Frog Log File Analyser أو BigQuery أو منصة سجلات. راجع تحليل ملفات السجل.
- Ahrefs Webmaster Tools — زحف وتدقيق مجانيان للمواقع التي تثبت ملكيتها.
- Bing Webmaster Tools — تغطية فهرس Bing ومعلومات الزحف.
موارد تستحق وقتك
من كتاباتي ذات الصلة
- الدليل الشامل للتنقل متعدد الأوجه — المصدر الأول لتضخم الفهرس وضوابطه، ومنه تعريف “قيمة البحث”.
- دليل شامل لتحديد canonical — وسيلة الدمج الأساسية ونحو 40 إشارة canonical وقاعدة عدم الجمع بين noindex وrel=canonical.
- المحتوى المكرر: سبب حدوثه وكيفية إصلاحه — ويتضمن قول مولر إنه لا توجد عقوبة للمحتوى المكرر.
- Crawled – Currently Not Indexed — حالة GSC التي تمثل البصمة التقليدية للتضخم.
- دليل المبتدئين إلى SEO التقني — موضع الفهرسة في الصورة الأكبر.
من محاضراتي
- كيف يعمل البحث على SlideShare — شرحي لمسار الزحف ← الفهرسة ← العرض. وينطبق التنبيه المعتاد: “This is my understanding of systems… not going to be 100% complete or accurate.” (ترجمة) «هذا فهمي للأنظمة، ولن يكون كاملًا أو دقيقًا بنسبة 100%».
من الآخرين
- سلسلة Crawling December من Google — أفضل مجموعة مركزة من شروح الزحف والفهرسة، ومنها حديث غاري إيليس عن التنقل متعدد الأوجه.
- r/TechSEO — مجتمع لاستكشاف مشكلات الزحف والفهرسة.
- تضخم الفهرس في SEO: ماهيته وكيفية إصلاحه في Search Engine Land — نظرة عامة جيدة تشمل حواجز الأتمتة وnoindex على مستوى قوالب CMS.
- هل Crawled – Currently Not Indexed علامة على مشكلة جودة في Google؟ في Search Engine Roundtable لباري شوارتز — تغطية تأطير مولر للحالة بوصفها إشارة جودة على مستوى الموقع لا خللًا في صفحة بعينها.
- تضخم الفهرس من Inflow — معالجة موجهة للتجارة الإلكترونية للأوجه والمعلمات.
- Screaming Frog SEO Spider — أداة الزحف واسعة الاستخدام لتدقيق الصفحات الضحلة والمكررة واليتيمة وروابط المعلمات القابلة للفهرسة إلى جانب Ahrefs Site Audit.
أمثلة تطبيقية
1. تنقل متعدد الأوجه ينفجر إلى روابط قابلة للفهرسة
https://example.com/shoes/
https://example.com/shoes/?color=red
https://example.com/shoes/?color=red&size=9
https://example.com/shoes/?color=red&size=9&sort=price-asc
https://example.com/shoes/?color=red&size=9&sort=price-asc&in-stock=true- خطأ: السماح لـCMS بربط كل تركيبة تلقائيًا وتركها كلها قابلة للزحف والفهرسة. تضاعف كل معلمة عدد الروابط، ولا يوجد طلب بحث فريد على التركيبات العميقة.
- صحيح: قرر المعلمات التي تغير المحتوى بما يكفي لاستحقاق رابط مفهرس مستقل، وغالبًا
colorفقط، وتلك التي ليست إلا ضجيج ترتيب أو تصفية مثلsortوin-stock. وجّه معلمات الضجيج بـcanonical إلى/shoes/?color=red، واحجب أكثر التركيبات ضجيجًا في robots.txt إذا ظلت تولد زحفًا بعد تحديد canonical.
2. فخ noindex مع robots.txt
# robots.txt
User-agent: *
Disallow: /search/<!-- /search/?q=running+shoes -->
<meta name="robots" content="noindex">- خطأ: يبدو الجمع حماية مزدوجة لكنه يرتد عليك. يحجب robots.txt Googlebot، فلا يجلب
/search/?q=running+shoesمجددًا ولا يرى وسمnoindex. وإذا كان الرابط مفهرسًا فقد يبقى مفهرسًا إلى أجل غير محدد، وغالبًا بلا مقتطف. - صحيح: أزل سطر
Disallow: /search/أولًا، ودعnoindexيعمل؛ تعيد Google الزحف وتقرأ الوسم وتزيل الصفحة. أكد عبر تقرير فهرسة الصفحات في GSC انتقال الرابط إلى “Excluded by noindex tag,” (ترجمة) «مستبعد بوسم noindex»، ثم أضف حجب robots.txt فقط إذا أردت توفير الزحف في هذا المسار مستقبلًا.
3. محتوى مكرر من نسخ البروتوكول والمضيف يُصلح بـcanonical
http://example.com/guide/
http://www.example.com/guide/
https://example.com/guide/
https://www.example.com/guide/- خطأ: تقديم محتوى مطابق في النسخ الأربع وترك Google تختار ما تشاء؛ فتتوزع قيمة الروابط وإشارات التفاعل على أربعة مسارات.
- صحيح: اختر تركيبة مضيف وبروتوكول canonical واحدة، مثل
https://www.example.com/guide/، وأعد توجيه النسخ الثلاث الأخرى إليها بـ301، وأضف<link rel="canonical" href="https://www.example.com/guide/">إشارة احتياطية. تحقق عبر canonical-checker (/tools/canonical-checker) من أن النسخ الأربع تصل إلى canonical المعلن نفسه.
4. دمج أرشيفات وسوم ضحلة بدل تطبيق noindex عليها
لدى ناشر /tag/seo/ و/tag/seo-tips/ و/tag/technical-seo/، وهي ثلاث صفحات أرشيف شبه متطابقة تعرض كل منها مقالتين أو ثلاثًا من المنشورات نفسها.
- خطأ: تطبيق noindex على الصفحات الثلاث وخسارة قيمة الربط الداخلي التي قدمتها، أو إبقاؤها كلها مفهرسة بوصفها نسخًا ضحلة شبه مكررة.
- صحيح: ادمجها في أرشيف واحد هو
/tag/seo/، وأعد توجيه الاثنين الآخرين بـ301، وحدّث الروابط الداخلية إلى الرابط الباقي. هذا “دمج” لا “noindex” لأن الصفحات تحمل بعض قيمة الربط والتنظيم المشروعة، لكنها مجزأة.
اختبارات التحقق
أكد أن كل إصلاح أصبح نافذًا فعلًا؛ ولا تفترض نجاحه لمجرد نشره.
اختبار: أزال noindex رابطًا منخفض القيمة من الفهرس
- الاختبار: بعد إضافة
noindexوالتأكد من أن الصفحة غير محجوبة في robots.txt باستخدام robots-txt-tester (/tools/robots-txt-tester)، افحص حالة الرابط في تقرير فهرسة الصفحات في GSC أو عبر فحص URL. - النتيجة المتوقعة: تنتقل الحالة إلى “Excluded by ‘noindex’ tag”.
- تفسير الإخفاق: ما زالت “Indexed” أو أصبحت “Blocked by robots.txt”؛ الصفحة عالقة في الفهرس لأن Google لا تستطيع زحفها لقراءة noindex.
- نافذة المراقبة: من أسبوع إلى 4 أسابيع لإعادة الزحف والمعالجة، بحسب تكرار زحف الرابط.
- سبب التراجع: إذا بقيت مفهرسة بعد أكثر من 4 أسابيع، فتحقق من عدم حجب robots.txt، ثم استخدم أداة Removals حلًا مؤقتًا حتى ينتشر noindex.
اختبار: يمنع disallow في robots.txt الزحف فعلًا، لا الفهرسة
- الاختبار: أضف قاعدة
Disallow، وتحقق من تحليلها عبر robots-txt-tester (/tools/robots-txt-tester)، ثم افحص سجلات الخادم باستخدام log-file-analyzer (/tools/log-file-analyzer) بحثًا عن طلبات Googlebot المستمرة للمسار المحجوب. - النتيجة المتوقعة: تنخفض طلبات Googlebot على المسار إلى الصفر. وقد يظل الرابط يظهر في GSC بالحالة “Indexed, though blocked by robots.txt” إذا كان مفهرسًا بالفعل؛ وهذا متوقع لا إخفاق.
- تفسير الإخفاق: استمرار طلبات الزحف يعني أن القاعدة لا تطابق نمط الرابط الفعلي؛ افحص الأخطاء وحساسية حالة الأحرف وقاعدة
Allowمتعارضة. - نافذة المراقبة: فورية لفحص الصياغة، ومن أسبوع إلى أسبوعين من السجلات لتأكيد تغير الزحف.
- سبب التراجع: إذا توقف زحف صفحات مشروعة في المسار نفسه، فالنمط واسع أكثر من اللازم؛ ضيقه وأعد الاختبار.
اختبار: هل تحترم Google rel=canonical أم تتجاوزه؟
- الاختبار: اضبط وسم canonical في النسخة المكررة، ثم افحص GSC ← تقرير فهرسة الصفحات ← Duplicate, Google chose different canonical than user أو الرابط المحدد. وقارن canonical المعلن بالمزحوف عبر canonical-checker (
/tools/canonical-checker). - النتيجة المتوقعة: يطابق “Google-selected canonical” للنسخة canonical المعلن.
- تفسير الإخفاق: إذا اختارت Google canonical مختلفًا، فقد لا تكون الصفحات متشابهة بما يكفي للثقة في التلميح، أو توجد إشارة منافسة من روابط داخلية أو خريطة الموقع أو روابط واردة إلى النسخة.
- نافذة المراقبة: من أسبوعين إلى 4 أسابيع ليستقر الاختيار بعد التغيير.
- سبب التراجع: إذا استمرت Google في التجاوز بعد شهر، فقوّ الإشارة عبر 301 بدل canonical، وحدّث الروابط الداخلية، وأزل النسخة من خريطة الموقع.
اختبار: هل قلل الدمج الفجوة بين المزحوف والمرتب؟
- الاختبار: قبل دمج الصفحات الضحلة، احسب الروابط القابلة للفهرسة أو المزحوفة عبر site-audit-lite (
/tools/site-audit-lite) أو أداة زحف كاملة، وقارنها بالصفحات التي ترتب أو تحصل على زيارات عضوية. أعد الحساب نفسه بعد الدمج. - النتيجة المتوقعة: تضيق الفجوة؛ تقل الروابط المزحوفة أو المفهرسة نسبة إلى الصفحات المرتبة، وتنكمش فئة “Crawled - currently not indexed” في GSC.
- تفسير الإخفاق: إذا لم تتغير الفجوة، فقد لا تكون الصفحات المدمجة أُعيد توجيهها، أو يُنشأ تضخم جديد بسرعة التنظيف نفسها.
- نافذة المراقبة: من 4 إلى 8 أسابيع؛ فهذه إشارة تراكمية أبطأ وليست فورية.
- سبب التراجع: لا يوجد تراجع حقيقي؛ فإذا اتسعت الفجوة، فأعد التدقيق بحثًا عن مصدر جديد، كتغيير قالب أو معلمة أو تحديث CMS، بدل عكس الدمج.
كيفية قياس تضخم الفهرس بمرور الوقت
هذه مؤشرات الأداء الدائمة للموضوع؛ تتبعها بوتيرة متكررة لا أثناء تنظيف لمرة واحدة فقط.
الفجوة بين المزحوف والمرتب
- ما الذي توضحه: مقدار ما يفهرس ويكسب زيارات أو ترتيبًا عضويًا مقابل ما يبقى عبئًا خامدًا.
- كيفية استخراجها: احسب الروابط القابلة للفهرسة أو المزحوفة عبر أداة زحف أو site-audit-lite (
/tools/site-audit-lite)، وقارنها بالصفحات ذات النقرات أو مرات الظهور العضوية في تقرير الأداء في Google Search Console خلال الفترة نفسها. - المعيار أو النطاق الواقعي: يعتمد بقوة على نوع الموقع وعمره؛ فلا توجد نسبة صحية عامة. ضع خط أساس من القياس الأول ثم راقب الاتجاه؛ اتساع الفجوة بمرور الوقت هو إشارة العمل، لا نسبة محددة.
- الوتيرة: كل ربع سنة، أو بعد تغيير كبير في القالب أو CMS.
عدد “Crawled - currently not indexed” في GSC
- ما الذي يوضحه: عدد الصفحات التي فحصتها Google وقررت عدم فهرستها؛ وهي البصمة التقليدية للتضخم وفق تأطير مولر لها إشارة جودة على مستوى الموقع.
- كيفية استخراجه: GSC ← تقرير فهرسة الصفحات، من جدول “Why pages aren’t indexed”.
- المعيار أو النطاق الواقعي: لا يوجد رقم عام صادق؛ فالموقع القائم على القوالب مع آلاف النسخ الضحلة سيعرض طبيعيًا أكثر من موقع صغير منسق. راقبه مقابل إجمالي روابطك واتجاهه بعد كل إصلاح، لا هدفًا مطلقًا.
- الوتيرة: شهريًا، أو فور نشر noindex أو canonical لتأكيد الانكماش.
عدد روابط حالات التكرار في GSC
- ما الذي يوضحه: عدد الروابط التي تعاملها Google بوصفها مكررة، سواء “without user-selected canonical” أو “Google chose different canonical than user”.
- كيفية استخراجه: GSC ← تقرير فهرسة الصفحات بعد التصفية إلى صفي حالتي التكرار.
- المعيار أو النطاق الواقعي: يعتمد على مقدار بنية المعلمات أو المتغيرات المشروعة. ارتفاع العدد بعد دفع canonical يعني عدم احترام الإشارة، وانخفاضه يعني نجاحها.
- الوتيرة: شهريًا.
نسبة الزحف المهدور من ملفات السجل
- ما الذي توضحه: نسبة طلبات زحف Googlebot الفعلية التي تصل إلى أنماط روابط منخفضة القيمة، مثل المعلمات والأوجه والبحث الداخلي والخلاصات، بدل المحتوى الحقيقي.
- كيفية استخراجها: استخدم log-file-analyzer (
/tools/log-file-analyzer) أو خط تحليل سجلات مقسمًا بحسب نمط الرابط. - المعيار أو النطاق الواقعي: لا هدف ثابت؛ فهو يعتمد على بنية الموقع. استخدم القياس الأول خط أساس وراقب تقلص النسبة بعد إصلاحات noindex أو robots.txt أو الدمج.
- الوتيرة: شهريًا في المواقع الكبيرة أو المعتمدة على القوالب، وكل ربع سنة في غيرها.
الاختبار
خمسة أسئلة سريعة للتحقق من فهم تأطير تضخم الفهرس.
سجل التغييرات
تم التحديث في 13 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 13 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 16 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
- Advanced
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.