تضخم الفهرس

تضخم الفهرس هو تراكم عناوين URL منخفضة القيمة أو مكررة في فهرس محركات البحث. تعرّف إلى أسبابه وطرق تشخيصه واختيار العلاج الصحيح من noindex وcanonical والحذف والدمج.

نُشر أول مرة: 23 يونيو 2026 · آخر تحديث: 13 أغسطس 2026 · Advanced
اللغات

تضخم الفهرس مصطلح في قطاع SEO يصف فهرسة محركات البحث لصفحات منخفضة القيمة أو مكررة، مثل عناوين التصفية والمعلمات ونتائج البحث الداخلي وصفحات الوسوم ونسخ البروتوكول. وهو ليس عقوبة ولا تحدده كثرة الصفحات وحدها؛ بل قد يهدر الزحف ويوزع الإشارات بين نسخ متقاربة. شخّصه بتقرير فهرسة الصفحات في Google Search Console وسجلات الخادم وأدوات الزحف، ولا تعتمد العدد التقريبي في `site:`. اختر العلاج بحسب قصد الصفحة: `noindex` للصفحات التي لا ينبغي ظهورها مع إبقائها قابلة للزحف، و`rel=canonical` للنسخ المكررة، و`404` أو `410` للمحتوى المحذوف، والدمج للصفحات الضعيفة المتقاربة. ولا يمنع robots.txt صفحة مفهرسة من البقاء في الفهرس، كما أن أداة الإزالة مؤقتة.

الخلاصة — “تضخم الفهرس” مصطلح في SEO لا تستخدمه Google؛ والمشكلة الفعلية هي فهرسة روابط ضحلة أو مكررة أو منخفضة القيمة، مثل التنقل متعدد الأوجه والمعلمات والبحث الداخلي وأرشيفات الوسوم وترقيم الصفحات وأخطاء 404 الزائفة ونسخ البروتوكول. إنها مشكلة كفاءة زحف وتخفيف إشارات، وليست عقوبة. تقول Bing: “Duplicate content doesn’t trigger search penalties on its own” (ترجمة) «لا يؤدي المحتوى المكرر بمفرده إلى عقوبات بحث»، ويقول مولر: “We don’t have a duplicate content penalty.” (ترجمة) «ليس لدينا عقوبة للمحتوى المكرر». تتعلق المشكلة بالجودة لا بعدد الصفحات. شخّصها عبر تقرير فهرسة الصفحات في GSC، إذ إن site: تقدير تقريبي، وسجلات الخادم وأدوات الزحف. Evidence for this claim Search Console's Page Indexing report summarizes indexed and non-indexed pages and groups non-indexed pages by reason, with limited example rows. Scope: Google Search Console reporting; it is not an exhaustive downloadable URL inventory. Confidence: high · Verified: Google: Page indexing report عالج كل رابط بحسب قصده: يزيل noindex الصفحة من الفهرس مع إبقائها قابلة للزحف، ويدمج rel=canonical إشارات النسخ المكررة مع كونه تلميحًا لا أمرًا، ولا يوقف robots.txt إلا الزحف ولا يزيل الروابط المفهرسة، واستخدم 404 أو 410 للصفحات الزائلة وادمج المحتوى الضحل. Evidence for this claim Google recommends noindex to prevent indexing while allowing crawling, canonical signals for duplicates, and 404/410 for removed pages. Scope: The appropriate control depends on the page's intended state. Confidence: high · Verified: Google: Block indexing with noindex Google: Canonicalization Google: HTTP status codes أما أداة الإزالة فمؤقتة لنحو 6 أشهر.

ما المقصود فعلًا بتضخم الفهرس؟

لنبدأ بالتأطير الذي تخطئ فيه معظم المقالات: “تضخم الفهرس” مصطلح في قطاع SEO، وليس مصطلحًا لدى Google. لا تستخدم Google هذه العبارة، بل تصف مكوناتها: روابط مكررة، وروابط منخفضة القيمة أو غير مهمة، وأخطاء 404 زائفة، ومساحات لا نهائية، وتنقل متعدد الأوجه. فلا تنسب العبارة إلى Google ولا تعاملها ككيان مسمى تطارده وتعاقب عليه.

التعريف العملي الذي أرتاح إليه: يحدث تضخم الفهرس عندما تفهرس محركات البحث صفحات في موقعك لا قيمة لها في البحث. ينصب التركيز على القيمة لا الحجم؛ فقد يكون موقع من 500 صفحة نظيفًا، وقد يكون معظم موقع من 100 000 صفحة تضخمًا. إنها مشكلة جودة ترتدي زي عدد الصفحات.

هل يمثل تضخم الفهرس مشكلة فعلًا؟ الإجابة الصادقة

هو في الغالب أقل خطرًا مما يظن الناس، والأهم أنه ليس عقوبة. وهذه أكثر فكرة مبالغ فيها في المجال. تقول Bing بوضوح: “Duplicate content doesn’t trigger search penalties on its own.” (ترجمة) «لا يؤدي المحتوى المكرر بمفرده إلى عقوبات بحث». وقال مولر الشيء نفسه عن Google منذ سنوات: “We don’t have a duplicate content penalty. It’s not that we would demote a site for having a lot of duplicate content.” (ترجمة) «ليس لدينا عقوبة للمحتوى المكرر، ولا نخفض موقعًا لأنه يضم قدرًا كبيرًا من المحتوى المكرر».

فما تكلفته الفعلية؟ أمران عمليان:

  1. إهدار الزحف. يذكر دليل Google للمواقع الكبيرة أنه إذا كانت روابط كثيرة مكررة أو غير مرغوبة، فإن “this wastes a lot of Google crawling time on your site.” (ترجمة) «يهدر هذا قدرًا كبيرًا من وقت زحف Google في موقعك». ومن جهة البنية التحتية: “If Google spends too much time crawling URLs that it shouldn’t, Google’s crawlers might decide that it’s not worth the time to look at the rest of your site.” (ترجمة) «إذا أمضت Google وقتًا أطول مما ينبغي في زحف روابط لا ينبغي زحفها، فقد تقرر برامج زحفها أن تفحص بقية موقعك لا يستحق الوقت». هذه هي الآلية: تحرم الروابط الرديئة الصفحات المهمة من الزحف وتبطئ اكتشاف المحتوى الجديد.

  2. تخفيف الإشارات. توضح Bing نتيجة النسخ شبه المكررة: “signals such as clicks, links, impressions, and engagement are often diluted.” (ترجمة) «غالبًا ما تتخفف إشارات مثل النقرات والروابط ومرات الظهور والتفاعل». فإذا وزعت قيمة صفحة واحدة على خمسة روابط شبه متطابقة، لن يرتب أي منها بقوة صفحة واحدة مدمجة.

متى يهم فعلًا؟ في المواقع الكبيرة أو المعتمدة على القوالب: التجارة الإلكترونية مع الأوجه والمعلمات ومتغيرات المنتجات، والناشرون مع الوسوم والأرشيفات وترقيم الصفحات، وأي CMS ينشئ روابط تلقائيًا مثل صفحات وسوم WordPress والمؤلفين والخلاصات والبحث الداخلي. أما في موقع ثابت صغير فهو غالبًا ضجيج.

والاختبار الصادق الذي أطبقه على عملي: راجعت مرة مدونة Ahrefs مباشرة ووجدت أكثر من 4 700 صفحة مزحوفة، لكن نحو 1 600 فقط كانت ترتب. وكانت الفجوة، أي “صفحات الزومبي”، تتألف من صفحات خلاصات التعليقات والتصنيفات والمؤلفين وترقيم الصفحات. وكان حكمي هادئًا: معظمها لم يضر SEO، لكنه استهلك ميزانية الزحف، ولذلك كان العلاج فرز الأولويات لا الذعر، مثل عرض عناصر أكثر في الصفحة لتقليل حجم ترقيم الصفحات. ابدأ كل تحقيق بسؤال “هل يهم هذا فعلًا؟” قبل أي تغيير.

أسباب تضخم الفهرس

فيما يلي المصادر المعتادة، مرتبة تقريبًا بحسب شيوع تسببها في المشكلة:

  • التنقل متعدد الأوجه. هو المصدر الأول. قال غاري إيليس في تدوينة Google عن الزحف في ديسمبر إن التنقل متعدد الأوجه “is by far the most common source of overcrawl issues site owners report to us,” (ترجمة) «هو بفارق كبير أكثر مصادر مشكلات الزحف المفرط التي يبلغنا بها مالكو المواقع شيوعًا»، وذلك تحديدًا “because it can generate a near-infinite number of URLs.” (ترجمة) «لأنه يستطيع إنشاء عدد شبه لا نهائي من الروابط». وهو “will always consume server resources,” (ترجمة) «سيستهلك موارد الخادم دائمًا»، كما أن الزحف المفرط “slows down the discovery of your important, new content.” (ترجمة) «يبطئ اكتشاف محتواك المهم والجديد».
  • معلمات URL للترتيب والتصفية والتتبع والجلسات؛ فقد تكون كل قيمة معلمة رابطًا جديدًا قابلًا للزحف والفهرسة بلا محتوى فريد.
  • صفحات نتائج البحث الداخلي التي تفهرسها المحركات، وهي نادرًا ما تحمل قيمة بحث مستقلة.
  • أرشيفات وخلاصات الوسوم والتصنيفات والمؤلفين المنشأة تلقائيًا والضحلة غالبًا.
  • ترقيم الصفحات، مثل الصفحات 2 و3 و4، مضروبًا في التصنيفات والأرشيفات.
  • نسخ البروتوكول والمضيف، مثل http وhttps، وwww ودونه، والشرطة الختامية ودونها. وتسرد وثيقة canonical في Google هذه الحالات تحديدًا: اختلاف المنطقة والجهاز والبروتوكول HTTP/HTTPS ووظائف الموقع مثل نتائج الترتيب والتصفية.
  • أخطاء 404 الزائفة والمساحات اللانهائية، مثل التقويمات والتمرير اللانهائي وصفحات “غير موجود” التي تعيد 200. تقول Google: “soft 404 pages will continue to be crawled, and waste your budget.” (ترجمة) «سيستمر زحف صفحات 404 الزائفة وتهدر ميزانيتك».
  • الصفحات المنشأة آليًا والضحلة، أي كل ما تنتجه القوالب مع قدر ضئيل من المحتوى الفريد.

وتقدم Google تذكيرًا مفيدًا عن الحجم: “The web is a nearly infinite space, exceeding Google’s ability to explore and index every available URL.” (ترجمة) «الويب مساحة شبه لانهائية تتجاوز قدرة Google على استكشاف كل رابط متاح وفهرسته». فإذا كانت قوالبك تستطيع إنشاء روابط لا نهائية، فلن تنقذك Google من تصميمك.

كيفية تشخيص تضخم الفهرس

تقرير فهرسة الصفحات في GSC هو المرجع الموثوق للعدد. تقول Google إن الإجماليات “complete and accurate from Google’s perspective.” (ترجمة) «كاملة ودقيقة من منظور Google». استخدمه بدل عامل site:. والأهم من العدد الخام توزيع أسباب عدم الفهرسة. ومن الفئات التي تكشف نمط التضخم:

  • Crawled - currently not indexed“The page was crawled by Google but not indexed.” (ترجمة) «زحفت Google الصفحة لكنها لم تفهرسها». والتراكم الكبير هنا إشارة تقليدية للتضخم.
  • Discovered - currently not indexed“The page was found by Google, but not crawled yet.” (ترجمة) «عثرت Google على الصفحة لكنها لم تزحفها بعد». تعرف Google روابط لم تصل إليها.
  • Duplicate without user-selected canonical“This page is a duplicate of another page, although it doesn’t indicate a preferred canonical page.” (ترجمة) «هذه الصفحة نسخة من صفحة أخرى، لكنها لا تحدد صفحة canonical مفضلة».
  • Duplicate, Google chose different canonical than user“Google thinks another URL makes a better canonical.” (ترجمة) «ترى Google أن رابطًا آخر canonical أفضل».
  • Soft 404“it returns a user-friendly ‘not found’ message but not a 404 HTTP response code.” (ترجمة) «تعيد رسالة “غير موجود” مفهومة للمستخدم، لكنها لا تعيد رمز استجابة HTTP ‏404».

ومن الحالات ذات الصلة في التقرير نفسه: “Alternate page with proper canonical tag” (ترجمة) «صفحة بديلة تتضمن وسم canonical صحيحًا»، و”Page with redirect” (ترجمة) «صفحة تتضمن إعادة توجيه»، و”Blocked by robots.txt” (ترجمة) «محجوبة بملف robots.txt»، و”Excluded by ‘noindex’ tag” (ترجمة) «مستبعدة بوسم noindex»؛ وهي أسماء الحالات الدقيقة كما تعرضها Google.

هناك تفصيل مهم في “Crawled - currently not indexed”: وصفها مولر بأنها إشارة إلى جودة الموقع عمومًا، لا خللًا في صفحة بعينها. قال: “You can’t force pages to be indexed — it’s normal that we don’t index all pages on all websites. It’s not an issue with ‘that page’, it’s more site-wide. Creating a good site structure and making sure the site is of the highest quality possible is essentially the direction.” (ترجمة) «لا يمكنك إجبار الصفحات على الفهرسة؛ فمن الطبيعي ألا نفهرس كل صفحات كل المواقع. ليست المشكلة في “تلك الصفحة” بل على مستوى الموقع، والاتجاه الصحيح هو إنشاء بنية جيدة وضمان أعلى جودة ممكنة». وأضاف: “If there are overall issues with your site, you need to look at the rest of your site, not the URLs that didn’t end up getting indexed.” (ترجمة) «إذا كانت في موقعك مشكلات عامة، فانظر إلى بقية الموقع لا إلى الروابط التي لم تُفهرس». لكن لا تبالغ في تفسير الحالة؛ فقد قال أيضًا: “It’s not meant to highlight low quality content issues.” (ترجمة) «ليس المقصود منها إبراز مشكلات المحتوى منخفض الجودة».

وتشمل بقية أدوات التشخيص:

  • عامل site: للفحص السريع فقط، مثل site:example.com inurl:? أو site:example.com/tag/ لاكتشاف نمط من التضخم. لا تستشهد به عددًا دقيقًا، وطابقه مع GSC.
  • تحليل ملفات السجل لمعرفة أين يقضي Googlebot وقته فعليًا. فإذا ذهبت نسبة كبيرة من الطلبات إلى روابط المعلمات أو الأوجه أو الخلاصات، فهذا زحف مهدور.
  • أدوات زحف المواقع، مثل Ahrefs Site Audit وScreaming Frog، لاكتشاف الصفحات الضحلة والمكررة واليتيمة وروابط المعلمات القابلة للفهرسة ومجموعات النسخ شبه المكررة، ثم مقارنة الروابط القابلة للزحف والفهرسة بخريطة XML والصفحات التي تحصل على زيارات فعلًا.
  • الفجوة بين المزحوف والمرتب، وهي طريقتي: قارن عدد الصفحات القابلة للفهرسة أو المزحوفة بعدد الصفحات التي ترتب أو تستقبل زيارات. والفرق قائمة مرشحي الزومبي أو التضخم التي تحتاج إلى فرز.

كيفية الإصلاح: اختر الأداة الصحيحة

Pick the treatment from the URL's intended job; robots.txt controls crawling but does not remove an indexed URL. المصدر: /technical-seo/how-search-works/indexing/index-bloat/

Use noindex for a page that stays live but should not appear in search, canonical for a duplicate of a useful URL, 404 or 410 for a permanently gone URL, and consolidation when several thin pages serve one intent. Use robots.txt only to stop wasteful crawling because it does not deindex the URL.

© Patrick Stox LLC · CC BY 4.0 ·

لا يوجد إصلاح واحد. تعالج كل صفحة بحسب ماهيتها وقيمتها. يلخص جدول القرار، المعروض كاملًا في تبويب Cheat Sheets، المسألة كلها؛ وهذه حجة كل وسيلة:

noindex: الإزالة من الفهرس. استخدمه عندما لا تكون للصفحة قيمة بحث ولا ينبغي أن تظهر، مثل نتائج البحث الداخلي وصفحات الشكر وصفحات الوسوم أو عوامل التصفية الضحلة. فهو يزيلها من النتائج. تقول Google: “Google will drop that page entirely from Google Search results, regardless of whether other sites link to it.” (ترجمة) «ستزيل Google الصفحة كليًا من نتائج Google Search، بصرف النظر عن روابط المواقع الأخرى إليها». ويمنع noindex فهرسة صفحات الأوجه بصورة مؤكدة. أما التحذير الحاسم: فيجب أن تبقى الصفحة قابلة للزحف كي يعمل noindex. تقول Google: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file.” (ترجمة) «لكي تكون قاعدة noindex فعالة، يجب ألا تكون الصفحة أو المورد محجوبًا بملف robots.txt». فإذا حجبتها أولًا لن ترى Google الوسم.

rel=canonical: دمج النسخ المكررة ذات القيمة. استخدمه للنسخ شبه المكررة التي تحمل روابط أو قيمة، مثل نسخ المعلمات والطباعة والبروتوكول أو المضيف. رابط canonical هو “the URL of a page that Google chose as the most representative from a set of duplicate pages,” (ترجمة) «رابط الصفحة التي اختارتها Google بوصفها الأكثر تمثيلًا من مجموعة صفحات مكررة»، وتحديده وسيلة لدمج الإشارات. لكنه تلميح لا أمر: “indicating a canonical preference is a hint, not a rule,” (ترجمة) «الإشارة إلى تفضيل canonical تلميح وليست قاعدة»، كما أن “Google may choose a different page as canonical than you do, for various reasons.” (ترجمة) «قد تختار Google صفحة canonical مختلفة عن اختيارك لأسباب متعددة». وهناك قاعدة حاسمة أكررها دائمًا: لا تجمع noindex وrel=canonical في الصفحة نفسها، فهما تعليمان متعارضان.

disallow في robots.txt: إيقاف الزحف فقط. استخدمه لإبعاد برامج الزحف عن أحجام ضخمة من الروابط الرديئة القابلة للزحف التي لا تحتاج إلى فهرستها ولا إلى إشاراتها، مثل تركيبات الأوجه اللانهائية. وبشأن التنقل متعدد الأوجه تحديدًا يقول إيليس: “If you don’t need these URLs indexed, use robots.txt to disallow crawling.” (ترجمة) «إذا لم تكن بحاجة إلى فهرسة هذه الروابط، فاستخدم robots.txt لمنع زحفها». لكن افهم ما يفعله وما لا يفعله؛ فهو “is not a mechanism for keeping a web page out of Google,” (ترجمة) «ليس آلية لإبقاء صفحة ويب خارج Google»، كما أن “a page that’s disallowed in robots.txt can still be indexed if linked to from other sites.” (ترجمة) «قد تظل الصفحة الممنوعة في robots.txt مفهرسة إذا ربطت بها مواقع أخرى». إنه يوقف الزحف ولا يزيل الروابط المفهرسة من الفهرس.

404 و410: صفحات زالت فعلًا. أعد هاتين الحالتين للصفحات التي ينبغي ألا تعود موجودة. 410 إشارة أقوى قليلًا إلى الزوال، أما 404 فهي “a strong signal not to crawl that URL again.” (ترجمة) «إشارة قوية إلى عدم زحف ذلك الرابط مرة أخرى».

الدمج أو التشذيب: صفحات ضحلة كثيرة حول موضوع واحد. اجمعها في صفحة قوية واحدة، وأعد توجيه البقية بـ301، أو احذفها. تصوغ Google الأمر هكذا: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (ترجمة) «ادمج المحتوى المكرر لتركيز الزحف على المحتوى الفريد بدل الروابط الفريدة». وهذا أفضل إصلاح طويل الأمد للمحتوى الضحل.

أداة Removals: حل مؤقت فقط. تزيل أداة Removals في GSC رابطًا من النتائج بسرعة، لكنها ضماد مؤقت: “Requests made in the Removals tool last for about 6 months.” (ترجمة) «تستمر الطلبات المقدمة عبر أداة Removals نحو 6 أشهر». اربطها دائمًا بطريقة دائمة مثل noindex أو 404/410 أو الحذف.

قاعدة التسلسل التي توقع الجميع في الخطأ

لإزالة رابط منخفض القيمة مفهرس بالفعل نهائيًا، طبق noindex أو 404/410 وأبقه قابلًا للزحف حتى تعيد Google معالجته. لا تضف disallow في robots.txt إلا بعد خروجه من الفهرس إذا أردت عندها توفير الزحف. الحجب أولًا يحبسه في الفهرس؛ إذ لا تستطيع Google قراءة noindex في صفحة لا تستطيع زحفها، وقد يبقى الرابط في النتائج، وأحيانًا بلا مقتطف، إلى أجل غير محدد.

Evidence for this claim A `noindex` rule can remove a URL from Google Search after Google fetches it; blocking that URL in robots.txt can prevent observation of the rule and does not save the initial recrawl needed for removal. Scope: HTML and HTTP index controls Confidence: high · Verified: Block search indexing with noindex

خرافات شائعة ينبغي تفنيدها

  • “Google penalizes index bloat / duplicate content.” (ترجمة) «تعاقب Google تضخم الفهرس أو المحتوى المكرر». لا؛ ليست هناك عقوبة، بل زحف مهدور وإشارات مخففة.
  • “robots.txt will remove pages from the index.” (ترجمة) «يزيل robots.txt الصفحات من الفهرس». لا؛ يوقف الزحف فقط، وقد تفهرس الروابط الممنوعة عبر الروابط الواردة.
  • “noindex saves crawl budget.” (ترجمة) «يوفر noindex ميزانية الزحف». لا؛ يجب أن تطلب Google الصفحة أولًا كي ترى noindex.
  • “You can noindex AND robots.txt-block the same page to be safe.” (ترجمة) «يمكن الجمع بين noindex والحجب في robots.txt احتياطًا». لا؛ فإذا حُجبت الصفحة تعذر على Google قراءة noindex وقد تبقى مفهرسة.
  • “rel=canonical forces consolidation.” (ترجمة) «يفرض rel=canonical الدمج». لا؛ إنه تلميح وقد تختار Google canonical مختلفًا.
  • “The site: operator gives an exact indexed count.” (ترجمة) «يعطي عامل site: عددًا دقيقًا للصفحات المفهرسة». لا؛ هو تقدير. ثق بتقرير فهرسة الصفحات في GSC.
  • “More indexed pages = better.” (ترجمة) «المزيد من الصفحات المفهرسة أفضل». لا؛ الجودة أهم من الكمية، فالروابط منخفضة القيمة تهدر الزحف وتخفف الإشارات.

الوقاية: ابنِ حواجز حماية

أفضل إصلاح هو منع نشوء التضخم أصلًا:

  • noindex على مستوى قوالب CMS للأنواع التي ينبغي ألا ترتب، مثل البحث الداخلي وصفحات التصفية الضحلة وبعض الأرشيفات؛ اضبطه مرة في القالب لا لكل صفحة.
  • انضباط المعلمات؛ قرر مسبقًا المعلمات التي تنشئ روابط قابلة للفهرسة وتلك التي تستخدم canonical أو تُحجب.
  • روابط متسقة؛ اختر بروتوكولًا ومضيفًا واتفاقية للشرطة المائلة الختامية وطبقها.
  • عمليات تدقيق دورية؛ أعد فحص الفجوة بين المزحوف والمرتب كل ربع سنة كي لا يتسلل التضخم مجددًا.

يقع هذا الموضوع بجوار موضوعات شقيقة: ميزانية الزحف، وهي المورد الذي يهدره تضخم الفهرس، وتحديد canonical، وهو وسيلة الدمج الأساسية، والتنقل متعدد الأوجه، وهو المصدر الأكثر شيوعًا. وللصورة الأوسع عن دخول الصفحات إلى الفهرس وبقائها خارجه، راجع محور الفهرسة.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.