الفهرسة

كيفية تخزين محركات البحث للصفحات وتنظيمها كي تتمكن من ترتيبها — تحليل المحتوى، وإضفاء الطابع الأساسي، ولماذا لا يعني الزحف الفهرسة، وكيفية قراءة تقرير فهرسة الصفحات في GSC.

نُشر أول مرة: 23 يونيو 2026 · آخر تحديث: 6 أغسطس 2026 · Advanced
اللغات
دليل واحد في هذه الصفحة

الفهرسة هي المرحلة الثانية من البحث (الزحف ← الفهرسة ← العرض): بعد زحف محرك البحث إلى الصفحة، يفهمها ويزيل التكرارات ويحدد عنوانها الأساسي، ثم — إذا استوفت الشروط — يخزنها في فهرس البحث. الزحف لا يعني الفهرسة؛ تختار Google ما تحتفظ به، والفهرسة غير مضمونة. وهي ليست عامل ترتيب، لكن يجب أن تكون الصفحة مفهرسة قبل أن تتمكن من الترتيب. ولإبقاء صفحة خارج الفهرس، استخدم noindex واتركها قابلة للزحف — ولا تحظرها في robots.txt. تشرح هذه الصفحة المرحلة كلها وتحيلك إلى الموضوعات المتعمقة.

الخلاصة — الفهرسة هي المرحلة الثانية من مراحل البحث الثلاث (الزحف ← الفهرسة ← العرض): تفهم Google الصفحة التي زُحف إليها (النص والوسوم الأساسية والصور والفيديو؛ كما تعرض JavaScript)، وتكتشف التكرارات، وتجمع الصفحات المتشابهة وتختار أكثرها تمثيلاً (تحديد العنوان الأساسي — فـrel=canonical تلميح لا قاعدة)، وتحسب الإشارات، وتخزن العنوان الأساسي في الفهرس. الزحف لا يساوي الفهرسة — «الفهرسة غير مضمونة»، والقرار يرتبط إلى حد كبير بالجودة والقيمة. تقرير فهرسة الصفحات في Search Console هو قمرة القيادة. ولإزالة الفهرسة استخدم noindex واترك الصفحة قابلة للزحف؛ ولا تستخدم robots.txt لإزالة صفحة، لأن الصفحة المحظورة قد تظل مفهرسة (لكن من دون مقتطف). Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex

الفهرسة هي المرحلة الثانية من ثلاث

Indexing is stage two of three — the middle filter between crawling and ranking. المصدر: /technical-seo/how-search-works/indexing/

Three stages run left to right. Crawl discovers and downloads a URL. Index processes the page and stores eligible information. Serve or rank orders the best indexed matches for a query. The Index stage is highlighted, and a note says not every page advances through every stage.

© Patrick Stox LLC · CC BY 4.0 ·

تتحدث Google بوضوح عن المسار: “Google Search works in three stages, and not all pages make it through each stage” (ترجمة) «يعمل بحث Google في ثلاث مراحل، ولا تصل كل الصفحات إلى نهاية كل مرحلة» — الزحف والفهرسة والعرض. الفهرسة هي المرحلة الوسطى، وتعرّفها الوثيقة بوضوح: “Indexing: Google analyzes the text, images, and video files on the page, and stores the information in the Google index, which is a large database.” (ترجمة) «الفهرسة: تحلل Google النصوص والصور وملفات الفيديو في الصفحة، وتخزن المعلومات في فهرس Google، وهو قاعدة بيانات كبيرة.»

Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search works

يجب أن تزحف Google إلى الصفحة قبل أن تتمكن من فهرستها، ويجب أن تكون مفهرسة قبل أن تتمكن من ترتيبها. لكن لا شيء من ذلك مضمون — فكل مرحلة مرشح. إن إبقاء المراحل الثلاث منفصلة في ذهنك هو النموذج الذهني الأكثر فائدة في SEO التقني، ولهذا أسأل دائماً عن المرحلة التي تفشل فيها الصفحة قبل تغيير أي شيء. (أما المرحلة السابقة لهذه، فراجع محور الزحف — الزحف ← الفهرسة هو المسار.)

ما الذي يحدث فعلياً أثناء الفهرسة

Indexing is a sequence: understand, cluster and select a canonical, then store. المصدر: /technical-seo/how-search-works/indexing/

Step one analyzes a crawled page for text, title, alt text, images, and video. Step two groups duplicate URLs into a cluster and chooses the most representative page as canonical. Step three stores the canonical page and its cluster information in the Google index.

© Patrick Stox LLC · CC BY 4.0 ·

الفهرسة ليست شيئاً واحداً؛ إنها سلسلة من الخطوات:

  • فهم المحتوى. تقول Google: “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (ترجمة) «بعد الزحف إلى الصفحة، تحاول Google فهم موضوعها. وتسمى هذه المرحلة الفهرسة.» وهذا يعني أن “Google analyzes the textual content and key content tags and attributes, such as <title> elements and alt attributes, images, videos, and more.” (ترجمة) «تحلل Google المحتوى النصي والوسوم والسمات الأساسية للمحتوى، مثل عناصر <title> وسمات alt والصور والفيديو وغير ذلك.» وتُعرض JavaScript كجزء من ذلك — فإذا ظهر محتواك بعد تشغيل JS فقط، فلا يزال عليه أن يُعرض قبل أن يمكن فهمه.
  • اكتشاف التكرارات وتحديد العنوان الأساسي. هذه هي الجزئية التي تتخطاها معظم الشروحات، وفيها تعيش ألغاز «لماذا لم تُفهرس هذه الصفحة؟» الكثيرة. تحدد Google “determines if a page is a duplicate of another page on the internet or canonical.” (ترجمة) «ما إذا كانت الصفحة تكراراً لصفحة أخرى على الإنترنت أو الصفحة الأساسية.» والآلية هي: “we first group together (also known as clustering) the pages that we found on the internet that have similar content, and then we select the one that’s most representative of the group.” (ترجمة) «نجمع أولاً الصفحات التي وجدناها على الإنترنت ذات المحتوى المتشابه، وهو ما يسمى التجميع، ثم نختار الصفحة الأكثر تمثيلاً للمجموعة.» وهذا الممثل هو العنوان الأساسي — “The canonical is the page that may be shown in search results.” (ترجمة) «العنوان الأساسي هو الصفحة التي قد تظهر في نتائج البحث.»
  • حساب الإشارات والتخزين. أخيراً، “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (ترجمة) «قد تُخزن المعلومات المجمعة عن الصفحة الأساسية ومجموعتها في فهرس Google، وهو قاعدة بيانات كبيرة مستضافة على آلاف الحواسيب.» ونظام الفهرسة الذي تسميه Google وراء ذلك كله هو Caffeine — الطبقة التي تستوعب بيانات الزحف، وتعرض الصفحات وتستخرج منها، وتحسب الإشارات، وتبني الفهرس الذي يجري عرضه.

تحديد العنوان الأساسي: تلميح لا أمر

بما أن تحديد العنوان الأساسي يحدث أثناء الفهرسة، فهو يستحق ملاحظة خاصة. “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content,” (ترجمة) «تحديد العنوان الأساسي هو عملية اختيار عنوان URL الممثل — الأساسي — لقطعة من المحتوى»، وهو موجود لأن “this process helps Google show only one version of the otherwise duplicate content in its search results.” (ترجمة) «هذه العملية تساعد Google على عرض نسخة واحدة فقط من المحتوى المكرر لولاها في نتائج البحث.»

التفصيل الحاسم: إن rel=canonical الخاص بك اقتراح. كلمات Google هي: “indicating a canonical preference is a hint, not a rule.” (ترجمة) «الإشارة إلى تفضيل عنوان أساسي تلميح لا قاعدة.» تزن Google إشارات كثيرة — وفي دليل تحديد العنوان الأساسي أذكر أنه، وفقاً لـAllan Scott من Google، توجد نحو 40 إشارة مختلفة لاختيار العنوان الأساسي — ويمكنها اختيار عنوان URL مختلفاً عن الذي حددته. وهذا بالضبط ما تخبرك به حالة «Duplicate, Google chose different canonical than user» في Search Console.

الزحف لا يساوي الفهرسة: لماذا لا تُفهرس الصفحات

إليك مبدد الخرافة، من الوثائق مباشرة: “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (ترجمة) «الفهرسة غير مضمونة؛ فليست كل صفحة تعالجها Google ستُفهرس.» Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works وتسرد Google أسباباً شائعة للفشل — “The quality of the content on page is low,” (ترجمة) «جودة المحتوى في الصفحة منخفضة»، و*“Robots meta rules disallow indexing,”* (ترجمة) «قواعد meta الخاصة بالروبوتات تمنع الفهرسة»، و*“The design of the website might make indexing difficult.”* (ترجمة) «قد يجعل تصميم الموقع الفهرسة صعبة.»

الممثلون أكثر مباشرة حتى في توضيح أن هذا قرار اختيار تحركه القيمة، وليس حصة يمكنك شراء طريقك عبرها:

  • قال John Mueller، عن المدة التي يمكن أن تستمر فيها حالة «Discovered/Crawled — غير مفهرسة حاليًا»: “That can be forever. It’s something where we just don’t crawl and index all pages.” (ترجمة) «قد يستمر ذلك إلى الأبد. الأمر أننا لا نزحف إلى كل الصفحات ولا نفهرسها.» والإصلاح ليس إعادة الإرسال — بل جعل الأنظمة تدرك القيمة، أي “continue working on the website and making sure that our systems recognize that there’s value in crawling and indexing more and then over time we will crawl and index more.” (ترجمة) «الاستمرار في العمل على الموقع والتأكد من أن أنظمتنا تدرك أن للزحف إلى المزيد من الصفحات وفهرستها قيمة، ثم سنزحف مع الوقت إلى المزيد ونفهرسه.»
  • وقال Mueller مرة أخرى: “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (ترجمة) «من المهم أن تضع في اعتبارك أن Google لا تفهرس كل صفحة على الويب، حتى إذا أُرسلت إليها مباشرة.» وبصراحة: “Well, lots of SEOs & sites (perhaps not you/yours!) produce terrible content that’s not worth indexing.” (ترجمة) «حسناً، ينتج كثير من العاملين في SEO والمواقع محتوى فظيعاً لا يستحق الفهرسة — وربما لا ينطبق ذلك عليك أو على موقعك!».
  • وقال Gary Illyes، عن سبب الانتقائية: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (ترجمة) «ليست لدينا مساحة لا نهائية، لذلك نريد فهرسة الأشياء التي نعتقد — حسناً، ليست نحن، بل خوارزمياتنا — أن الناس قد يبحثون عنها…».
  • ويصف Martin Splitt الأمر بأنه موازنة: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (ترجمة) «أصفه عادةً بأنه تحدٍ يتمثل في الموازنة بين عدم إغراق الموقع، وإنفاق مواردنا حيث تهم.»

الخلاصة العملية: تساعد خريطة الموقع أو «طلب الفهرسة» على الاكتشاف، لا على الاختيار. ولن يؤدي إرسال الصفحة مجدداً إلى إجبار Google على إدخالها. الرافعة هي جودة الموقع وقيمته.

قراءة تقرير فهرسة الصفحات في Google Search Console

Page indexing report هو المكان الذي تظهر فيه مشكلات الفهرسة فعلياً. تعامل مع كل حالة بوصفها تشخيصاً. هذه أوصاف Google الحرفية نفسها:

  • Crawled – currently not indexed: “The page was crawled by Google but not indexed. It may or may not be indexed in the future; no need to resubmit this URL for crawling.” (ترجمة) «زحفت Google إلى الصفحة لكنها لم تفهرسها. وقد تُفهرس أو لا تُفهرس مستقبلاً؛ لا حاجة إلى إعادة إرسال عنوان URL هذا للزحف.» عادةً هو حكم على الجودة والقيمة — حسّن الصفحة، ولا تزعج زر إعادة الإرسال.
  • Discovered – currently not indexed: “The page was found by Google, but not crawled yet. Typically, Google wanted to crawl the URL but this was expected to overload the site; therefore Google rescheduled the crawl.” (ترجمة) «وجدت Google الصفحة، لكنها لم تزحف إليها بعد. عادةً أرادت Google الزحف إلى عنوان URL، لكن كان متوقعاً أن يحمّل ذلك الموقع فوق طاقته؛ لذلك أعادت جدولة الزحف.» حالة تقنية قبل الزحف تحركها السعة — لكن إذا استمرت، يربطها الممثلون بالقيمة، مثل الحالة السابقة.
  • Duplicate without user-selected canonical: “This page is a duplicate of another page, although it doesn’t indicate a preferred canonical page. Google has chosen the other page as the canonical for this page, and so will not serve this page in Search.” (ترجمة) «هذه الصفحة تكرار لصفحة أخرى رغم أنها لا تشير إلى صفحة أساسية مفضلة. اختارت Google الصفحة الأخرى عنواناً أساسياً لهذه الصفحة، ولذلك لن تعرض هذه الصفحة في البحث.»
  • Duplicate, Google chose different canonical than user: “This page is marked as canonical for a set of pages, but Google thinks another URL makes a better canonical.” (ترجمة) «هذه الصفحة محددة بوصفها أساسية لمجموعة من الصفحات، لكن Google ترى أن عنوان URL آخر أفضل بوصفه أساسياً.» وهذا هو ناتج «التلميح لا القاعدة» في الواقع.
  • صفحة بديلة ذات وسم canonical صحيح: “This page is marked as an alternate of another page… This page correctly points to the canonical page, which is indexed, so there is nothing you need to do.” (ترجمة) «هذه الصفحة محددة بوصفها بديلاً لصفحة أخرى… وتشير بصورة صحيحة إلى الصفحة الأساسية المفهرسة، لذلك لا يلزمك فعل شيء.»
  • Indexed, though blocked by robots.txt: “The page was indexed despite being blocked by your website’s robots.txt file. Google always respects robots.txt, but this doesn’t necessarily prevent indexing if someone else links to your page.” (ترجمة) «فُهرست الصفحة رغم حظرها بملف robots.txt الخاص بموقعك. تحترم Google دائماً robots.txt، لكن ذلك لا يمنع الفهرسة بالضرورة إذا ربط شخص آخر بصفحتك.» وهذا دليل على أن حظر الزحف لا يمنع الفهرسة.
  • URL blocked by robots.txt: “This page was blocked by your site’s robots.txt file.” (ترجمة) «حُظرت هذه الصفحة بواسطة ملف robots.txt الخاص بموقعك.»
  • URL marked ‘noindex’: “When Google tried to index the page it encountered a ‘noindex’ directive and therefore did not index it.” (ترجمة) «عندما حاولت Google فهرسة الصفحة، واجهت توجيه «noindex» ولذلك لم تفهرسها.» وهذا يعني أن إزالة الفهرسة تعمل كما أُريد لها.
  • Page with redirect: “This is a non-canonical URL that redirects to another page. As such, this URL will not be indexed.” (ترجمة) «هذا عنوان URL غير أساسي يعيد التوجيه إلى صفحة أخرى، ولذلك لن يُفهرس.»
  • Soft 404: “The page request returns what we think is a soft 404 response. This means that it returns a user-friendly ‘not found’ message but not a 404 HTTP response code.” (ترجمة) «يعيد طلب الصفحة ما نعتقد أنه استجابة 404 لينة. أي إنه يعيد رسالة «غير موجود» مناسبة للمستخدم، لا رمز استجابة HTTP 404.»

كيف تتحكم في الفهرسة بالطريقة الصحيحة

لفهرسة صفحة: اجعلها قابلة للزحف، واربط بها داخلياً، وأدرجها في خريطة موقعك — وقبل كل شيء، اجعلها تستحق الفهرسة. أدوات الاكتشاف لا تتجاوز حكم القيمة.

لإبقاء الصفحة خارج الفهرس — أكثر أدوات التحكم التي يُساء استخدامها في SEO: استخدم noindex، أي “a rule set with either a <meta> tag or HTTP response header,” (ترجمة) «مجموعة قواعد عبر وسم <meta> أو رأس استجابة HTTP»، وأبق الصفحة قابلة للزحف. وتحذير Google الحاسم: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (ترجمة) «لكي تكون قاعدة noindex فعالة، يجب ألا تكون الصفحة أو المورد محظوراً بملف robots.txt، ويجب أن يكون متاحاً للزاحف بطريقة أخرى.»

Evidence for this claim For Google to apply noindex, the crawler must be allowed to access the page or resource; a robots.txt block can prevent Google from seeing the rule. Scope: HTML and HTTP resources Confidence: high · Verified: Block Search indexing with noindex

الخطأ الذي أراه باستمرار هو إضافة noindex وحظر الصفحة في robots.txt. هذا يأتي بنتيجة عكسية. وكما كتبت في كيفية إزالة عناوين URL من بحث Google: «For these tags to be seen, a search engine needs to be able to crawl the pages—so make sure they aren’t blocked in robots.txt» (ترجمة) «لكي ترى محركات البحث هذه الوسوم، يجب أن تتمكن من الزحف إلى الصفحات — لذا تأكد من عدم حظرها في robots.txt»، و«Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.» (ترجمة) «الزحف ليس الفهرسة. حتى إذا مُنعت Google من الزحف إلى الصفحات، فقد تفهرسها إذا وجدت روابط داخلية أو خارجية إليها.» وفي مقال حالة Indexed, though blocked by robots.txt أقولها بصورة أوضح: «Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.» (ترجمة) «ما لم تتمكن Google من الزحف إلى الصفحة، فلن ترى وسم noindex meta وقد تظل تفهرسها لأنها تحتوي على روابط.» والإصلاح هو: «Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.» (ترجمة) «أضف وسم noindex meta للروبوتات فحسب، وتأكد من السماح بالزحف — بافتراض أن الصفحة أساسية.»

ولقرار الإزالة الأشمل — 404/410 مقابل noindex، وحجز أداة Removals لنحو ستة أشهر، والحماية بكلمة مرور — راجع كيفية إزالة فهرسة صفحة.

الفهرسة في Bing

تشغّل Bing المسار نفسه. وكما تصفه Microsoft: “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (ترجمة) «أثناء زحف Bingbot إلى الويب، يرسل إلى Bing معلومات عما يجده. ثم تُضاف هذه الصفحات إلى فهرس Bing.» تنطبق أدوات التحكم نفسها — يبقي توجيه noindex الصفحة خارج الفهرس، ويمكن لـrobots.txt المفرط في التقييد أن يمنع Bingbot من الزحف إليها أصلاً. وتحتاج Bing أيضاً إلى رابط واحد على الأقل يشير إلى موقعك كي تجده في المقام الأول.

ليست كل صفحة تنتمي إلى الفهرس

هذا مرشح بسيط لا قاعدة عالمية: تستحق الصفحة الفهرسة إذا كان يمكنها الظهور في بحث بنتيجة مميزة ومفيدة. وهذا هو المعيار الذي تقيس عليه التكرارات، وصيغ المعلمات، وعناوين URL الخاصة أو التجريبية، وصفحات المخزون الرقيقة أو المتكررة — وليس سبباً لإضافة noindex إلى نوع صفحة كامل افتراضياً. أجرِ التدقيق الكامل على الصفحات المصممة لامتلاك هذا الظهور، ثم تابع.

إلى أين تذهب بعد ذلك: مجموعة الفهرسة

هذه الصفحة هي النظرة العامة. وهناك شيئان يسوءان على نطاق واسع، ولكل منهما موضوع متعمق خاص:

  • تضخم الفهرس — عندما ينتهي عدد كبير جداً من عناوين URL منخفضة القيمة أو المكررة أو الرقيقة في الفهرس، فيخفف ذلك قيمة موقعك ويهدر موارد الزحف والفهرسة. تعلّم تشخيصه وتقليمه بأمان.
  • الفهرسة التي تركز على الهاتف أولاً — تفهرس Google النسخة الجوالة من صفحاتك، لذلك يجب أن يصل المحتوى والروابط والبيانات المنظمة إلى مستوى التكافؤ بين الهاتف وسطح المكتب. تعرّف ما الذي يجب فحصه وما الذي يتعطل.

كلا الموضوعين متفرعان تحت هذه الصفحة — وهما موجودان في الشريط الجانبي أيضاً، وسيربطان عائداً بهذه الصفحة.

تعيش المرحلة السابقة لهذه — أي كيفية اكتشاف الروبوتات لصفحاتك وتنزيلها — في محور الزحف؛ فالزحف ← الفهرسة هو المسار، ويجب أن تتجاوز الصفحة مرحلة الزحف قبل أن ينطبق أي من هذا. وللصورة الأوسع، راجع كيف يعمل البحث.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.