الفهرسة
كيفية تخزين محركات البحث للصفحات وتنظيمها كي تتمكن من ترتيبها — تحليل المحتوى، وإضفاء الطابع الأساسي، ولماذا لا يعني الزحف الفهرسة، وكيفية قراءة تقرير فهرسة الصفحات في GSC.
اللغات
دليل واحد في هذه الصفحة
- أداة مباشرة ذات صلةGoogle Index Checker
الفهرسة هي المرحلة الثانية من البحث (الزحف ← الفهرسة ← العرض): بعد زحف محرك البحث إلى الصفحة، يفهمها ويزيل التكرارات ويحدد عنوانها الأساسي، ثم — إذا استوفت الشروط — يخزنها في فهرس البحث. الزحف لا يعني الفهرسة؛ تختار Google ما تحتفظ به، والفهرسة غير مضمونة. وهي ليست عامل ترتيب، لكن يجب أن تكون الصفحة مفهرسة قبل أن تتمكن من الترتيب. ولإبقاء صفحة خارج الفهرس، استخدم noindex واتركها قابلة للزحف — ولا تحظرها في robots.txt. تشرح هذه الصفحة المرحلة كلها وتحيلك إلى الموضوعات المتعمقة.
الخلاصة — الفهرسة هي الطريقة التي يخزّن بها محرك البحث صفحتك كي يستطيع إظهارها في النتائج. بعد زحف المحرك إلى الصفحة (وتنزيلها)، يحدد موضوعها ويقرر ما إذا كان سيحتفظ بها. ولا يعني الزحف أنك مفهرس — تختار Google ما يستحق الاحتفاظ به. كما أن الفهرسة لا تساوي الترتيب؛ فهي تعني فقط أنك مؤهل له.
ما هي الفهرسة
يعمل البحث في ثلاث خطوات، بالترتيب:
- الزحف — يكتشف روبوت مثل Googlebot عنوان URL وينزّل الصفحة.
- الفهرسة — يقرأ المحرك الصفحة، ويفهم موضوعها، ويحفظها في قاعدة بيانات ضخمة لكل ما قد يعرضه في النتائج.
- العرض (الترتيب) — عندما يبحث شخص ما، يستخرج المحرك أفضل التطابقات من قاعدة البيانات تلك ويرتبها.
الفهرسة هي الخطوة الثانية. فإذا لم تكن الصفحة مفهرسة، لا يمكنها الترتيب — لأنها ببساطة ليست في قاعدة البيانات التي تُستخرج منها النتائج. لكن الفهرسة وحدها لا ترفعك في الصفحة؛ إنها تدخلك إلى المنافسة فحسب.
الزحف لا يعني الفهرسة
هذا هو الجزء الذي يفوته الناس. لا تفهرس Google كل صفحة تزحف إليها — فهي تختار الصفحات التي تستحق الاحتفاظ بها. وبعبارة Google نفسها: «indexing isn’t guaranteed; not every page that Google processes will be indexed.» (ترجمة) «الفهرسة غير مضمونة؛ فليست كل صفحة تعالجها Google ستُفهرس.» Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works غالباً ما تُستبعد الصفحات لأن محتواها ضعيف أو منخفض القيمة، أو لأن قاعدة noindex تطلب من Google تجاوزها، أو لأن شيئاً تقنياً يجعل معالجة الصفحة صعبة.
لذلك إذا كانت صفحة مفقودة من البحث، فعبارتا «لم تزحف Google إليها» و«زحفت Google إليها لكنها لم تحتفظ بها» تصفان مشكلتين مختلفتين لهما إصلاحان مختلفان.
كيف تتحقق من فهرستك
- Google Search Console هي الإجابة الفعلية. تخبرك أداة URL Inspection ما إذا كانت صفحة محددة مفهرسة، ويوضح Page indexing report سبب فهرسة الصفحات عبر موقعك أو عدم فهرستها.
- بالنسبة إلى عنوان URL واحد محدد، استخدم URL Inspection — فلا يمكنك البحث في Page indexing report أو تصفيته حسب عنوان URL، ولذلك فالتقرير مخصص للأنماط عبر الموقع لا لفحص صفحة واحدة. كما أن الاختبار المباشر النظيف في URL Inspection لا يروي القصة كاملة: فهو لا يفحص كل ما يفحصه التقرير، ولا سيما حالات التكرار والعنوان الأساسي.
- الاختصار التقريبي هو عامل
site:(مثلsite:example.com/page) — وهو مفيد، لكن Search Console هو مصدر الحقيقة.
كيف تُبقي الصفحة خارج الفهرس
هنا يقلب كثير من الناس الأمر. إذا أردت إخراج صفحة من البحث:
- أضف وسم
noindex(وسم meta للروبوتات أو رأسX-Robots-Tag)، و - تأكد من أن الصفحة لا تزال قابلة للزحف — ولا تحظرها في
robots.txt.
لماذا؟ لأن Google يجب أن تتمكن من الزحف إلى الصفحة كي ترى noindex. فإذا حجبتها في robots.txt، فلن تستطيع Google قراءة الوسم — وقد تبقى الصفحة مفهرسة فعلياً إذا ربطت بها صفحات أخرى. Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex
يغطي ذلك الحالة اليومية. أما حالات الإزالة الطرفية — الصفحات التي تحتاج إلى اختفائها سريعاً، أو صفحة محمية بكلمة مرور أو خاصة تسربت إلى الفهرس، أو قرار استخدام 404/410 كاملاً مقابل noindex — فراجع دليل كيفية إزالة فهرسة صفحة المخصص.
هل تريد النسخة الأعمق — ما الذي يحدث فعلياً أثناء الفهرسة، وكيف يعمل تحديد العنوان الأساسي، وكيف تقرأ كل حالة في تقرير فهرسة الصفحات في Search Console؟ انتقل إلى تبويب Advanced.
الخلاصة — الفهرسة هي المرحلة الثانية من مراحل البحث الثلاث (الزحف ← الفهرسة ← العرض): تفهم Google الصفحة التي زُحف إليها (النص والوسوم الأساسية والصور والفيديو؛ كما تعرض JavaScript)، وتكتشف التكرارات، وتجمع الصفحات المتشابهة وتختار أكثرها تمثيلاً (تحديد العنوان الأساسي — فـ
rel=canonicalتلميح لا قاعدة)، وتحسب الإشارات، وتخزن العنوان الأساسي في الفهرس. الزحف لا يساوي الفهرسة — «الفهرسة غير مضمونة»، والقرار يرتبط إلى حد كبير بالجودة والقيمة. تقرير فهرسة الصفحات في Search Console هو قمرة القيادة. ولإزالة الفهرسة استخدمnoindexواترك الصفحة قابلة للزحف؛ ولا تستخدمrobots.txtلإزالة صفحة، لأن الصفحة المحظورة قد تظل مفهرسة (لكن من دون مقتطف). Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex
الفهرسة هي المرحلة الثانية من ثلاث
Three stages run left to right. Crawl discovers and downloads a URL. Index processes the page and stores eligible information. Serve or rank orders the best indexed matches for a query. The Index stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
تتحدث Google بوضوح عن المسار: “Google Search works in three stages, and not all pages make it through each stage” (ترجمة) «يعمل بحث Google في ثلاث مراحل، ولا تصل كل الصفحات إلى نهاية كل مرحلة» — الزحف والفهرسة والعرض. الفهرسة هي المرحلة الوسطى، وتعرّفها الوثيقة بوضوح: “Indexing: Google analyzes the text, images, and video files on the page, and stores the information in the Google index, which is a large database.” (ترجمة) «الفهرسة: تحلل Google النصوص والصور وملفات الفيديو في الصفحة، وتخزن المعلومات في فهرس Google، وهو قاعدة بيانات كبيرة.»
Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search worksيجب أن تزحف Google إلى الصفحة قبل أن تتمكن من فهرستها، ويجب أن تكون مفهرسة قبل أن تتمكن من ترتيبها. لكن لا شيء من ذلك مضمون — فكل مرحلة مرشح. إن إبقاء المراحل الثلاث منفصلة في ذهنك هو النموذج الذهني الأكثر فائدة في SEO التقني، ولهذا أسأل دائماً عن المرحلة التي تفشل فيها الصفحة قبل تغيير أي شيء. (أما المرحلة السابقة لهذه، فراجع محور الزحف — الزحف ← الفهرسة هو المسار.)
ما الذي يحدث فعلياً أثناء الفهرسة
Step one analyzes a crawled page for text, title, alt text, images, and video. Step two groups duplicate URLs into a cluster and chooses the most representative page as canonical. Step three stores the canonical page and its cluster information in the Google index.
© Patrick Stox LLC · CC BY 4.0 ·
الفهرسة ليست شيئاً واحداً؛ إنها سلسلة من الخطوات:
- فهم المحتوى. تقول Google: “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (ترجمة) «بعد الزحف إلى الصفحة، تحاول Google فهم موضوعها. وتسمى هذه المرحلة الفهرسة.» وهذا يعني أن “Google analyzes the textual content and key content tags and attributes, such as
<title>elements and alt attributes, images, videos, and more.” (ترجمة) «تحلل Google المحتوى النصي والوسوم والسمات الأساسية للمحتوى، مثل عناصر<title>وسمات alt والصور والفيديو وغير ذلك.» وتُعرض JavaScript كجزء من ذلك — فإذا ظهر محتواك بعد تشغيل JS فقط، فلا يزال عليه أن يُعرض قبل أن يمكن فهمه. - اكتشاف التكرارات وتحديد العنوان الأساسي. هذه هي الجزئية التي تتخطاها معظم الشروحات، وفيها تعيش ألغاز «لماذا لم تُفهرس هذه الصفحة؟» الكثيرة. تحدد Google “determines if a page is a duplicate of another page on the internet or canonical.” (ترجمة) «ما إذا كانت الصفحة تكراراً لصفحة أخرى على الإنترنت أو الصفحة الأساسية.» والآلية هي: “we first group together (also known as clustering) the pages that we found on the internet that have similar content, and then we select the one that’s most representative of the group.” (ترجمة) «نجمع أولاً الصفحات التي وجدناها على الإنترنت ذات المحتوى المتشابه، وهو ما يسمى التجميع، ثم نختار الصفحة الأكثر تمثيلاً للمجموعة.» وهذا الممثل هو العنوان الأساسي — “The canonical is the page that may be shown in search results.” (ترجمة) «العنوان الأساسي هو الصفحة التي قد تظهر في نتائج البحث.»
- حساب الإشارات والتخزين. أخيراً، “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (ترجمة) «قد تُخزن المعلومات المجمعة عن الصفحة الأساسية ومجموعتها في فهرس Google، وهو قاعدة بيانات كبيرة مستضافة على آلاف الحواسيب.» ونظام الفهرسة الذي تسميه Google وراء ذلك كله هو Caffeine — الطبقة التي تستوعب بيانات الزحف، وتعرض الصفحات وتستخرج منها، وتحسب الإشارات، وتبني الفهرس الذي يجري عرضه.
تحديد العنوان الأساسي: تلميح لا أمر
بما أن تحديد العنوان الأساسي يحدث أثناء الفهرسة، فهو يستحق ملاحظة خاصة. “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content,” (ترجمة) «تحديد العنوان الأساسي هو عملية اختيار عنوان URL الممثل — الأساسي — لقطعة من المحتوى»، وهو موجود لأن “this process helps Google show only one version of the otherwise duplicate content in its search results.” (ترجمة) «هذه العملية تساعد Google على عرض نسخة واحدة فقط من المحتوى المكرر لولاها في نتائج البحث.»
التفصيل الحاسم: إن rel=canonical الخاص بك اقتراح. كلمات Google هي: “indicating a canonical preference is a hint, not a rule.” (ترجمة) «الإشارة إلى تفضيل عنوان أساسي تلميح لا قاعدة.» تزن Google إشارات كثيرة — وفي دليل تحديد العنوان الأساسي أذكر أنه، وفقاً لـAllan Scott من Google، توجد نحو 40 إشارة مختلفة لاختيار العنوان الأساسي — ويمكنها اختيار عنوان URL مختلفاً عن الذي حددته. وهذا بالضبط ما تخبرك به حالة «Duplicate, Google chose different canonical than user» في Search Console.
الزحف لا يساوي الفهرسة: لماذا لا تُفهرس الصفحات
إليك مبدد الخرافة، من الوثائق مباشرة: “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (ترجمة) «الفهرسة غير مضمونة؛ فليست كل صفحة تعالجها Google ستُفهرس.» Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works وتسرد Google أسباباً شائعة للفشل — “The quality of the content on page is low,” (ترجمة) «جودة المحتوى في الصفحة منخفضة»، و*“Robots meta rules disallow indexing,”* (ترجمة) «قواعد meta الخاصة بالروبوتات تمنع الفهرسة»، و*“The design of the website might make indexing difficult.”* (ترجمة) «قد يجعل تصميم الموقع الفهرسة صعبة.»
الممثلون أكثر مباشرة حتى في توضيح أن هذا قرار اختيار تحركه القيمة، وليس حصة يمكنك شراء طريقك عبرها:
- قال John Mueller، عن المدة التي يمكن أن تستمر فيها حالة «Discovered/Crawled — غير مفهرسة حاليًا»: “That can be forever. It’s something where we just don’t crawl and index all pages.” (ترجمة) «قد يستمر ذلك إلى الأبد. الأمر أننا لا نزحف إلى كل الصفحات ولا نفهرسها.» والإصلاح ليس إعادة الإرسال — بل جعل الأنظمة تدرك القيمة، أي “continue working on the website and making sure that our systems recognize that there’s value in crawling and indexing more and then over time we will crawl and index more.” (ترجمة) «الاستمرار في العمل على الموقع والتأكد من أن أنظمتنا تدرك أن للزحف إلى المزيد من الصفحات وفهرستها قيمة، ثم سنزحف مع الوقت إلى المزيد ونفهرسه.»
- وقال Mueller مرة أخرى: “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (ترجمة) «من المهم أن تضع في اعتبارك أن Google لا تفهرس كل صفحة على الويب، حتى إذا أُرسلت إليها مباشرة.» وبصراحة: “Well, lots of SEOs & sites (perhaps not you/yours!) produce terrible content that’s not worth indexing.” (ترجمة) «حسناً، ينتج كثير من العاملين في SEO والمواقع محتوى فظيعاً لا يستحق الفهرسة — وربما لا ينطبق ذلك عليك أو على موقعك!».
- وقال Gary Illyes، عن سبب الانتقائية: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (ترجمة) «ليست لدينا مساحة لا نهائية، لذلك نريد فهرسة الأشياء التي نعتقد — حسناً، ليست نحن، بل خوارزمياتنا — أن الناس قد يبحثون عنها…».
- ويصف Martin Splitt الأمر بأنه موازنة: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (ترجمة) «أصفه عادةً بأنه تحدٍ يتمثل في الموازنة بين عدم إغراق الموقع، وإنفاق مواردنا حيث تهم.»
الخلاصة العملية: تساعد خريطة الموقع أو «طلب الفهرسة» على الاكتشاف، لا على الاختيار. ولن يؤدي إرسال الصفحة مجدداً إلى إجبار Google على إدخالها. الرافعة هي جودة الموقع وقيمته.
قراءة تقرير فهرسة الصفحات في Google Search Console
Page indexing report هو المكان الذي تظهر فيه مشكلات الفهرسة فعلياً. تعامل مع كل حالة بوصفها تشخيصاً. هذه أوصاف Google الحرفية نفسها:
- Crawled – currently not indexed: “The page was crawled by Google but not indexed. It may or may not be indexed in the future; no need to resubmit this URL for crawling.” (ترجمة) «زحفت Google إلى الصفحة لكنها لم تفهرسها. وقد تُفهرس أو لا تُفهرس مستقبلاً؛ لا حاجة إلى إعادة إرسال عنوان URL هذا للزحف.» عادةً هو حكم على الجودة والقيمة — حسّن الصفحة، ولا تزعج زر إعادة الإرسال.
- Discovered – currently not indexed: “The page was found by Google, but not crawled yet. Typically, Google wanted to crawl the URL but this was expected to overload the site; therefore Google rescheduled the crawl.” (ترجمة) «وجدت Google الصفحة، لكنها لم تزحف إليها بعد. عادةً أرادت Google الزحف إلى عنوان URL، لكن كان متوقعاً أن يحمّل ذلك الموقع فوق طاقته؛ لذلك أعادت جدولة الزحف.» حالة تقنية قبل الزحف تحركها السعة — لكن إذا استمرت، يربطها الممثلون بالقيمة، مثل الحالة السابقة.
- Duplicate without user-selected canonical: “This page is a duplicate of another page, although it doesn’t indicate a preferred canonical page. Google has chosen the other page as the canonical for this page, and so will not serve this page in Search.” (ترجمة) «هذه الصفحة تكرار لصفحة أخرى رغم أنها لا تشير إلى صفحة أساسية مفضلة. اختارت Google الصفحة الأخرى عنواناً أساسياً لهذه الصفحة، ولذلك لن تعرض هذه الصفحة في البحث.»
- Duplicate, Google chose different canonical than user: “This page is marked as canonical for a set of pages, but Google thinks another URL makes a better canonical.” (ترجمة) «هذه الصفحة محددة بوصفها أساسية لمجموعة من الصفحات، لكن Google ترى أن عنوان URL آخر أفضل بوصفه أساسياً.» وهذا هو ناتج «التلميح لا القاعدة» في الواقع.
- صفحة بديلة ذات وسم canonical صحيح: “This page is marked as an alternate of another page… This page correctly points to the canonical page, which is indexed, so there is nothing you need to do.” (ترجمة) «هذه الصفحة محددة بوصفها بديلاً لصفحة أخرى… وتشير بصورة صحيحة إلى الصفحة الأساسية المفهرسة، لذلك لا يلزمك فعل شيء.»
- Indexed, though blocked by robots.txt: “The page was indexed despite being blocked by your website’s robots.txt file. Google always respects robots.txt, but this doesn’t necessarily prevent indexing if someone else links to your page.” (ترجمة) «فُهرست الصفحة رغم حظرها بملف robots.txt الخاص بموقعك. تحترم Google دائماً robots.txt، لكن ذلك لا يمنع الفهرسة بالضرورة إذا ربط شخص آخر بصفحتك.» وهذا دليل على أن حظر الزحف لا يمنع الفهرسة.
- URL blocked by robots.txt: “This page was blocked by your site’s robots.txt file.” (ترجمة) «حُظرت هذه الصفحة بواسطة ملف robots.txt الخاص بموقعك.»
- URL marked ‘noindex’: “When Google tried to index the page it encountered a ‘noindex’ directive and therefore did not index it.” (ترجمة) «عندما حاولت Google فهرسة الصفحة، واجهت توجيه «noindex» ولذلك لم تفهرسها.» وهذا يعني أن إزالة الفهرسة تعمل كما أُريد لها.
- Page with redirect: “This is a non-canonical URL that redirects to another page. As such, this URL will not be indexed.” (ترجمة) «هذا عنوان URL غير أساسي يعيد التوجيه إلى صفحة أخرى، ولذلك لن يُفهرس.»
- Soft 404: “The page request returns what we think is a soft 404 response. This means that it returns a user-friendly ‘not found’ message but not a 404 HTTP response code.” (ترجمة) «يعيد طلب الصفحة ما نعتقد أنه استجابة 404 لينة. أي إنه يعيد رسالة «غير موجود» مناسبة للمستخدم، لا رمز استجابة HTTP 404.»
كيف تتحكم في الفهرسة بالطريقة الصحيحة
لفهرسة صفحة: اجعلها قابلة للزحف، واربط بها داخلياً، وأدرجها في خريطة موقعك — وقبل كل شيء، اجعلها تستحق الفهرسة. أدوات الاكتشاف لا تتجاوز حكم القيمة.
لإبقاء الصفحة خارج الفهرس — أكثر أدوات التحكم التي يُساء استخدامها في SEO: استخدم noindex، أي “a rule set with either a <meta> tag or HTTP response header,” (ترجمة) «مجموعة قواعد عبر وسم <meta> أو رأس استجابة HTTP»، وأبق الصفحة قابلة للزحف. وتحذير Google الحاسم: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (ترجمة) «لكي تكون قاعدة noindex فعالة، يجب ألا تكون الصفحة أو المورد محظوراً بملف robots.txt، ويجب أن يكون متاحاً للزاحف بطريقة أخرى.»
الخطأ الذي أراه باستمرار هو إضافة noindex وحظر الصفحة في robots.txt. هذا يأتي بنتيجة عكسية. وكما كتبت في كيفية إزالة عناوين URL من بحث Google: «For these tags to be seen, a search engine needs to be able to crawl the pages—so make sure they aren’t blocked in robots.txt» (ترجمة) «لكي ترى محركات البحث هذه الوسوم، يجب أن تتمكن من الزحف إلى الصفحات — لذا تأكد من عدم حظرها في robots.txt»، و«Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.» (ترجمة) «الزحف ليس الفهرسة. حتى إذا مُنعت Google من الزحف إلى الصفحات، فقد تفهرسها إذا وجدت روابط داخلية أو خارجية إليها.» وفي مقال حالة Indexed, though blocked by robots.txt أقولها بصورة أوضح: «Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.» (ترجمة) «ما لم تتمكن Google من الزحف إلى الصفحة، فلن ترى وسم noindex meta وقد تظل تفهرسها لأنها تحتوي على روابط.» والإصلاح هو: «Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.» (ترجمة) «أضف وسم noindex meta للروبوتات فحسب، وتأكد من السماح بالزحف — بافتراض أن الصفحة أساسية.»
ولقرار الإزالة الأشمل — 404/410 مقابل noindex، وحجز أداة Removals لنحو ستة أشهر، والحماية بكلمة مرور — راجع كيفية إزالة فهرسة صفحة.
الفهرسة في Bing
تشغّل Bing المسار نفسه. وكما تصفه Microsoft: “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (ترجمة) «أثناء زحف Bingbot إلى الويب، يرسل إلى Bing معلومات عما يجده. ثم تُضاف هذه الصفحات إلى فهرس Bing.» تنطبق أدوات التحكم نفسها — يبقي توجيه noindex الصفحة خارج الفهرس، ويمكن لـrobots.txt المفرط في التقييد أن يمنع Bingbot من الزحف إليها أصلاً. وتحتاج Bing أيضاً إلى رابط واحد على الأقل يشير إلى موقعك كي تجده في المقام الأول.
ليست كل صفحة تنتمي إلى الفهرس
هذا مرشح بسيط لا قاعدة عالمية: تستحق الصفحة الفهرسة إذا كان يمكنها الظهور في بحث بنتيجة مميزة ومفيدة. وهذا هو المعيار الذي تقيس عليه التكرارات، وصيغ المعلمات، وعناوين URL الخاصة أو التجريبية، وصفحات المخزون الرقيقة أو المتكررة — وليس سبباً لإضافة noindex إلى نوع صفحة كامل افتراضياً. أجرِ التدقيق الكامل على الصفحات المصممة لامتلاك هذا الظهور، ثم تابع.
إلى أين تذهب بعد ذلك: مجموعة الفهرسة
هذه الصفحة هي النظرة العامة. وهناك شيئان يسوءان على نطاق واسع، ولكل منهما موضوع متعمق خاص:
- تضخم الفهرس — عندما ينتهي عدد كبير جداً من عناوين URL منخفضة القيمة أو المكررة أو الرقيقة في الفهرس، فيخفف ذلك قيمة موقعك ويهدر موارد الزحف والفهرسة. تعلّم تشخيصه وتقليمه بأمان.
- الفهرسة التي تركز على الهاتف أولاً — تفهرس Google النسخة الجوالة من صفحاتك، لذلك يجب أن يصل المحتوى والروابط والبيانات المنظمة إلى مستوى التكافؤ بين الهاتف وسطح المكتب. تعرّف ما الذي يجب فحصه وما الذي يتعطل.
كلا الموضوعين متفرعان تحت هذه الصفحة — وهما موجودان في الشريط الجانبي أيضاً، وسيربطان عائداً بهذه الصفحة.
تعيش المرحلة السابقة لهذه — أي كيفية اكتشاف الروبوتات لصفحاتك وتنزيلها — في محور الزحف؛ فالزحف ← الفهرسة هو المسار، ويجب أن تتجاوز الصفحة مرحلة الزحف قبل أن ينطبق أي من هذا. وللصورة الأوسع، راجع كيف يعمل البحث.
ملخص الذكاء الاصطناعي
خلاصة مركزة للنسخة المتقدمة:
- الفهرسة = المرحلة الثانية من البحث (الزحف ← الفهرسة ← العرض). يجب الزحف إلى الصفحة كي تُفهرس، وفهرستها كي ترتب — لكن لا شيء من ذلك مضمون. وهي ليست عامل ترتيب، بل أهلية فحسب.
- ما يحدث أثناء الفهرسة: تفهم Google المحتوى (النص والوسوم الأساسية والصور والفيديو؛ وتعرض JS)، وتكتشف التكرارات، وتجمع الصفحات المتشابهة وتختار أكثرها تمثيلاً (الصفحة الأساسية)، وتحسب الإشارات، وتخزنها في فهرس Google (النظام: Caffeine).
- يحدث تحديد العنوان الأساسي أثناء الفهرسة. إن
rel=canonical«تلميح لا قاعدة» — ويمكن لـGoogle اختيار عنوان أساسي مختلف (نحو 40 إشارة للاختيار). - الزحف لا يساوي الفهرسة. «الفهرسة غير مضمونة». إنه قرار جودة وقيمة: يقول Mueller «قد يستمر ذلك إلى الأبد»، ويقول Illyes «ليست لدينا مساحة لا نهائية». لن تجبر إعادة الإرسال الصفحة على الدخول؛ تحسين الموقع هو الرافعة.
- تقرير فهرسة الصفحات في GSC هو قمرة القيادة: «Crawled/Discovered — غير مفهرس حاليًا» (غالباً قيمة)، وحالات التكرار والعنوان الأساسي، و«Indexed, though blocked by robots.txt»، و«URL marked noindex».
- لإزالة الفهرسة: استخدم
noindex(meta أو X-Robots-Tag) وأبق الصفحة قابلة للزحف — يجب أن تزحف Google إليها كي ترى الوسم. ولا تستخدمrobots.txtلإزالة الفهرسة أبداً: فقد تظل الصفحة المحظورة مفهرسة عبر الروابط (من دون مقتطف). - تعكس Bing المسار نفسه. وتنطبق قواعد
noindexنفسها. - على نطاق واسع، هناك نمطا فشل: تضخم الفهرس (عناوين URL منخفضة القيمة أكثر من اللازم) والفهرسة التي تركز على الهاتف أولاً (أي النسخة التي تفهرسها Google).
الوثائق الرسمية
وثائق من المصادر الأولية لمحركات البحث.
- دليل متعمق لكيفية عمل بحث Google — نظرة عامة على الزحف ← الفهرسة ← العرض، ومرحلة الفهرسة، وسبب أن «الفهرسة غير مضمونة».
- تحديد العنوان الأساسي وعناوين URL المكررة — كيف تجمع Google التكرارات وتختار عنواناً أساسياً (وثيقة «التلميح لا القاعدة»).
- حظر فهرسة البحث باستخدام noindex — أداة إزالة الفهرسة الصحيحة، وسبب ضرورة إبقاء الصفحة قابلة للزحف.
- تقرير فهرسة الصفحات — مساعدة Search Console لكل حالة فهرسة وما تعنيه.
- الزحف والفهرسة — محور robots وخرائط المواقع وتحديد العنوان الأساسي وأدوات التحكم في الفهرسة.
Bing / Microsoft
- كيف تعرض Bing نتائج البحث — مسار الزحف ← الفهرسة لدى Bing بكلمات Microsoft نفسها.
- لماذا لا يظهر موقعي في الفهرس؟ — مساعدة Bing Webmaster Tools بشأن عوائق الفهرسة.
اقتباسات من المصدر
تصريحات مسجلة من Google وBing. كل رابط هو رابط عميق يقفز إلى المقطع المقتبس في صفحة المصدر.
Google — ما هي الفهرسة
- “Google Search works in three stages, and not all pages make it through each stage.” (ترجمة) «يعمل بحث Google في ثلاث مراحل، ولا تصل كل الصفحات إلى نهاية كل مرحلة.» — وثائق Google Search Central. الانتقال إلى الاقتباس
- “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (ترجمة) «بعد أن تزحف الصفحة، تحاول Google استيعاب موضوعها؛ وتُسمّى هذه الخطوة الفهرسة». الانتقال إلى الاقتباس
- “Google analyzes the textual content and key content tags and attributes, such as
<title>elements and alt attributes, images, videos, and more.” (ترجمة) «تحلل Google المحتوى النصي ووسوم وسمات المحتوى الأساسية، مثل عناصر<title>وسمات alt والصور والفيديو وغير ذلك.» الانتقال إلى الاقتباس - “The canonical is the page that may be shown in search results… we first group together (also known as clustering) the pages that we found on the internet that have similar content, and then we select the one that’s most representative of the group.” (ترجمة) «العنوان الأساسي هو الصفحة التي قد تظهر في نتائج البحث… نجمع أولاً الصفحات ذات المحتوى المتشابه التي وجدناها على الإنترنت، ثم نختار أكثرها تمثيلاً للمجموعة.» الانتقال إلى الاقتباس
- “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (ترجمة) «قد تُخزن المعلومات المجمعة عن الصفحة الأساسية ومجموعتها في فهرس Google، وهو قاعدة بيانات كبيرة مستضافة على آلاف الحواسيب.» الانتقال إلى الاقتباس
- “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (ترجمة) «الفهرسة غير مضمونة؛ فليست كل صفحة تعالجها Google ستُفهرس.» الانتقال إلى الاقتباس
Google — تحديد العنوان الأساسي وnoindex
- “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content.” (ترجمة) «تحديد العنوان الأساسي هو عملية اختيار عنوان URL الممثل — الأساسي — لقطعة من المحتوى.» — وثائق Google Search Central. الانتقال إلى الاقتباس
- “That is, indicating a canonical preference is a hint, not a rule.” (ترجمة) «أي إن الإشارة إلى تفضيل عنوان أساسي تلميح لا قاعدة.» الانتقال إلى الاقتباس
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (ترجمة) «لكي تكون قاعدةnoindexفعالة، يجب ألا تكون الصفحة أو المورد محظوراً بملف robots.txt، ويجب أن يكون متاحاً للزاحف بطريقة أخرى.» — وثائق Google Search Central. الانتقال إلى الاقتباس
John Mueller، Google (عبر Search Engine Journal)
- “That can be forever. It’s something where we just don’t crawl and index all pages.” (ترجمة) «قد يدوم ذلك إلى الأبد؛ فنحن لا نزحف إلى كل الصفحات ولا نفهرسها». قراءة التغطية
- “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (ترجمة) «من المهم أن تضع في اعتبارك أن Google لا تفهرس كل صفحة على الويب، حتى إذا أُرسلت إليها مباشرة.» قراءة التغطية
Gary Illyes وMartin Splitt، Google (عبر Search Engine Journal)
- قال Illyes: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (ترجمة) «ليست لدينا مساحة لا نهائية، لذلك نريد فهرسة الأشياء التي تحدد خوارزمياتنا أن الناس قد يبحثون عنها…» قراءة التغطية
- وقال Splitt: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (ترجمة) «أصفه عادةً بأنه تحدٍ يتمثل في الموازنة بين عدم إغراق الموقع وإنفاق مواردنا حيث تهم.» قراءة التغطية
Bing / Microsoft
- “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (ترجمة) «عندما يزحف Bingbot إلى الويب، يرسل إلى Bing معلومات ما يعثر عليه، ثم تُضاف تلك الصفحات إلى فهرس Bing». — Microsoft Support. قراءة المصدر
قائمة فحص صحة الفهرسة
مراجعة سريعة للتأكد من فهرسة الصفحات الصحيحة وعدم فهرسة الصفحات الخاطئة:
- الصفحات التي تريد فهرستها قابلة للزحف (غير محظورة في
robots.txt) ويمكن الوصول إليها عبر الروابط الداخلية — ولا توجد صفحات يتيمة. - تعيد الصفحات المهمة
200، وليست موسومة بـnoindexبالخطأ، وتشير سمةrel=canonicalفيها إلى نفسها (أو إلى العنوان الأساسي الصحيح). - يعرض تقرير فهرسة الصفحات (Page indexing report) في Search Console القوالب الأساسية على أنها «Indexed»، وقد فرزت حالات «Crawled/Discovered — غير مفهرسة حاليًا».
- جرت مراجعة حالات التكرار والعنوان الأساسي — وتأكدت من مطابقة العنوان الأساسي الذي اختارته Google لنيتك.
- تستخدم الصفحات التي تريد إخراجها
noindex(meta أوX-Robots-Tag) وتظل قابلة للزحف كي ترى Google الوسم. - لا تستخدم
robots.txtلإزالة الفهرسة (فالمحظور لا يساوي المُزال). - لا توجد مفاجآت من نوع «Indexed, though blocked by robots.txt» في التقرير.
- يُعرض المحتوى المعتمد على JS في HTML قابل للفهرسة (إذ يجب عرضه قبل فهمه).
- تسرد خريطة الموقع عناوين URL الأساسية القابلة للفهرسة فقط (فهي تساعد على الاكتشاف، لا الاختيار).
النماذج الذهنية
1. المسار — الزحف ← الفهرسة ← العرض. كل مرحلة مرشح، و«لا تصل كل الصفحات إلى نهاية كل مرحلة». قبل تغيير أي شيء، حدّد المرحلة التي تفشل فيها الصفحة: هل زُحف إليها؟ هل فُهرست؟ هل عُرضت للاستعلام؟
2. الزحف لا يساوي الفهرسة ولا يساوي الترتيب. يعني الزحف التنزيل. وتعني الفهرسة التخزين والأهلية. أما الترتيب فمنافسة منفصلة بين الصفحات المفهرسة. والفهرسة ليست عامل ترتيب — لكن لا يمكنك الترتيب من دونها.
3. الفهرسة قرار اختيار. تختار Google ما تحتفظ به — «الفهرسة غير مضمونة». إذا لم تُفهرس الصفحة، فنادراً ما يكون السؤال «هل أرسلتها؟»، وغالباً ما يكون «هل تستحق الاحتفاظ بها؟» حسّن القيمة؛ ولا تعِد إرسالها.
4. تحديد العنوان الأساسي جزء من الفهرسة.
تُجمع التكرارات ويُخزن عنوان URL ممثل واحد. إن rel=canonical تلميح — ويمكن لـGoogle تجاوزه. فإذا فُهرس عنوان URL خاطئ، فانظر إلى الإشارات (الروابط الداخلية وخرائط المواقع وعمليات إعادة التوجيه)، لا إلى الوسم وحده.
5. قاعدة القرار لإبقاء الصفحة خارج الفهرس.
أتريد إخراجها من الفهرس؟ اسمح بالزحف + noindex. أتريد من الروبوتات تجاوز مساحة من عناوين URL تماماً (ولا تهتم بما إذا كانت نسخ شاردة ستُفهرس عبر الروابط)؟ استخدم حظر robots.txt. ولا تستخدم الحظر لإزالة الفهرسة.
أدوات التحكم في الفهرسة والحالات — ورقة غش
ما الذي يفعله كل عنصر تحكم فعلياً
| عنصر التحكم | هل يوقف الزحف؟ | هل يوقف الفهرسة؟ | استخدمه من أجل |
|---|---|---|---|
noindex (meta/header) | لا (يجب أن تظل الصفحة قابلة للزحف) | نعم | إزالة صفحة من الفهرس |
حظر robots.txt | نعم | لا | إبقاء الروبوتات خارج مساحات عناوين URL منخفضة القيمة |
rel=canonical | لا | يدمج (تلميح) | الإشارة إلى التكرار المفضل |
| أداة إزالة عناوين URL (GSC) | لا | مؤقت (نحو ستة أشهر) | إخفاء سريع وقصير الأجل ريثما تضيف noindex |
قراءة تقرير فهرسة الصفحات (الحالات عالية القيمة)
| الحالة | ما تعنيه | ما الذي ينبغي فعله |
|---|---|---|
| Crawled – currently not indexed | زُحف إلى الصفحة وحُكم بأنها لا تستحق الاحتفاظ | حسّن الجودة والقيمة — ولا تعِد إرسالها |
| Discovered – currently not indexed | عُثر عليها وأُجّل الزحف؛ والاستمرار إشارة قيمة | حسّن القيمة؛ وافحص الروابط الداخلية |
| Duplicate, Google chose different canonical | تجاوزت Google عنوانك الأساسي | قوِّ الإشارات إلى عنوان URL المفضل |
| Indexed, though blocked by robots.txt | محظورة لكنها فُهرست عبر الروابط | أزل الحظر + أضف noindex لإزالتها |
| URL marked ‘noindex’ | شوهد noindex واحترمته Google | لا شيء (تعمل كما ينبغي) |
| صفحة تعيد التوجيه / 404 وهمية | إعادة توجيه غير أساسية / 404 وهمية | أصلح إعادة التوجيه أو أعد 404/410 حقيقية |
حقائق سريعة
- «الفهرسة غير مضمونة» — تختار Google ما تحتفظ به.
- لا يعمل
noindexإلا إذا كانت الصفحة قابلة للزحف. - يحظر
robots.txtالزحف، لا الفهرسة — فقد تظل الصفحة المحظورة مفهرسة. - إن
rel=canonicalتلميح لا توجيه (~40 إشارة لاختيار العنوان الأساسي). - الفهرسة ليست عامل ترتيب — إنها بوابة الأهلية للترتيب.
أدوات لرؤية الفهرسة وإدارتها
تحقق من فهرسة صفحة محددة باستخدام Google Index Checker:
- الصق عنوان URL العام الدقيق في الأداة.
- شغّل Check signals لجلب الاستجابة المباشرة.
- اقرأ إشارات الحالة وإعادة التوجيه وnoindex والعنوان الأساسي التي تعرضها.
- اتبع إحالة Open URL Inspection لمعرفة حكم Google الفعلي في الفهرس — فالأداة تعرض فقط ما يمكن ملاحظته من الصفحة العامة.
- Google Search Console — Page indexing report — رؤية Google الخاصة بالصفحات المفهرسة وسبب عدم فهرسة الصفحات الأخرى، حالةً بحالة.
- URL Inspection (GSC) — تحقق من فهرسة عنوان URL واحد، وشاهد العنوان الأساسي الذي اختارته Google وHTML المعروض.
- Bing Webmaster Tools — تغطية الفهرس وفحص عناوين URL والإرسال إلى Bing.
- عامل
site:— فحص تقريبي سريع لما هو مفهرس (وليس بديلاً عن Search Console). - الزواحف / تدقيق المواقع — يعرض Ahrefs Site Audit وScreaming Frog SEO Spider وسوم
noindexوتعارضات العنوان الأساسي ومجموعات التكرار ومشكلات قابلية الفهرسة على نطاق واسع. - Ahrefs Webmaster Tools — زحف وتدقيق مجانيان للمواقع التي تتحقق منها، مع الإبلاغ عن مشكلات قابلية الفهرسة.
موارد تستحق وقتك
كتاباتي ذات الصلة
- دليل المبتدئين إلى SEO التقني — موضع الفهرسة في الصورة الأوسع.
- كيفية إزالة عناوين URL من بحث Google (5 طرق) — الطرق الصحيحة والخاطئة لإزالة الفهرسة.
- مفهرسة رغم حظرها في robots.txt — لماذا تُفهرس الصفحات المحظورة رغم ذلك، وما الإصلاح.
- تحديد العنوان الأساسي: دليل المبتدئين — كيف تختار Google عنوان URL الذي تفهرسه.
- ماذا تعني حالة «Crawled - Currently Not Indexed» في Google Search Console — تشخيص أكثر حالات «غير مفهرس» شيوعاً.
من آخرين
- وسم Robots Meta وX-Robots-Tag: كل ما تحتاج إلى معرفته (Michal Pecánek، Ahrefs) — المرجع الحاسم لتوجيهات
noindex، بما في ذلك: «Never disallow crawling of content that you’re trying to get deindexed in robots.txt.» (لا تمنع أبداً زحف المحتوى الذي تحاول إزالة فهرسته في robots.txt.) - r/TechSEO — مجتمع لتصحيح مشكلات الزحف والفهرسة.
من أرجاء المجال
- Google تقول إن حالة «Discovered - Currently Not Indexed» قد تستمر إلى الأبد (Search Engine Journal) — اقتباس Mueller «قد يستمر ذلك إلى الأبد» في سياقه، مع خلاصات عملية للمواقع العالقة في هذه الحالة.
- Google تشارك رؤى حول الفهرسة وميزانية الزحف (Search Engine Journal) — Mueller وIllyes وSplitt عن سبب عدم فهرسة Google لكل شيء وكيفية التفكير في قرار قيمة الزحف والفهرسة.
- Gary Illyes يتحدث عن استرجاع المعلومات في بحث Google (Search Engine Roundtable) — Illyes عن محدودية مساحة الفهرس وسبب انتقائية Google فيما تخزنه.
- كشف أسرار Caffeine (نظام فهرسة Google) (بودكاست Search Off the Record من Google) — يشرح فريق Google Search Relations كيف يستوعب Caffeine بيانات الزحف، ويعرض الصفحات ويستخرج الإشارات، ويبني الفهرس.
محاضراتي
- How Search Works (SlideShare) — شرحي للزحف والعرض والفهرسة والترتيب. (ينطبق إخلاء المسؤولية المعتاد لدي: «This is my understanding of systems… not going to be 100% complete or accurate.» (هذا فهمي للأنظمة… ولن يكون كاملاً أو دقيقاً بنسبة 100%).)
ملفات صوتية
- بودكاست Search Off the Record (علاقات بحث Google) — “Spilling the beans on Caffeine (Google’s indexing system) and more!” (ترجمة) «كشف أسرار Caffeine، نظام فهرسة Google، والمزيد!» يتحدث فريق Google عن كيفية استيعاب نظام الفهرسة لبيانات الزحف، وعرضها واستخراجها، وحساب الإشارات، وبناء الفهرس. استماع
فيديوهات
- Google Search Central (YouTube) — سلسلة How Google Search Works وشرائح Martin Splitt عن الفهرسة والعرض، بما في ذلك فيديوهات تحديد العنوان الأساسي وJavaScript SEO. Channel
اختبر نفسك: الفهرسة
خمسة أسئلة سريعة عن كيفية فهرسة الصفحات (ولماذا قد لا تُفهرس). اختر إجابة لكل سؤال، ثم تحقق منها.
سجل التغييرات
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 18 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
- Beginner
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
- Beginner
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
- Advanced
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.