Come funziona la ricerca

Come funziona la ricerca — Italiano

Italiano › Contenuti

Rapporto Indicizzazione delle pagine (GSC)

Come funziona il rapporto Indicizzazione delle pagine di Google Search Console (prima Copertura dell'indice): indicizzate e non indicizzate, colonna Origine, tutti gli stati, Convalida correzione e ritardo del rapporto.

Leggi l’articolo →
Italiano › Contenuti

Web crawler

Che cos’è davvero un web crawler (spider o bot), come funziona il ciclo recupero → analisi → coda e perché il crawling non coincide con indicizzazione, rendering o ranking.

Leggi l’articolo →
Italiano › Contenuti

Scoperta degli URL

Come i motori di ricerca scoprono gli URL tramite link interni, backlink, sitemap, RSS/Atom e protocolli push come IndexNow e l’API di indicizzazione. L’hub per tutto ciò che riguarda la scoperta.

Leggi l’articolo →
Italiano › Contenuti

Crawl delay

La direttiva crawl-delay di robots.txt — che cosa fa, perché Google ha smesso di rispettarla nel 2019 e Yandex nel 2018, come Bing interpreta ancora il valore, quali altri crawler la rispettano e che cosa usare al suo posto.

Leggi l’articolo →
Italiano › Contenuti

Canonicalizzazione

Come i motori di ricerca scelgono un URL canonical tra duplicati, vi consolidano i segnali e allineano tutti i segnali, sapendo che rel=canonical è un suggerimento, non una regola.

Leggi l’articolo →
Italiano › Contenuti

Tag canonical

Come implementare correttamente rel=canonical: elemento link HTML, header HTTP Link per i PDF, URL assoluti, un solo canonical per pagina e principali errori da evitare.

Leggi l’articolo →
Italiano › Contenuti

Bloccato da robots.txt (stato GSC)

Che cosa significa lo stato "Bloccato da robots.txt" di Indicizzazione delle pagine in Google Search Console: un URL escluso dall’indicizzazione perché robots.txt ha vietato il crawl. Di solito è intenzionale. In che cosa differisce da "Indicizzato nonostante il blocco"; perché noindex e disallow sono in conflitto; e come correggerlo se il blocco è un errore.

Leggi l’articolo →
Italiano › Contenuti

Bloccato per accesso vietato (403)

Che cosa significa lo stato "Bloccato per accesso vietato (403)" nel rapporto Indicizzazione delle pagine di Google Search Console, perché Googlebot riceve 403 mentre il tuo browser no, in che cosa differisce dal 401 e come diagnosticarlo, correggerlo e validarlo.

Leggi l’articolo →
Italiano › Contenuti

Bloccato per altro problema 4xx

Che cosa significa lo stato "Bloccato per altro problema 4xx" nel rapporto Indicizzazione delle pagine di Google Search Console, quali codici 400, 405, 408, 410, 411, 413, 414, 421, 422 e 451 possono trovarsi nel gruppo, come distinguere la sfumatura del 429 e come diagnosticare, correggere e validare il codice reale.

Leggi l’articolo →
Italiano › Contenuti

Bloccato per richiesta non autorizzata (401)

Che cosa significa lo stato "Bloccato per richiesta non autorizzata (401)" nel rapporto Indicizzazione delle pagine di Google Search Console, in che cosa differisce dal 403 secondo RFC 9110, quali sono le cause comuni, come diagnosticarlo come bot e qual è la correzione giusta in base al tipo di pagina: pubblica, privata, falso positivo WAF o con paywall.

Leggi l’articolo →
Italiano › Contenuti

Non trovato (404)

Cosa significa "Non trovato (404)" nel report Indicizzazione delle pagine di Google Search Console — perché Google ha trovato URL che non hai mai inviato, perché i 404 di solito non danneggiano la SEO, e il piccolo insieme di 404 che vale davvero la pena correggere.

Leggi l’articolo →
Italiano › Contenuti

URL contrassegnato 'noindex' (stato GSC)

Cosa significa lo stato "URL contrassegnato 'noindex'" di Google Search Console — e la variante "URL inviato contrassegnato 'noindex'" e il nome legacy "Escluso per tag 'noindex'". Quando è intenzionale vs. un errore, dove vive il noindex (meta tag vs. header X-Robots-Tag), il conflitto con robots.txt, il noindex fantasma/CDN, e come correggere e validare.

Leggi l’articolo →
Italiano › Contenuti

Crawling: come funziona la scansione web

Come i motori di ricerca scoprono e scaricano il web — Googlebot e Bingbot, scoperta degli URL, scheduler di scansione, rendering e differenze tra crawling, indicizzazione e ranking. L’hub per tutto ciò che riguarda il crawling.

Leggi l’articolo →
Italiano › Contenuti

Crawl budget: cos’è e come ottimizzarlo

Che cos’è davvero il crawl budget — capacità di scansione più domanda di scansione — cosa lo spreca e il test onesto per capire se il tuo sito è abbastanza grande da dovertene preoccupare.

Leggi l’articolo →
Italiano › Contenuti

Crawler IA

I tre tipi di crawler IA — bot di addestramento, indicizzatori della ricerca IA e fetcher attivati dall'utente —, i principali nomi e come controllarli senza danneggiare il SEO.

Leggi l’articolo →
Italiano › Contenuti

Googlebot: guida al crawler di Google

Che cos’è davvero Googlebot: Smartphone contro Desktop, rendering con Chromium evergreen, stringhe user-agent, verifica degli intervalli IP, limiti in byte e differenza tra crawling e ranking.

Leggi l’articolo →
Italiano › Contenuti

Il crawler Bingbot

Che cos’è Bingbot, che cosa alimenta oltre a Bing, come verificarlo con il DNS inverso e come controllarne il crawling con robots.txt, Crawl Control e IndexNow.

Leggi l’articolo →
Italiano › Contenuti

PageRank e SEO

PageRank è l'algoritmo originale di Google per l'analisi dei link: il modello del navigatore casuale, la formula, l'evoluzione Reasonable Surfer, la storia dalla barra degli strumenti alla fuga di documenti API del 2024, perché resta un sistema fondamentale di posizionamento e che cosa comporta per i link e l'architettura interna del sito.

Leggi l’articolo →
Italiano › Contenuti

Reindirizzamenti JavaScript

Cos'è un reindirizzamento JavaScript, come la pipeline di rendering di Google lo tratta diversamente da un 301 lato server, quando è un'ultima risorsa accettabile, e come implementarlo e rilevarlo — oltre a dove si collocano il meta refresh e l'History API.

Leggi l’articolo →
Italiano › Contenuti

Robots.txt

Che cosa fa davvero robots.txt — controlla la scansione, non l’indicizzazione — oltre alla sintassi esatta, a come Google lo gestisce internamente e agli errori che danneggiano i siti.

Leggi l’articolo →
Italiano › Contenuti

User Agent e SEO

Cos'è un user agent — l'header HTTP che crawler e browser usano per identificarsi, il token robots.txt rispetto alla stringa completa, e come verificare che un bot sia reale.

Leggi l’articolo →
Italiano › Contenuti

Feed RSS

Come i motori di ricerca usano i feed RSS 2,0 e Atom 1,0 come canale di scoperta per contenuti freschi: Feedfetcher, robots.txt, WebSub e perché un feed integra ma non sostituisce mai una sitemap XML.

Leggi l’articolo →
Italiano › Contenuti

Google Indexing API: guida

Che cosa fa davvero la Google Indexing API — supportata ufficialmente solo per pagine JobPosting e BroadcastEvent (livestream), non per i contenuti generici. I miti, ciò che dice davvero Google e che cosa usare invece per indicizzare più velocemente.

Leggi l’articolo →
Italiano › Contenuti

Sitemap

Cos'è una sitemap, se ti serve, i tipi (XML, HTML, immagini, video, notizie), come trovarla, crearla e inviarla, e perché le sitemap aiutano la scoperta ma non garantiscono mai l'indicizzazione.

Leggi l’articolo →
Italiano › Contenuti

Sitemap XML

Cos'è una sitemap XML, la sua anatomia, i tag ignorati (priority/changefreq), lastmod accurato, i limiti di 50 000/50MB, hreflang nelle sitemap e come inviarne una.

Leggi l’articolo →
Italiano › Contenuti

Contenuto duplicato: perché si verifica e come correggerlo

Non esiste una penalità per contenuto duplicato. Scopri quali sono i costi reali, come Google raggruppa i duplicati e sceglie un canonical e come correggerli.

Leggi l’articolo →
Italiano › Contenuti

Rendering e SEO

Come il Web Rendering Service di Google esegue il tuo JavaScript per costruire la pagina che indicizza — più le opzioni di rendering (CSR, SSR, SSG, hydration, ISR, edge, dynamic) e i loro compromessi SEO.

Leggi l’articolo →
Italiano › Contenuti

Sitelink: cosa sono e come influenzarli

Che cosa sono i sitelink di Google, perché sono algoritmici al 100% e come influenzarli (non controllarli): lo strumento di demozione ormai scomparso, la deprecazione del Sitelinks Searchbox, i Deep Links di Bing e la differenza tra sitelink a pagamento e organici.

Leggi l’articolo →
Italiano › Contenuti

Indicizzazione mobile-first

Cos'è realmente l'indicizzazione mobile-first — come Google usa il tuo HTML mobile per l'indicizzazione e il posizionamento — e perché la parità dei contenuti è la regola fondamentale.

Leggi l’articolo →
Italiano › Contenuti

Indicizzazione

Come i motori di ricerca memorizzano e organizzano le pagine per poterle classificare: analisi dei contenuti, canonicalizzazione, motivi per cui una pagina scansionata può non essere indicizzata e lettura del report Indicizzazione delle pagine in GSC.

Leggi l’articolo →
Italiano › Contenuti

Baiduspider: guida al crawler di Baidu

Che cos’è Baiduspider: le varianti e gli user-agent del crawler di Baidu, la conformità a robots.txt (e l’eccezione cpro/ads), la verifica tramite DNS inverso, il rendering JavaScript debole e il controllo del crawling in Ziyuan.

Leggi l’articolo →
Italiano › Contenuti

IndexNow per la SEO

IndexNow è il protocollo push aperto che informa immediatamente Bing, Yandex, Naver, Seznam e Yep quando cambiano i tuoi URL: un solo invio, condiviso tra tutti. Come funziona, come configurarlo e perché non produce effetti su Google.

Leggi l’articolo →
Italiano › Contenuti

Pagina alternativa con tag canonical corretto

«Pagina alternativa con tag canonical corretto» nel rapporto Indicizzazione delle pagine di Google Search Console non è un errore: è il sistema canonical che funziona come previsto. Ecco che cosa significa, perché i numeri elevati sono spesso normali, come si distingue dai due stati di duplicato e quali pochi casi meritano un controllo.

Leggi l’articolo →