Come funziona la ricerca
Come funziona la ricerca — Italiano
Rapporto Indicizzazione delle pagine (GSC)
Come funziona il rapporto Indicizzazione delle pagine di Google Search Console (prima Copertura dell'indice): indicizzate e non indicizzate, colonna Origine, tutti gli stati, Convalida correzione e ritardo del rapporto.
Italiano › ContenutiWeb crawler
Che cos’è davvero un web crawler (spider o bot), come funziona il ciclo recupero → analisi → coda e perché il crawling non coincide con indicizzazione, rendering o ranking.
Italiano › ContenutiScoperta degli URL
Come i motori di ricerca scoprono gli URL tramite link interni, backlink, sitemap, RSS/Atom e protocolli push come IndexNow e l’API di indicizzazione. L’hub per tutto ciò che riguarda la scoperta.
Italiano › ContenutiCrawl delay
La direttiva crawl-delay di robots.txt — che cosa fa, perché Google ha smesso di rispettarla nel 2019 e Yandex nel 2018, come Bing interpreta ancora il valore, quali altri crawler la rispettano e che cosa usare al suo posto.
Italiano › ContenutiCanonicalizzazione
Come i motori di ricerca scelgono un URL canonical tra duplicati, vi consolidano i segnali e allineano tutti i segnali, sapendo che rel=canonical è un suggerimento, non una regola.
Italiano › ContenutiTag canonical
Come implementare correttamente rel=canonical: elemento link HTML, header HTTP Link per i PDF, URL assoluti, un solo canonical per pagina e principali errori da evitare.
Italiano › ContenutiBloccato da robots.txt (stato GSC)
Che cosa significa lo stato "Bloccato da robots.txt" di Indicizzazione delle pagine in Google Search Console: un URL escluso dall’indicizzazione perché robots.txt ha vietato il crawl. Di solito è intenzionale. In che cosa differisce da "Indicizzato nonostante il blocco"; perché noindex e disallow sono in conflitto; e come correggerlo se il blocco è un errore.
Italiano › ContenutiBloccato per accesso vietato (403)
Che cosa significa lo stato "Bloccato per accesso vietato (403)" nel rapporto Indicizzazione delle pagine di Google Search Console, perché Googlebot riceve 403 mentre il tuo browser no, in che cosa differisce dal 401 e come diagnosticarlo, correggerlo e validarlo.
Italiano › ContenutiBloccato per altro problema 4xx
Che cosa significa lo stato "Bloccato per altro problema 4xx" nel rapporto Indicizzazione delle pagine di Google Search Console, quali codici 400, 405, 408, 410, 411, 413, 414, 421, 422 e 451 possono trovarsi nel gruppo, come distinguere la sfumatura del 429 e come diagnosticare, correggere e validare il codice reale.
Italiano › ContenutiBloccato per richiesta non autorizzata (401)
Che cosa significa lo stato "Bloccato per richiesta non autorizzata (401)" nel rapporto Indicizzazione delle pagine di Google Search Console, in che cosa differisce dal 403 secondo RFC 9110, quali sono le cause comuni, come diagnosticarlo come bot e qual è la correzione giusta in base al tipo di pagina: pubblica, privata, falso positivo WAF o con paywall.
Italiano › ContenutiNon trovato (404)
Cosa significa "Non trovato (404)" nel report Indicizzazione delle pagine di Google Search Console — perché Google ha trovato URL che non hai mai inviato, perché i 404 di solito non danneggiano la SEO, e il piccolo insieme di 404 che vale davvero la pena correggere.
Italiano › ContenutiURL contrassegnato 'noindex' (stato GSC)
Cosa significa lo stato "URL contrassegnato 'noindex'" di Google Search Console — e la variante "URL inviato contrassegnato 'noindex'" e il nome legacy "Escluso per tag 'noindex'". Quando è intenzionale vs. un errore, dove vive il noindex (meta tag vs. header X-Robots-Tag), il conflitto con robots.txt, il noindex fantasma/CDN, e come correggere e validare.
Italiano › ContenutiCrawling: come funziona la scansione web
Come i motori di ricerca scoprono e scaricano il web — Googlebot e Bingbot, scoperta degli URL, scheduler di scansione, rendering e differenze tra crawling, indicizzazione e ranking. L’hub per tutto ciò che riguarda il crawling.
Italiano › ContenutiCrawl budget: cos’è e come ottimizzarlo
Che cos’è davvero il crawl budget — capacità di scansione più domanda di scansione — cosa lo spreca e il test onesto per capire se il tuo sito è abbastanza grande da dovertene preoccupare.
Italiano › ContenutiCrawler IA
I tre tipi di crawler IA — bot di addestramento, indicizzatori della ricerca IA e fetcher attivati dall'utente —, i principali nomi e come controllarli senza danneggiare il SEO.
Italiano › ContenutiGooglebot: guida al crawler di Google
Che cos’è davvero Googlebot: Smartphone contro Desktop, rendering con Chromium evergreen, stringhe user-agent, verifica degli intervalli IP, limiti in byte e differenza tra crawling e ranking.
Italiano › ContenutiIl crawler Bingbot
Che cos’è Bingbot, che cosa alimenta oltre a Bing, come verificarlo con il DNS inverso e come controllarne il crawling con robots.txt, Crawl Control e IndexNow.
Italiano › ContenutiPageRank e SEO
PageRank è l'algoritmo originale di Google per l'analisi dei link: il modello del navigatore casuale, la formula, l'evoluzione Reasonable Surfer, la storia dalla barra degli strumenti alla fuga di documenti API del 2024, perché resta un sistema fondamentale di posizionamento e che cosa comporta per i link e l'architettura interna del sito.
Italiano › ContenutiReindirizzamenti JavaScript
Cos'è un reindirizzamento JavaScript, come la pipeline di rendering di Google lo tratta diversamente da un 301 lato server, quando è un'ultima risorsa accettabile, e come implementarlo e rilevarlo — oltre a dove si collocano il meta refresh e l'History API.
Italiano › ContenutiRobots.txt
Che cosa fa davvero robots.txt — controlla la scansione, non l’indicizzazione — oltre alla sintassi esatta, a come Google lo gestisce internamente e agli errori che danneggiano i siti.
Italiano › ContenutiUser Agent e SEO
Cos'è un user agent — l'header HTTP che crawler e browser usano per identificarsi, il token robots.txt rispetto alla stringa completa, e come verificare che un bot sia reale.
Italiano › ContenutiFeed RSS
Come i motori di ricerca usano i feed RSS 2,0 e Atom 1,0 come canale di scoperta per contenuti freschi: Feedfetcher, robots.txt, WebSub e perché un feed integra ma non sostituisce mai una sitemap XML.
Italiano › ContenutiGoogle Indexing API: guida
Che cosa fa davvero la Google Indexing API — supportata ufficialmente solo per pagine JobPosting e BroadcastEvent (livestream), non per i contenuti generici. I miti, ciò che dice davvero Google e che cosa usare invece per indicizzare più velocemente.
Italiano › ContenutiSitemap
Cos'è una sitemap, se ti serve, i tipi (XML, HTML, immagini, video, notizie), come trovarla, crearla e inviarla, e perché le sitemap aiutano la scoperta ma non garantiscono mai l'indicizzazione.
Italiano › ContenutiSitemap XML
Cos'è una sitemap XML, la sua anatomia, i tag ignorati (priority/changefreq), lastmod accurato, i limiti di 50 000/50MB, hreflang nelle sitemap e come inviarne una.
Italiano › ContenutiContenuto duplicato: perché si verifica e come correggerlo
Non esiste una penalità per contenuto duplicato. Scopri quali sono i costi reali, come Google raggruppa i duplicati e sceglie un canonical e come correggerli.
Italiano › ContenutiRendering e SEO
Come il Web Rendering Service di Google esegue il tuo JavaScript per costruire la pagina che indicizza — più le opzioni di rendering (CSR, SSR, SSG, hydration, ISR, edge, dynamic) e i loro compromessi SEO.
Italiano › ContenutiSitelink: cosa sono e come influenzarli
Che cosa sono i sitelink di Google, perché sono algoritmici al 100% e come influenzarli (non controllarli): lo strumento di demozione ormai scomparso, la deprecazione del Sitelinks Searchbox, i Deep Links di Bing e la differenza tra sitelink a pagamento e organici.
Italiano › ContenutiIndicizzazione mobile-first
Cos'è realmente l'indicizzazione mobile-first — come Google usa il tuo HTML mobile per l'indicizzazione e il posizionamento — e perché la parità dei contenuti è la regola fondamentale.
Italiano › ContenutiIndicizzazione
Come i motori di ricerca memorizzano e organizzano le pagine per poterle classificare: analisi dei contenuti, canonicalizzazione, motivi per cui una pagina scansionata può non essere indicizzata e lettura del report Indicizzazione delle pagine in GSC.
Italiano › ContenutiBaiduspider: guida al crawler di Baidu
Che cos’è Baiduspider: le varianti e gli user-agent del crawler di Baidu, la conformità a robots.txt (e l’eccezione cpro/ads), la verifica tramite DNS inverso, il rendering JavaScript debole e il controllo del crawling in Ziyuan.
Italiano › ContenutiIndexNow per la SEO
IndexNow è il protocollo push aperto che informa immediatamente Bing, Yandex, Naver, Seznam e Yep quando cambiano i tuoi URL: un solo invio, condiviso tra tutti. Come funziona, come configurarlo e perché non produce effetti su Google.
Italiano › ContenutiPagina alternativa con tag canonical corretto
«Pagina alternativa con tag canonical corretto» nel rapporto Indicizzazione delle pagine di Google Search Console non è un errore: è il sistema canonical che funziona come previsto. Ecco che cosa significa, perché i numeri elevati sono spesso normali, come si distingue dai due stati di duplicato e quali pochi casi meritano un controllo.