Skip to content
Guida Wavize verificata

Analizzare un sito e la sua sitemap

Importa correttamente le pagine pubbliche utili senza indicizzare aree tecniche o private.

Aggiornato il 7 agosto 2026

Cosa importa il crawl — e cosa deve ignorare

La fonte “Sito web completo” esplora le pagine pubbliche di un dominio per estrarne contenuti testuali utilizzabili dall’assistente. Completa l’analisi leggera dell’onboarding: quest’ultima prepara il profilo mentre il crawl costruisce una base di pagine monitorate individualmente.

Il volume autorizzato dipende dal piano e dal limite mensile di URL. Wavize scopre indirizzi, li mette in coda, li elabora in background e mostra i numeri di URL scoperte, riuscite, escluse e fallite. Una sitemap grande non annulla il limite del tuo piano.

Ambito di sicurezza
Usa solo pagine pubbliche che la tua azienda è autorizzata a sfruttare. Wavize blocca destinazioni private o rischiose e non deve bypassare connessioni, firewall o challenge anti-robot.

Creare una fonte sito completo

In Base di conoscenze, scegli Sito web completo, assegna un titolo riconoscibile e inserisci l’URL canonica.

  1. Selezionare la radice pubblica

    Preferisci https://exemple.com o la sua variante www finale. Evita URL di carrello, campagne temporanee, sottodomini privati o redirect fuori dal dominio.

  2. Lascia attivata "Addestra ora"

    La casella è selezionata di default. Ordina a Wavize di avviare la scoperta e indicizzazione subito dopo il salvataggio. Deselezionala solo se vuoi preparare la fonte senza lanciare il processo.

  3. Attendi la coda di elaborazione

    Non ricaricare in loop e non ricreare la fonte. Lo stato passa attraverso stati di coda e processo; il progresso avanza con i task in background.

Capire scoperta, sitemap e selezione

Wavize può usare sitemap e seguire link interni, mantenendo però protezioni e priorità.

  • Pagine ad alto valore

    Homepage, servizi, categorie, prodotti, assistenza, spedizioni, resi e contatti sono generalmente prioritari. Una pagina deve contenere testo utile, non solo animazioni o blocchi caricati dopo interazione.

  • URL tecnici

    Escludi account, login, carrello, pagamento, ricerca interna, parametri di tracciamento, anteprime e filtri infiniti. Creano duplicati o mostrano pagine senza valore per la risposta.

  • Quota e selezione parziale

    Se la scoperta supera la capacità, concentrati sulle pagine più utili o escludi famiglie di URL. Il limite assoluto di sicurezza non garantisce che tutte le URL di un sito enorme siano importate.

Gestire le URL dopo il primo crawl

La scheda della fonte permette di cercare le pagine trovate, escluderle definitivamente, ripristinarle e rilanciare l’addestramento.

  1. Escludere senza perdere il controllo

    Un’esclusione persistente impedisce che la pagina ritorni al prossimo crawl. Nota il motivo nella tua procedura interna, soprattutto per politiche vecchie o zone giuridiche locali.

  2. Ripristinare e riaddestrare

    Ripristinare l’URL la rende nuovamente eleggibile; poi rilancia l’addestramento e attendi che sia processato prima di testare le informazioni presenti.

  3. Leggere un errore con prudenza

    La tabella tiene il totale delle pagine fallite ma non offre una diagnosi dettagliata per ogni URL. Testa la pagina pubblicamente, verifica redirect, status HTTP, firewall e contenuti prima di contattare il supporto.


Controllo qualità del crawl

Un crawl terminato è utile solo se il suo ambito corrisponde a ciò che l’assistente deve conoscere.

  • Copertura — Trova nella lista le pagine commerciali e di supporto prioritarie.
  • Pulizia — Nessun carrello, account o filtri di massa domina i risultati.
  • Risposta testata — Una domanda riprende un dato esplicito della pagina trattata, senza aggiunte inventate.

Non hai trovato la risposta?

Il nostro team può aiutarti dal tuo spazio cliente.

Contatta il supporto