Analizzare un sito e la sua sitemap
Importa correttamente le pagine pubbliche utili senza indicizzare aree tecniche o private.
Aggiornato il 7 agosto 2026Cosa importa il crawl — e cosa deve ignorare
La fonte “Sito web completo” esplora le pagine pubbliche di un dominio per estrarne contenuti testuali utilizzabili dall’assistente. Completa l’analisi leggera dell’onboarding: quest’ultima prepara il profilo mentre il crawl costruisce una base di pagine monitorate individualmente.
Il volume autorizzato dipende dal piano e dal limite mensile di URL. Wavize scopre indirizzi, li mette in coda, li elabora in background e mostra i numeri di URL scoperte, riuscite, escluse e fallite. Una sitemap grande non annulla il limite del tuo piano.
Ambito di sicurezza
Usa solo pagine pubbliche che la tua azienda è autorizzata a sfruttare. Wavize blocca destinazioni private o rischiose e non deve bypassare connessioni, firewall o challenge anti-robot.
Creare una fonte sito completo
In Base di conoscenze, scegli Sito web completo, assegna un titolo riconoscibile e inserisci l’URL canonica.
Selezionare la radice pubblica
Preferisci https://exemple.com o la sua variante www finale. Evita URL di carrello, campagne temporanee, sottodomini privati o redirect fuori dal dominio.
Lascia attivata "Addestra ora"
La casella è selezionata di default. Ordina a Wavize di avviare la scoperta e indicizzazione subito dopo il salvataggio. Deselezionala solo se vuoi preparare la fonte senza lanciare il processo.
Attendi la coda di elaborazione
Non ricaricare in loop e non ricreare la fonte. Lo stato passa attraverso stati di coda e processo; il progresso avanza con i task in background.
Capire scoperta, sitemap e selezione
Wavize può usare sitemap e seguire link interni, mantenendo però protezioni e priorità.
Pagine ad alto valore
Homepage, servizi, categorie, prodotti, assistenza, spedizioni, resi e contatti sono generalmente prioritari. Una pagina deve contenere testo utile, non solo animazioni o blocchi caricati dopo interazione.
URL tecnici
Escludi account, login, carrello, pagamento, ricerca interna, parametri di tracciamento, anteprime e filtri infiniti. Creano duplicati o mostrano pagine senza valore per la risposta.
Quota e selezione parziale
Se la scoperta supera la capacità, concentrati sulle pagine più utili o escludi famiglie di URL. Il limite assoluto di sicurezza non garantisce che tutte le URL di un sito enorme siano importate.
Gestire le URL dopo il primo crawl
La scheda della fonte permette di cercare le pagine trovate, escluderle definitivamente, ripristinarle e rilanciare l’addestramento.
Escludere senza perdere il controllo
Un’esclusione persistente impedisce che la pagina ritorni al prossimo crawl. Nota il motivo nella tua procedura interna, soprattutto per politiche vecchie o zone giuridiche locali.
Ripristinare e riaddestrare
Ripristinare l’URL la rende nuovamente eleggibile; poi rilancia l’addestramento e attendi che sia processato prima di testare le informazioni presenti.
Leggere un errore con prudenza
La tabella tiene il totale delle pagine fallite ma non offre una diagnosi dettagliata per ogni URL. Testa la pagina pubblicamente, verifica redirect, status HTTP, firewall e contenuti prima di contattare il supporto.
Controllo qualità del crawl
Un crawl terminato è utile solo se il suo ambito corrisponde a ciò che l’assistente deve conoscere.
- Copertura — Trova nella lista le pagine commerciali e di supporto prioritarie.
- Pulizia — Nessun carrello, account o filtri di massa domina i risultati.
- Risposta testata — Una domanda riprende un dato esplicito della pagina trattata, senza aggiunte inventate.
Non hai trovato la risposta?
Il nostro team può aiutarti dal tuo spazio cliente.