Soluzione per la raccolta dati

Raccogli pagine web pubbliche in una forma utilizzabile dalla tua applicazione

Scegli la modalità di raccolta sufficiente più economica, conserva le prove della destinazione e arricchisci il risultato solo quando il flusso lo richiede.

Per sviluppatori, team dati, ricercatori e costruttori di agenti

Usa questo flusso per raccolta di pagine con limiti definiti, estrazione di contenuti, input di ricerca e contesto di pagine pubbliche.

Contenuti di pagina utilizzabili con contesto di raccolta

Ricevi HTML, testo o markdown insieme alle prove della destinazione finale e dell’elaborazione per ogni richiesta supportata.

Un URL da solo non è un record affidabile del contenuto

La pagina può reindirizzare, richiedere JavaScript, superare la dimensione di risposta definita o esporre solo parte del contesto necessario all’applicazione.

La raccolta ha limiti e l’accesso non è garantito

DomScan non aggira autenticazione, paywall, controlli di accesso o restrizioni della destinazione e non promette di poter raccogliere ogni URL pubblico.

Flusso di lavoro

Ricevi HTML, testo o markdown insieme alle prove della destinazione finale e dell’elaborazione per ogni richiesta supportata.

Ispeziona e normalizza l’URL di destinazione

Usa URL Intelligence o Redirects quando prima della raccolta è necessario controllare destinazione o segnali di rischio dell’URL.

Raccogli con la modalità sufficiente più economica

Inizia con Scrape standard, scegli il comportamento di retry resiliente solo quando è utile e usa il rendering soltanto per contenuti che dipendono da JavaScript.

Aggiungi contesto strutturato quando cambia la decisione

Richiedi Website Categorization o Technology Detection dopo la raccolta quando l’attività successiva ha bisogno di questi segnali.

Raccogli un articolo pubblico in markdown

Invia l’URL dell’articolo in modalità standard, conserva l’URL finale e aggiungi prove di categoria solo se l’applicazione le utilizza.

Richiesta di esempio
curl -X POST "https://domscan.net/v1/scrape" -H "X-API-Key: $DOMSCAN_API_KEY" -H "Content-Type: application/json" -d '{"url":"https://example.com","output":"markdown"}'
Risposta di esempio
{
  "data": {
    "url": "https://example.com",
    "outcome": "success",
    "content": "# Example Domain",
    "truncated": false
  },
  "billing": { "credits_charged": 1, "credits_refunded": 0 }
}

Prodotti in questo flusso di lavoro

Ricevi HTML, testo o markdown insieme alle prove della destinazione finale e dell’elaborazione per ogni richiesta supportata.

Web Scraping

Recupera pagine web pubbliche in HTML, Markdown o testo con opzioni sincrone e asincrone.

Sceglilo quando: Recupera pagine web pubbliche in HTML, Markdown o testo con opzioni sincrone e asincrone.

Input
URL
Risultati
Raccogliere
Crediti
0-20
SincronaAsincronaRESTMCPSDK

Intelligence unificata degli URL

Estrai da un URL metadati normalizzati della pagina, campi di anteprima, dati strutturati e segnali di identità pubblici.

Sceglilo quando: Estrai da un URL metadati normalizzati della pagina, campi di anteprima, dati strutturati e segnali di identità pubblici.

Input
URL
Risultati
Raccogliere, Arricchire
Crediti
2
SincronaIn bloccoRESTMCPSDK

Categorizzazione sito web

Categorizza un sito web per settore, tipo di contenuto e argomenti.

Sceglilo quando: Categorizza un sito web per settore, tipo di contenuto e argomenti.

Input
URL, Dominio
Risultati
Arricchire, Valutare
Crediti
0-3
SincronaIn bloccoRESTMCPSDKStrumento interattivo

Batch API asincroni

Accoda più richieste API supportate e raccogli i risultati senza mantenere aperta una connessione client.

Sceglilo quando: Accoda più richieste API supportate e raccogli i risultati senza mantenere aperta una connessione client.

Input
Dominio, URL, Indirizzo email
Risultati
Automatizzare
Crediti
0
AsincronaRESTMCPSDK

Scegli questo flusso quando

Sceglilo quando

Ti servono contenuti di pagine pubbliche con limiti definiti e contesto esplicito di destinazione, modalità ed elaborazione.

Non adatto a

Non usarlo per aggirare controlli di accesso, eseguire il crawling illimitato di un sito o garantire la raccolta di ogni destinazione.

Suite di prodotti correlate

Contenuti di pagina utilizzabili con contesto di raccolta

Scegli la modalità di raccolta sufficiente più economica, conserva le prove della destinazione e arricchisci il risultato solo quando il flusso lo richiede.