Lösning för datainsamling

Samla in offentliga webbsidor i ett format som din applikation kan använda

Välj det lägsta tillräckliga insamlingsläget, bevara destinationsbevis och berika bara resultatet när arbetsflödet behöver det.

För utvecklare, datateam, analytiker och agentbyggare

Använd detta arbetsflöde för avgränsad sidinsamling, innehållsextraktion, researchindata och kontext från offentliga sidor.

Användbart sidinnehåll med insamlingskontext

Ta emot HTML, text eller Markdown plus bevis för slutlig destination och bearbetning för varje stödd förfrågan.

En URL ensam är inte en tillförlitlig innehållspost

Sidan kan omdirigera, kräva JavaScript, överskrida en avgränsad svarsstorlek eller bara visa en del av den kontext din applikation behöver.

Insamlingen är avgränsad och åtkomst garanteras inte

DomScan kringgår inte autentisering, betalväggar, åtkomstkontroller eller målbegränsningar och lovar inte att varje offentlig URL kan samlas in.

Arbetsflöde

Ta emot HTML, text eller Markdown plus bevis för slutlig destination och bearbetning för varje stödd förfrågan.

Inspektera och normalisera mål-URL:en

Använd URL Intelligence eller Redirects när destinations- eller URL-risksignaler bör kontrolleras före insamlingen.

Samla in med det lägsta tillräckliga läget

Börja med standard-Scrape, välj motståndskraftig återförsökslogik bara när den är användbar och använd rendering endast för JavaScript-beroende innehåll.

Lägg till strukturerad kontext där den ändrar beslutet

Begär Website Categorization eller Technology Detection efter insamlingen när den efterföljande uppgiften behöver signalerna.

Samla in en offentlig artikel som Markdown

Skicka artikelns URL i standardläge, bevara den slutliga URL:en och lägg till kategoribevis endast om applikationen använder det.

Exempelbegäran
curl -X POST "https://domscan.net/v1/scrape" -H "X-API-Key: $DOMSCAN_API_KEY" -H "Content-Type: application/json" -d '{"url":"https://example.com","output":"markdown"}'
Exempelsvar
{
  "data": {
    "url": "https://example.com",
    "outcome": "success",
    "content": "# Example Domain",
    "truncated": false
  },
  "billing": { "credits_charged": 1, "credits_refunded": 0 }
}

Produkter i detta arbetsflöde

Ta emot HTML, text eller Markdown plus bevis för slutlig destination och bearbetning för varje stödd förfrågan.

Webbskrapning

Hämta offentliga webbsidor som HTML, Markdown eller text med synkrona och asynkrona alternativ.

Välj detta när: Hämta offentliga webbsidor som HTML, Markdown eller text med synkrona och asynkrona alternativ.

Indata
URL
Resultat
Samla in
Krediter
0-20
SynkronAsynkronRESTMCPSDK

Samlad URL-intelligens

Hämta normaliserade sidmetadata, förhandsvisningsfält, strukturerade data och offentliga identitetssignaler från en URL.

Välj detta när: Hämta normaliserade sidmetadata, förhandsvisningsfält, strukturerade data och offentliga identitetssignaler från en URL.

Indata
URL
Resultat
Samla in, Berika
Krediter
2
SynkronMasskörningRESTMCPSDK

Webbkategorisering

Kategorisera en webbplats per industri, innehållstyp och ämnen.

Välj detta när: Kategorisera en webbplats per industri, innehållstyp och ämnen.

Indata
URL, Domän
Resultat
Berika, Bedöm
Krediter
0-3
SynkronMasskörningRESTMCPSDKInteraktivt verktyg

Asynkrona API-batchar

Köa många API-begäranden som stöds och samla in resultaten utan att hålla en klientanslutning öppen.

Välj detta när: Köa många API-begäranden som stöds och samla in resultaten utan att hålla en klientanslutning öppen.

Indata
Domän, URL, E-postadress
Resultat
Automatisera
Krediter
0
AsynkronRESTMCPSDK

Välj detta arbetsflöde när

Välj detta när

Du behöver avgränsat innehåll från offentliga sidor med tydlig destinations-, läges- och bearbetningskontext.

Inte för

Använd det inte för att kringgå åtkomstkontroller, crawla en obegränsad webbplats eller garantera insamling av varje mål.

Relaterade produktpaket

Användbart sidinnehåll med insamlingskontext

Välj det lägsta tillräckliga insamlingsläget, bevara destinationsbevis och berika bara resultatet när arbetsflödet behöver det.