Pour les développeurs, équipes data, chercheurs et concepteurs d’agents
Utilisez ce flux pour la collecte encadrée de pages, l’extraction de contenu, les données de recherche et le contexte de pages publiques.
Choisissez le mode de collecte suffisant le plus léger, conservez les éléments de preuve de destination et enrichissez le résultat uniquement lorsque le flux en a besoin.
Utilisez ce flux pour la collecte encadrée de pages, l’extraction de contenu, les données de recherche et le contexte de pages publiques.
Recevez du HTML, du texte ou du Markdown, ainsi que les éléments de preuve de destination finale et de traitement pour chaque requête prise en charge.
La page peut rediriger, nécessiter JavaScript, dépasser la taille de réponse encadrée ou n’exposer qu’une partie du contexte requis par votre application.
DomScan ne contourne ni l’authentification, ni les paywalls, ni les contrôles d’accès, ni les restrictions de la cible, et ne promet pas de collecter chaque URL publique.
Recevez du HTML, du texte ou du Markdown, ainsi que les éléments de preuve de destination finale et de traitement pour chaque requête prise en charge.
Utilisez URL Intelligence ou Redirects lorsque la destination ou les signaux de risque de l’URL doivent être contrôlés avant la collecte.
Commencez avec Scrape en mode standard, choisissez un comportement de nouvelle tentative résilient uniquement lorsqu’il est utile et utilisez le rendu seulement pour le contenu dépendant de JavaScript.
Demandez Website Categorization ou Technology Detection après la collecte lorsque la tâche en aval a besoin de ces signaux.
Soumettez l’URL de l’article en mode standard, conservez l’URL finale et ajoutez les éléments de catégorie uniquement si l’application les utilise.
curl -X POST "https://domscan.net/v1/scrape" -H "X-API-Key: $DOMSCAN_API_KEY" -H "Content-Type: application/json" -d '{"url":"https://example.com","output":"markdown"}'
{
"data": {
"url": "https://example.com",
"outcome": "success",
"content": "# Example Domain",
"truncated": false
},
"billing": { "credits_charged": 1, "credits_refunded": 0 }
}
Recevez du HTML, du texte ou du Markdown, ainsi que les éléments de preuve de destination finale et de traitement pour chaque requête prise en charge.
Récupérez des pages web publiques au format HTML, Markdown ou texte, avec des options synchrones et asynchrones.
À choisir lorsque: Récupérez des pages web publiques au format HTML, Markdown ou texte, avec des options synchrones et asynchrones.
Extrayez d’une URL les métadonnées de page normalisées, les champs d’aperçu, les données structurées et les signaux d’identité publics.
À choisir lorsque: Extrayez d’une URL les métadonnées de page normalisées, les champs d’aperçu, les données structurées et les signaux d’identité publics.
Catégorisez un site web par industrie, type de contenu et sujets.
À choisir lorsque: Catégorisez un site web par industrie, type de contenu et sujets.
Placez plusieurs requêtes API compatibles en file d’attente et récupérez leurs résultats sans maintenir une connexion cliente ouverte.
À choisir lorsque: Placez plusieurs requêtes API compatibles en file d’attente et récupérez leurs résultats sans maintenir une connexion cliente ouverte.
Vous avez besoin de contenu public encadré avec un contexte explicite de destination, de mode et de traitement.
Ne l’utilisez pas pour contourner des contrôles d’accès, explorer un site sans limite ou garantir la collecte de chaque cible.
Choisissez le mode de collecte suffisant le plus léger, conservez les éléments de preuve de destination et enrichissez le résultat uniquement lorsque le flux en a besoin.