Для разработчиков, команд данных, исследователей и создателей агентов
Используйте этот процесс для ограниченного сбора страниц, извлечения контента, исследовательских входных данных и контекста публичных страниц.
Выбирайте минимальный достаточный режим сбора, сохраняйте данные назначения и обогащайте результат только при необходимости процесса.
Используйте этот процесс для ограниченного сбора страниц, извлечения контента, исследовательских входных данных и контекста публичных страниц.
Получайте HTML, текст или Markdown, а также данные конечного назначения и обработки для каждого поддерживаемого запроса.
Страница может перенаправить, потребовать JavaScript, превысить ограниченный размер ответа или открыть только часть нужного приложению контекста.
DomScan не обходит аутентификацию, paywall, контроль доступа или ограничения цели и не обещает сбор каждого публичного URL.
Получайте HTML, текст или Markdown, а также данные конечного назначения и обработки для каждого поддерживаемого запроса.
Используйте URL Intelligence или Redirects, если до сбора нужно проверить назначение или сигналы риска URL.
Начните со стандартного Scrape, включайте устойчивые повторы только при пользе и используйте рендеринг только для контента, зависящего от JavaScript.
Запросите Website Categorization или Technology Detection после сбора, если дальнейшей задаче нужны эти сигналы.
Отправьте URL статьи в стандартном режиме, сохраните конечный URL и добавьте данные категории только при использовании их приложением.
curl -X POST "https://domscan.net/v1/scrape" -H "X-API-Key: $DOMSCAN_API_KEY" -H "Content-Type: application/json" -d '{"url":"https://example.com","output":"markdown"}'
{
"data": {
"url": "https://example.com",
"outcome": "success",
"content": "# Example Domain",
"truncated": false
},
"billing": { "credits_charged": 1, "credits_refunded": 0 }
}
Получайте HTML, текст или Markdown, а также данные конечного назначения и обработки для каждого поддерживаемого запроса.
Получайте общедоступные веб-страницы в формате HTML, Markdown или текста с синхронным и асинхронным режимами.
Выбирайте, если: Получайте общедоступные веб-страницы в формате HTML, Markdown или текста с синхронным и асинхронным режимами.
Извлекайте из URL нормализованные метаданные страницы, поля предпросмотра, структурированные данные и сигналы публичной идентичности.
Выбирайте, если: Извлекайте из URL нормализованные метаданные страницы, поля предпросмотра, структурированные данные и сигналы публичной идентичности.
Категоризируйте веб-сайт по отраслям, типу контента и темам.
Выбирайте, если: Категоризируйте веб-сайт по отраслям, типу контента и темам.
Ставьте в очередь множество поддерживаемых запросов API и получайте результаты, не удерживая клиентское соединение открытым.
Выбирайте, если: Ставьте в очередь множество поддерживаемых запросов API и получайте результаты, не удерживая клиентское соединение открытым.
Нужен ограниченный публичный контент с явным контекстом назначения, режима и обработки.
Не используйте для обхода контроля доступа, неограниченного сканирования сайта или гарантии сбора каждой цели.
Выбирайте минимальный достаточный режим сбора, сохраняйте данные назначения и обогащайте результат только при необходимости процесса.