開発者、データチーム、調査担当者、エージェント開発者向け
範囲を限定したページ収集、コンテンツ抽出、調査入力、公開ページのコンテキストに使います。
十分な最小限の収集モードを選び、遷移先の証拠を保持し、ワークフローが必要とするときだけ結果を補足します。
範囲を限定したページ収集、コンテンツ抽出、調査入力、公開ページのコンテキストに使います。
対応する各リクエストについて、HTML、テキスト、Markdownと最終遷移先、処理の証拠を受け取ります。
ページはリダイレクト、JavaScript要求、応答サイズ超過、必要なコンテキストの一部だけを示す場合があります。
DomScanは認証、ペイウォール、アクセス制御、対象の制限を回避せず、すべての公開URLを収集できるとは約束しません。
対応する各リクエストについて、HTML、テキスト、Markdownと最終遷移先、処理の証拠を受け取ります。
収集前に遷移先やURLリスクを確認する必要があるときは、URL IntelligenceまたはRedirectsを使います。
standard Scrapeから始め、有用な場合だけ堅牢な再試行を選び、JavaScript依存コンテンツにのみレンダリングを使います。
後続タスクが必要とするとき、収集後にWebsite CategorizationまたはTechnology Detectionを要求します。
記事URLをstandardモードで送信し、最終URLを保持して、アプリケーションが使う場合だけカテゴリ証拠を加えます。
curl -X POST "https://domscan.net/v1/scrape" -H "X-API-Key: $DOMSCAN_API_KEY" -H "Content-Type: application/json" -d '{"url":"https://example.com","output":"markdown"}'
{
"data": {
"url": "https://example.com",
"outcome": "success",
"content": "# Example Domain",
"truncated": false
},
"billing": { "credits_charged": 1, "credits_refunded": 0 }
}
対応する各リクエストについて、HTML、テキスト、Markdownと最終遷移先、処理の証拠を受け取ります。
公開ウェブページをHTML、Markdown、またはテキストとして取得します。同期と非同期のオプションに対応しています。
この製品を選ぶ場面: 公開ウェブページをHTML、Markdown、またはテキストとして取得します。同期と非同期のオプションに対応しています。
URL から、正規化したページメタデータ、プレビュー項目、構造化データ、公開アイデンティティシグナルを抽出します。
この製品を選ぶ場面: URL から、正規化したページメタデータ、プレビュー項目、構造化データ、公開アイデンティティシグナルを抽出します。
業界、コンテンツタイプ、トピックごとにウェブサイトを分類します。
この製品を選ぶ場面: 業界、コンテンツタイプ、トピックごとにウェブサイトを分類します。
対応する多数の API リクエストをキューに追加し、クライアント接続を開いたままにせず結果を取得できます。
この製品を選ぶ場面: 対応する多数の API リクエストをキューに追加し、クライアント接続を開いたままにせず結果を取得できます。
遷移先、モード、処理コンテキストが明示された範囲限定の公開ページコンテンツが必要なとき。
アクセス制御の回避、無制限サイトクロール、すべての対象収集の保証には使わないでください。