Web 数据

收集可用的公开 Web 内容及其上下文

从 URL 获取可读内容、最终目标、可见技术、类别和 URL 级别信号。

面向开发者、研究人员和智能体构建者

当产品或工作流需要结构化响应中的当前公开页面证据时,使用专用 API。

从所需输出开始

收集内容用于分析,在跟随前追踪目标,或为已知页面补充技术和类别上下文。

输入

URL域名

结果

收集评估发现丰富

选择能够回答问题的最窄产品

页面内容使用 Scrape。仅当上下文会改变决策时,才添加 Redirects、Technology Detection、Website Categorization 或 URL Intelligence。

网页抓取

以 HTML、Markdown 或文本形式获取公开网页,支持同步和异步选项。

适用场景: 需要从公开页面获取 HTML、文本或 Markdown 时选择。仅在支持且确有必要时使用渲染或异步收集。

输入
URL
结果
收集
额度
0-20
同步异步RESTMCPSDK

重定向链

追踪 URL 的完整重定向链。

适用场景: 当目标和重定向链比页面正文更重要时选择。

输入
URL, 域名
结果
收集, 评估
额度
2
同步RESTMCPSDK交互式工具

技术栈检测

检测网站使用的技术栈,包括 CMS、框架和服务。

适用场景: 需要暴露的框架、平台、分析工具或基础设施技术证据时选择。

输入
URL, 域名
结果
发现, 丰富, 评估
额度
0-9
同步批量异步RESTMCPSDK交互式工具

网站分类

按行业、内容类型和主题对网站进行分类。

适用场景: 需要用于路由、研究或审查的宽泛内容或业务类别时选择。

输入
URL, 域名
结果
丰富, 评估
额度
0-3
同步批量RESTMCPSDK交互式工具

统一 URL 情报

从 URL 提取规范化页面元数据、预览字段、结构化数据和公开身份信号。

适用场景: 在深入收集前需要规范化 URL 结构和面向风险的 URL 信号时选择。

输入
URL
结果
收集, 丰富
额度
2
同步批量RESTMCPSDK

工作流

检查 URL,以 Markdown 收集页面,然后添加智能体任务所需的类别或技术证据。

从页面到适用于智能体的上下文

检查 URL,以 Markdown 收集页面,然后添加智能体任务所需的类别或技术证据。

网站研究快照

收集代表性页面,解析最终目标,并将内容与网站类别和暴露的技术信号结合。

将一个公开页面收集为 Markdown

使用 Markdown 输出将公开 URL 提交到 POST /v1/scrape。先使用 standard 模式,页面需要 JavaScript 时再选择渲染。

请求示例
curl -X POST "https://domscan.net/v1/scrape" -H "X-API-Key: $DOMSCAN_API_KEY" -H "Content-Type: application/json" -d '{"url":"https://example.com","output":"markdown"}'
响应示例
{
  "data": {
    "url": "https://example.com",
    "outcome": "success",
    "content": "# Example Domain",
    "truncated": false
  },
  "billing": { "credits_charged": 1, "credits_refunded": 0 }
}

先使用同步模式,负载需要时再使用任务

同步抓取一个页面,或将 1 到 100 个公开 URL 提交到付费异步 Scrape 任务。Technology Detection 也支持产品专属的批处理和任务路径。

同步批量异步RESTMCPSDK交互式工具

有范围限制的公开页面收集

收集受重定向、响应大小、并发和处理模式限制。不承诺能够访问每个页面。

从一个页面开始,只添加所需上下文

查看五个 Web 数据产品,或从文档发起首次 Scrape 请求。