抓取的页面
API + MCPGET/v3/site-explorer/crawled-pages
查询参数
selectstring必填
要返回的字段列表,以逗号分隔。
order_bystring
用于对结果排序的字段,可选排序方向。格式:field_name:asc 或 field_name:desc(默认 desc)。
wherestring
支持的字段:
targetstring (url)必填
搜索目标:域名或 URL。
modestring
目标对象的范围。
允许的值:exactprefixdomainsubdomains
默认:subdomains
protocolstring
目标的协议。
允许的值:bothhttphttps
默认:both
limitinteger
要返回的结果数量。
默认:1000
outputstring
输出格式。
允许的值:jsoncsvxmlphp
响应
pagesarray<object>
first_seenstring (date-time)
Ahrefs 首次发现该 URL 的时间戳。
http_codeinteger
上次抓取该页面时返回的 HTTP 状态码。
languagesarray<string>
在页面内容中检测到的语言代码,按置信度从高到低排序。等值筛选会匹配包含给定代码的页面。
last_attemptstring (date-time)
上次抓取尝试的时间戳。
last_crawledstring (date-time)
上次成功抓取的时间戳。
page_categorystring or null
以逗号分隔的页面类别,例如“/Arts_and_Entertainment,/Finance”。每个父级分组仅包含最深层的元素。使用带引号的路径进行筛选,例如 ["substring", "\"/Finance\""],以精确匹配该路径。
page_typestring or null
以逗号分隔的页面类型,例如“/Article/How_to,/Landing_Page”。每个父级分组仅包含最深层的元素。使用带引号的路径进行筛选,例如 ["substring", "\"/Article/How_to\""],以精确匹配该路径。
publish_datestring (date-time) or null
页面的发布日期,优先使用首次发布日期,而不是 HTML 中注明的日期。
titlestring or null
页面的 meta 标题。
urlstring (url)
已抓取页面的 URL。
url_ratingnumber (float)
页面在上次抓取时的 URL 评分,采用 100 分制。
errorstring
errorstring
errorstring
errorstring
errorstring