Skip to main content
POST
链接
一次爬取中发现的全部链接。用 page_from / page_to 筛出某个页面的出链或入链。返回 total_items_countitems_countitems,以及用于翻页的 search_after_token——翻过前几页后请用它而不是 offset。单条实测 1.0 KB。读的是一次已完成的爬取,因此需要 post_dataforseo_on_page_submit 返回的 id,并会带回 crawl_progresscrawl_statusmax_crawl_pagespages_in_queuepages_crawled)——结果偏少时先看这几个字段,爬取还在跑就是本来没那么多。 💰 上游免费:查询一次已完成的爬取不花钱,只有爬取本身花钱。本家族是整个 provider 里最便宜的。

示例

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
id
string
必填

任务 ID,必填字段;您可以从 Task POST 端点的响应中获取此 ID。示例:“07131248-1535-0216-1000-17384017ad04”

page_from
string

相对页面 URL。可选字段;如果使用此字段,API 响应将仅包含指定页面中的链接。请注意,此字段只能指定相对 URL。

page_to
string

相对页面 URL,可选字段。如果使用此字段,API 响应将仅包含指向指定页面的内部链接。请注意,此字段中只能指定相对 URL

limit
integer

返回链接的最大数量,可选字段,默认值:100,最大值:1000

offset
integer

返回链接的 results 数组中的偏移量。可选字段,默认值:0。如果指定值 10,results 数组中的前十个链接将被省略,并提供后续链接的数据

filters
string[]

结果过滤参数数组,可选字段。你可以同时添加多个过滤条件(最多 8 个)。应在条件之间设置逻辑运算符 and、or。支持以下运算符:regex、not_regex、=、 、in、not_in、like、not_like。你可以将 % 运算符与 like 和 not_like 配合使用,以匹配包含零个或多个字符的任意字符串。示例:["direction","=","external"] [["domain_to","","example.com"], "and", ["link_from","not_like","%example.com/blog%"]] [["direction","=","external"], "and", [["link_from","like","%example.com/blog%"],"or",["link_from","like","%example.com/help%"]]] 可通过此链接查看所有可用过滤条件。

search_after_token
string

用于后续请求的 token;可选字段;每个请求的响应中都会在同名字段中提供;尝试通过单次请求获取超过 20,000 条结果时,请使用此参数以避免超时;通过指定响应数组中的唯一 search_after_token 值,您将获得初始任务的后续结果;每个后续任务的 search_after_token 值都是唯一的;注意:如果请求中指定了 search_after_token,则所有其他参数都应与上一个请求保持一致

tag
string

用户定义的任务标识符。可选字段。字符数限制为 255。您可以使用此参数标识任务并将其与结果匹配;您将在响应的 data 对象中找到指定的 tag 值

响应

成功响应

version
string

API 的当前版本

status_code
integer

通用状态码;您可以在此处查看完整的响应码列表。注意:我们强烈建议设计必要的系统来处理相关异常或错误情况

status_message
string

常规信息消息;可在此处查看常规信息消息的完整列表

time
string

执行时间(秒)

cost
number

任务总成本(美元)

tasks_count
integer

tasks 数组中的任务数量

tasks_error
integer

返回错误的 tasks 数组中的任务数量

tasks
string[]

任务数组

tasks.id
string

任务标识符,系统中采用 UUID 格式的唯一任务标识符

tasks.status_code
integer

DataForSEO 生成的任务状态码;范围为:10000-60000;完整响应代码列表可在此处查看

tasks.status_message
string

任务的信息性消息,你可以在此处查看通用信息性消息的完整列表

tasks.time
string

执行时间(秒)

tasks.cost
number

任务成本(美元)

tasks.result_count
integer

结果数组中的元素数量

tasks.path
string[]

URL 路径

tasks.data
object

包含您在 POST 请求中指定的相同参数

tasks.result
string[]

结果数组

tasks.result.crawl_progress
string

抓取会话的状态,可能的值:in_progress、finished

tasks.result.crawl_status
object

抓取会话的详细信息

tasks.result.crawl_status.max_crawl_pages
integer

最大抓取页面数,表示设置任务时指定的 max_crawl_pages 限制

tasks.result.crawl_status.pages_in_queue
integer

当前位于抓取队列中的页面数量

tasks.result.crawl_status.pages_crawled
integer

已抓取页面数

tasks.result.total_items_count
integer

数据库中相关项目的总数

tasks.result.items_count
integer

results 数组中的项目数量

tasks.result.items
string[]

items 数组

tasks.result.items.type
string

链接类型 = ‘redirect’,状态码为 3xx 的 HTTP 重定向

tasks.result.items.domain_from
string

在此域名上发现该链接的引用域名

tasks.result.items.domain_to
string

链接所指向的引用域名

tasks.result.items.page_from
string

发现该链接的引用页面的相对 URL

tasks.result.items.page_to
string

链接所指向页面的相对 URL

发现该链接的引用页面的绝对 URL

引用页面,即链接所指向页面的绝对 URL

添加到外部链接的链接属性,表示在 page_from 页面上添加到 link_to 的链接属性 ["ugc","noopener"]

tasks.result.items.dofollow
boolean

指示链接是否为 dofollow;如果值为 true,则链接没有 rel="nofollow" 属性

tasks.result.items.page_from_scheme
string

引用页面的 URL 协议

tasks.result.items.page_to_scheme
string

引用页面的 URL 协议

tasks.result.items.direction
string

链接方向,可选值:internal、external

tasks.result.items.is_broken
boolean

链接是否失效,表示链接是否指向已损坏的页面或资源

tasks.result.items.text
string

图片文本

表示该链接是否可能与其他链接存在冲突。如果为 true,则至少有一个指向 link_to 的链接具有 rel="nofollow" 属性,并且至少有一个是 dofollow

tasks.result.items.page_to_status_code
integer

引用页面的状态码,即链接所指向页面的状态码

tasks.result.items.image_alt
string

图像的替代文本

tasks.result.items.image_src
string

图片的 URL

tasks.result.items.is_valid_hreflang
boolean

hreflang 有效性状态表示 hreflang 属性是否正确实现

tasks.result.items.hreflang
string

hreflang 属性值,即 hreflang 属性中指定的语言和可选国家/地区代码,示例:"en-US"、"fr"