Skip to main content
POST
无法抓取的资源
一次爬取中抓取失败的资源及原因。返回 total_items_countitems_countitems。实测 621 字节。读的是一次已完成的爬取,因此需要 post_dataforseo_on_page_submit 返回的 id,并会带回 crawl_progresscrawl_statusmax_crawl_pagespages_in_queuepages_crawled)——结果偏少时先看这几个字段,爬取还在跑就是本来没那么多。 这些是站长最该先看的断链;成功加载的那些在 post_dataforseo_on_page_resources。💰 上游免费:查询一次已完成的爬取不花钱,只有爬取本身花钱。本家族是整个 provider 里最便宜的。

示例

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
id
string
必填

任务 ID,必填字段;你可以从 Task POST 端点的响应中获取此 ID,例如:"07131248-1535-0216-1000-17384017ad04"

limit
integer

返回的不可抓取资源的最大数量,可选字段,默认值:100,最大值:1000

offset
integer

返回的不可抓取资源在 results 数组中的偏移量。可选字段,默认值:0。如果指定值 10,则会省略 results 数组中的前十个无效资源,并提供后续无效资源的数据。

order_by
string[]

结果排序规则;可选字段;您可以使用与 filters 数组中相同的值对结果进行排序;可用的排序类型:asc - 结果将按升序排列;desc - 结果将按降序排列;应使用逗号设置排序类型;示例:["meta.content_type,desc"];请注意,单个请求最多可设置三条排序规则;应使用逗号分隔多条排序规则;示例:["meta.content_type,asc","fetch_time,desc"]

filters
string[]

结果过滤参数数组,可选字段。可以同时添加多个过滤器(最多 8 个)。应在条件之间设置逻辑运算符 and、or。支持以下运算符:regex、not_regex、 、 、>、>=、=、 、in、not_in、like、not_like。可以将 % 运算符与 like 和 not_like 配合使用,以匹配由零个或多个字符组成的任意字符串。示例:[["meta.content_type","=","image/jpeg"], "and", ["url","not_like","%/help-center/%"]]。可通过此链接查看所有可用过滤器的完整列表。

响应

成功响应

version
string

API 的当前版本

status_code
integer

通用状态码;您可以在此处查看完整的响应码列表。注意:我们强烈建议设计必要的系统来处理相关异常或错误情况

status_message
string

常规信息消息;可在此处查看常规信息消息的完整列表

time
string

执行时间(秒)

cost
number

任务总成本(美元)

tasks_count
integer

tasks 数组中的任务数量

tasks_error
integer

返回错误的 tasks 数组中的任务数量

tasks
string[]

任务数组

tasks.id
string

任务标识符,系统中采用 UUID 格式的唯一任务标识符

tasks.status_code
integer

DataForSEO 生成的任务状态码;范围为:10000-60000;完整响应代码列表可在此处查看

tasks.status_message
string

任务的信息性消息,你可以在此处查看通用信息性消息的完整列表

tasks.time
string

执行时间(秒)

tasks.cost
number

任务成本(美元)

tasks.result_count
integer

结果数组中的元素数量

tasks.path
string[]

URL 路径

tasks.data
object

包含您在 POST 请求中指定的相同参数

tasks.result
string[]

结果数组

tasks.result.crawl_progress
string

抓取会话的状态,可能的值:in_progress、finished

tasks.result.crawl_status
object

抓取会话的详细信息

tasks.result.crawl_status.max_crawl_pages
integer

最大抓取页面数,表示设置任务时指定的 max_crawl_pages 限制

tasks.result.crawl_status.pages_in_queue
integer

当前位于抓取队列中的页面数量

tasks.result.crawl_status.pages_crawled
integer

已抓取页面数

tasks.result.total_items_count
integer

发现的不可抓取资源总数,在目标域名抓取期间发现的不可抓取资源总数

tasks.result.items_count
integer

items 数组中无法抓取的资源数量

tasks.result.items
string[]

无法抓取的资源数组

tasks.result.items.url
string

无法抓取的资源的 URL

tasks.result.items.reason
string

资源无法抓取的原因,可取以下值:content_type_inconsistency

tasks.result.items.status_code
integer

无法抓取的资源返回的 HTTP 响应代码,可能的值:200

tasks.result.items.fetch_time
string

获取资源的日期和时间,采用 UTC 格式:“yyyy-mm-dd hh-mm-ss +00:00”;示例:2026-03-09 18:20:32 +00:00

tasks.result.items.meta
object

无法抓取的资源的元数据

tasks.result.items.meta.content_type
string

资源的实际内容类型

tasks.result.items.meta.expected_content_types
string[]

资源的预期内容类型列表,即爬虫根据页面上引用资源的方式所预期的内容类型