Skip to main content
POST
OnPage API 不可索引页面
爬取到但搜索引擎不会收录的页面,每条含 reasonurl。实测 588 字节。读的是一次已完成的爬取,因此需要 post_dataforseo_on_page_submit 返回的 id,并会带回 crawl_progresscrawl_statusmax_crawl_pagespages_in_queuepages_crawled)——结果偏少时先看这几个字段,爬取还在跑就是本来没那么多。 reason 才是重点——noindex、canonical 指向别处、被 robots 挡住,症状一样但完全是三个问题。💰 上游免费:查询一次已完成的爬取不花钱,只有爬取本身花钱。本家族是整个 provider 里最便宜的。

示例

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
id
string
必填

任务 ID,必填字段;您可以从 Task POST 端点的响应中获取此 ID。示例:“07131248-1535-0216-1000-17384017ad04”

limit
integer

返回页面的最大数量,可选字段,默认值:100,最大值:1000

offset
integer

返回的页面在结果数组中的偏移量。可选字段。默认值:0。如果指定值 10,结果数组中的前十个页面将被忽略,并提供后续页面的数据

filters
string[]

结果筛选参数数组。可选字段。你可以同时添加多个筛选条件(最多 8 个)。应在条件之间设置逻辑运算符 and、or。支持以下运算符:regex、not_regex、 、 、>、>=、=、 、in、not_in、like、not_like。你可以将 % 运算符与 like 和 not_like 搭配使用,以匹配包含零个或多个字符的任意字符串。示例:["reason","=","robots_txt"][["reason","","robots_txt"], "and", ["url","not_like","%/wp-admin/%"]] [["url","not_like","%/wp-admin/%"], "and", [["reason","","meta_tag"],"or",["reason","","http_header"]]] 可通过此链接查看所有可用筛选条件。

响应

成功响应

version
string

API 的当前版本

status_code
integer

通用状态码;您可以在此处查看完整的响应码列表。注意:我们强烈建议设计必要的系统来处理相关异常或错误情况

status_message
string

常规信息消息;可在此处查看常规信息消息的完整列表

time
string

执行时间(秒)

cost
number

任务总成本(美元)

tasks_count
integer

tasks 数组中的任务数量

tasks_error
integer

返回错误的 tasks 数组中的任务数量

tasks
string[]

任务数组

tasks.id
string

任务标识符,系统中采用 UUID 格式的唯一任务标识符

tasks.status_code
integer

DataForSEO 生成的任务状态码;范围为:10000-60000;完整响应代码列表可在此处查看

tasks.status_message
string

任务的信息性消息,你可以在此处查看通用信息性消息的完整列表

tasks.time
string

执行时间(秒)

tasks.cost
number

任务成本(美元)

tasks.result_count
integer

结果数组中的元素数量

tasks.path
string[]

URL 路径

tasks.data
object

包含您在 POST 请求中指定的相同参数

tasks.result
string[]

结果数组

tasks.result.crawl_progress
string

抓取会话的状态,可能的值:in_progress、finished

tasks.result.crawl_status
object

抓取会话的详细信息

tasks.result.crawl_status.max_crawl_pages
integer

最大抓取页面数,表示设置任务时指定的 max_crawl_pages 限制

tasks.result.crawl_status.pages_in_queue
integer

当前位于抓取队列中的页面数量

tasks.result.crawl_status.pages_crawled
integer

已抓取页面数

tasks.result.total_items_count
integer

数据库中相关项目的总数

tasks.result.items_count
integer

results 数组中的项目数量

tasks.result.items
string[]

items 数组

tasks.result.reason
string

页面不可编入索引的原因,可以采用以下值:robots_txt, meta_tag, http_header, attribute, too_many_redirects

tasks.result.url
string

不可索引页面的 url