OnPage API 原始 HTML
原始 HTML
OnPage API 原始 HTML
某个已爬取 url 存下来的 HTML。
POST
OnPage API 原始 HTML
某个已爬取
url 存下来的 HTML。小页面实测 578 字节。读的是一次已完成的爬取,因此需要 post_dataforseo_on_page_submit 返回的 id,并会带回 crawl_progress 和 crawl_status(max_crawl_pages、pages_in_queue、pages_crawled)——结果偏少时先看这几个字段,爬取还在跑就是本来没那么多。 ⚠️ 只有 submit 时开了 store_raw_html 才有内容,而且爬取完成后无法补救。要解析后的内容而不是源码,用 post_dataforseo_on_page_content_parsing。💰 上游免费:查询一次已完成的爬取不花钱,只有爬取本身花钱。本家族是整个 provider 里最便宜的。
示例
授权
Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
请求体
application/json
响应
成功响应
API 的当前版本
通用状态码;您可以在此处查看完整的响应码列表。注意:我们强烈建议设计必要的系统来处理相关异常或错误情况
常规信息消息;可在此处查看常规信息消息的完整列表
执行时间(秒)
任务总成本(美元)
tasks 数组中的任务数量
返回错误的 tasks 数组中的任务数量
任务数组
任务标识符,系统中采用 UUID 格式的唯一任务标识符
DataForSEO 生成的任务状态码;范围为:10000-60000;完整响应代码列表可在此处查看
任务的信息性消息,你可以在此处查看通用信息性消息的完整列表
执行时间(秒)
任务成本(美元)
结果数组中的元素数量
URL 路径
包含您在 POST 请求中指定的相同参数
结果数组
抓取会话的状态,可能的值:in_progress、finished
抓取会话的详细信息
最大抓取页面数,表示设置任务时指定的 max_crawl_pages 限制
当前位于抓取队列中的页面数量
已抓取页面数
results 数组中的项目数量
items 对象
HTML 页面