Skip to main content
POST
使用 Tavily Extract 从指定 URL 提取网页内容。
取回你已经拿到的 URL 的干净正文 —— 来自搜索结果、站点地图或用户输入。urls 必填,可一次传多个。返回 results[],含 urltitleraw_contentimages,另有一个 failed_results[] 数组 —— 这个一定要读,取不到的页面会被记在那里,而不是抛错。可选 format(markdown 或 text)与 extract_depth。实测取 1 个页面约 1 秒。只要页面能点得出名字,就用它而不是 post_tavily_search —— 为已知页面去搜索既贵又未必搜得到。如果是一长串 URL 且不急,post_firecrawl_batch_scrape 会作为后台任务跑完。想先摸清整站有哪些 URL,用 post_tavily_map

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
urls
必填

要从中提取内容的 URL。支持单个 URL 字符串和 URL 字符串数组。

示例:
query
string

用于对提取的内容块进行重新排序的用户意图。

chunks_per_source
integer
默认值:3

每个来源返回的相关内容块的最大数量。仅在提供 query 时可用。

必填范围: 1 <= x <= 5
extract_depth
enum<string>
默认值:basic

提取过程的深度。

可用选项:
basic,
advanced
include_images
boolean
默认值:false

包含从 URL 中提取的图片列表。

include_favicon
boolean
默认值:false

为每个结果包含 favicon URL。

format
enum<string>
默认值:markdown

提取的网页内容格式。

可用选项:
markdown,
text
timeout
number<float>

等待 URL 提取的最长时间(秒)。如果省略,默认超时时间取决于 extract_depth:basic 为 10 秒,advanced 为 30 秒。

必填范围: 1 <= x <= 60
include_usage
boolean
默认值:false

在响应中包含信用额度用量信息。

响应

200 - application/json

已成功返回提取结果。

results
object[]
failed_results
string[]

无法处理的 URL 列表。

response_time
number<float>

完成请求所用的时间(秒)。

usage
object
request_id
string

唯一请求标识符。