Skip to main content
POST
使用 Tavily Map 生成全面的站点地图。
从根 url 列出站点的 URL 结构,不抓取任何页面正文。可用自然语言 instructions 和正则 select_paths / exclude_paths / select_domains 过滤。返回 base_urlresults —— 是一个扁平的 URL 字符串数组,不是对象数组 —— 以及 response_timerequest_id。又快又便宜,实测约 1.5 秒。用它在决定爬取之前先估算站点规模,再用 post_tavily_extract 只取需要的那部分。如果要的是内容而不是结构,post_tavily_crawl 一次调用就能同时给到。

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
url
string
必填

开始映射的根 URL。

示例:

"docs.tavily.com"

instructions
string

用于爬虫的自然语言指令。

max_depth
integer
默认值:1

映射的最大深度。

必填范围: 1 <= x <= 5
max_breadth
integer
默认值:20

树中每一层可跟踪的最大链接数量。

必填范围: 1 <= x <= 500
limit
integer
默认值:50

爬虫停止前将处理的链接总数。

必填范围: x >= 1
select_paths
string[]

用于仅选择具有特定路径模式的 URL 的正则表达式模式。

select_domains
string[]

用于选择仅抓取特定域名或子域名的正则表达式模式。

exclude_paths
string[]

用于排除具有特定路径模式的 URL 的正则表达式模式。

exclude_domains
string[]

用于从映射中排除特定域名或子域名的正则表达式模式。

allow_external
boolean
默认值:true

在最终结果列表中包含外部域名链接。

timeout
number<float>
默认值:150

等待 map 操作完成的最长时间(秒)。

必填范围: 10 <= x <= 150
include_usage
boolean
默认值:false

在响应中包含信用额度用量信息。

响应

200 - application/json

已成功返回地图结果。

base_url
string

已映射的基础 URL。

results
string[]

映射期间发现的 URL。

response_time
number<float>

完成请求所用的时间(秒)。

usage
object
request_id
string

唯一请求标识符。