Website Scrape
当你希望工作流步骤从网络获取页面并返回工作流所需的页面部分时,请使用 Website Scrape。配置
URL 字段支持 Insert Variable。在其下方,设置面板允许你选择要返回的输出类型:HTML、Markdown、Links 和 Subpages。
使用 Crawl Mode 控制 Fetch Hive 检索页面的方式:
- Preferred 首先尝试实时爬取,然后回退到缓存。
- Always 始终使用实时爬取。
- Fallback 首先使用缓存,然后按需爬取。
- Never 仅使用缓存。
输出
点击步骤标题中的 Run 来测试步骤。运行完成后,Fetch Hive 会在 Output 中显示抓取结果。 在后续步骤中使用变量选择器插入该次运行可用的确切输出路径。基础引用为:示例
从 Search steps… 的 Research 分组中添加 Website Scrape。 将 Name 设置为类似Scrape product page 的内容。
将页面粘贴到 URL 中。如果 URL 来自早前的工作流步骤,点击 Insert Variable 并添加该引用。
开启你需要的输出。例如,启用 Markdown 以获得干净的内容,启用 Links 以获得提取的链接,如果你希望从主页面爬取一个子页面,则启用 Subpages。
选择 Crawl Mode,然后为此次运行设置 Max Characters、Max Retries 和 Timeout (ms)。
如果你需要可视化捕获,开启 Screenshot 并在 Screenshot Type 中选择 Viewport 或 Full Page。
点击 Run 并在 Output 中查看抓取的结果,然后再将其发送到后续工作流步骤。
备注
- 返回的结果取决于你启用了哪些输出开关,因此如果你需要确切的字段名称,请在运行后检查变量选择器。
- 编辑器会对直接 LinkedIn URL 显示警告。不支持抓取 LinkedIn URL。
- 当你想要更干净的页面内容时使用 Markdown,需要原始标记时使用 HTML,只需要提取的 URL 时使用 Links。

