Skip to main content

Website Scrape

当你希望工作流步骤从网络获取页面并返回工作流所需的页面部分时,请使用 Website Scrape。

配置

URL 字段支持 Insert Variable。在其下方,设置面板允许你选择要返回的输出类型:HTML、Markdown、Links 和 Subpages。 使用 Crawl Mode 控制 Fetch Hive 检索页面的方式:
  • Preferred 首先尝试实时爬取,然后回退到缓存。
  • Always 始终使用实时爬取。
  • Fallback 首先使用缓存,然后按需爬取。
  • Never 仅使用缓存。
如果开启 Screenshot,Screenshot Type 会出现,带有 Viewport 和 Full Page 选项。

输出

点击步骤标题中的 Run 来测试步骤。运行完成后,Fetch Hive 会在 Output 中显示抓取结果。 在后续步骤中使用变量选择器插入该次运行可用的确切输出路径。基础引用为:
具体字段取决于你启用了哪些输出。例如,HTML、markdown、links、subpage 数据和与截图相关的字段只在这些输出开启时出现。在测试运行后使用变量选择器检查返回的字段。

示例

从 Search steps… 的 Research 分组中添加 Website Scrape。 将 Name 设置为类似 Scrape product page 的内容。 将页面粘贴到 URL 中。如果 URL 来自早前的工作流步骤,点击 Insert Variable 并添加该引用。 开启你需要的输出。例如,启用 Markdown 以获得干净的内容,启用 Links 以获得提取的链接,如果你希望从主页面爬取一个子页面,则启用 Subpages。 选择 Crawl Mode,然后为此次运行设置 Max Characters、Max Retries 和 Timeout (ms)。 如果你需要可视化捕获,开启 Screenshot 并在 Screenshot Type 中选择 Viewport 或 Full Page。 点击 Run 并在 Output 中查看抓取的结果,然后再将其发送到后续工作流步骤。

备注

  • 返回的结果取决于你启用了哪些输出开关,因此如果你需要确切的字段名称,请在运行后检查变量选择器。
  • 编辑器会对直接 LinkedIn URL 显示警告。不支持抓取 LinkedIn URL。
  • 当你想要更干净的页面内容时使用 Markdown,需要原始标记时使用 HTML,只需要提取的 URL 时使用 Links。
  • 当此步骤位于 Iteration 循环体内时,请将迭代步骤的 When the step fails 设为 Continue,因为有些网站会拦截抓取。抓取失败仍会停止该项;迭代上的 Continue 才会让工作流继续运行。
另见:创建和编辑、测试与迭代 和 错误处理