> ## Documentation Index
> Fetch the complete documentation index at: https://docs.fetchhive.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Extract from File

> 配置工作流步骤,从 URL 获取文件并提取行或文本供后续步骤使用

# Extract from File

当你希望工作流步骤从 Fetch Hive 内的公开文件 URL 读取结构化或文本数据时,请使用 **Extract from File**。

## 配置

| 选项                  | 是否必填  | 说明                                                          |
| ------------------- | ----- | ----------------------------------------------------------- |
| Name                | 否     | 步骤在工作流画布中的标签。                                               |
| File URL            | 是     | **File URL** 中的 URL。此字段支持通过 **Insert Variable** 使用工作流变量。    |
| File format         | 否     | 根据 URL 扩展名自动检测,或手动选择 JSON、CSV、XLSX、XLS、HTML、DOCX、PDF 或 XML。 |
| Sheet index         | 仅表格格式 | XLS 和 XLSX 文件的从零开始的工作表索引。默认为 `0`。                           |
| First row is header | 仅表格格式 | 启用后,CSV 和电子表格文件将第一行用作列名。                                    |
| When the step fails | 否     | 控制此步骤失败时工作流应 **Terminate Workflow** 还是 **Continue**。        |

从 **Search steps...** 的 **Utilities** 分组添加此步骤。

支持的格式:

| 格式            | 输出形状      |
| ------------- | --------- |
| CSV、XLSX、XLS  | 行对象数组     |
| JSON、XML      | 解析后的对象或数组 |
| HTML、DOCX、PDF | 纯文本字符串    |

表格输出会限制在你的套餐迭代上限以及平台 1,000 行的安全上限内。

## 输出

点击步骤标题中的 **Run** 来测试该步骤。运行完成后,Fetch Hive 会在 **Output** 中显示提取结果。

在后续步骤中使用变量选择器插入本次运行的确切输出路径。基础引用为:

```text theme={null}
{{STEP_IDENTIFIER.output}}
```

对于 CSV 或电子表格文件,`{{STEP_IDENTIFIER.output}}` 是一个可直接传入 **Iteration** 步骤的数组:

```text theme={null}
{{extract_contacts.output}}
```

在迭代体内,引用每一行的字段:

```text theme={null}
{{contacts_loop.item.name}}
{{contacts_loop.item.website}}
```

## 示例

从 **Utilities** 分组添加 **Extract from File**。

将 **File URL** 设置为公开 CSV,例如 `https://example.com/contacts.csv`。

将 **File format** 保持为 **Auto-detect**,并启用 **First row is header**。

添加 **Iteration** 步骤,来源为 `{{extract_contacts.output}}`。

在循环内:

1. 对 `{{contacts_loop.item.website}}` 运行 **Website Scrape**
2. 使用 **AI Prompt** 根据抓取结果编写独特的触达信息

循环结束后,使用 **Data Transform** 或 **Google Sheets** 汇总丰富后的行。

## 备注

* 请使用可直接访问的文件 URL。此步骤通过 HTTP 获取文件,不会从你的电脑上传文件。
* HTML 提取返回整页文本,而不是表格行。
* PDF 和 DOCX 提取返回适合后续 **AI Prompt** 步骤的文本。

另请参阅: [Data Transform](./data-transform)、[Creating and Editing](../../creating-and-editing)、[Testing and Iteration](../../testing-and-iteration) 和 [Error Handling](../../error-handling)
