DeckFlow Logo 开发者 DeckFlow 文档
开发者指南API 参考MCPCLI

提取器

提取器 API 规格和任务参数,支持图片 OCR 文本识别、PPTX 字体检测和文本提取。

API 接口

文件提取任务为异步处理。使用以下两个接口进行任务创建与结果获取。点击右侧的“调试接口”可打开交互式控制台。

POST /tools/tasks

创建一个异步提取任务。表单参数中 type 值对应相应的工具 ID。

GET /tools/tasks/:id

查询提取任务的执行状态,并在完成后通过 result.url 获取最终输出的下载链接。

请求头

请求头 类型 是否必填 描述
Authorization String 是 Bearer <YOUR_API_KEY> — 您的开发者 API 密钥。
Content-Type String 是 (POST) 必须为 multipart/form-data。

POST 请求体参数 (Form Data)

参数名 类型 是否必填 描述
files File 是 待处理的源文件。支持上传多个文件。
type String 是 任务类型标识符。例如:image.ocr。
params String (JSON) 否 包含工具特定参数的 JSON 字符串。默认为空 JSON 字符串 "{}"。
notifyURL String 否 Webhook 回调 URL,用于接收任务状态更新通知。

任务参数说明

Image OCR (图片文本识别)

提取图片中的多语言文本信息。支持 image/* 格式,文件上限 50 MB。params 参数结构如下:

{
  "language": "zh-hans" // string。识别语言。可选值: "zh-hans" (简体中文) | "zh-hant" (繁体中文) | "en" (英文) | "ja" (日文) | "ko" (韩文) | "fr" (法文) | "de" (德文) | "es" (西班牙文)
}

PPTX Font Finder (PPTX 字体查找器)

扫描并列出幻灯片中引用的所有字体列表。支持 .pptx 格式,文件上限 300 MB,params 参数结构为 {}。

PPTX Text Extractor (PPTX 文本提取器)

提取幻灯片内所有图层的文本元素,支持多维度的结构化过滤。支持 .pptx 格式,文件上限 300 MB。params 参数结构如下:

{
  "hasChildren": false,       // boolean。是否包含子图层(递归提取子级形状文字)
  "pickPages": [1, 2, 5],     // array。可选。指定提取的幻灯片页码列表(从 1 开始计数)
  "imageFilter": 0.2,         // number (范围 0~1)。可选。根据图像面积比例过滤元素
  "includeLayout": false,     // boolean。是否提取版式页面(Layout)中的文字
  "includeMaster": false,     // boolean。是否提取母版页面(Master)中的文字
  "includeNotes": false,      // boolean。是否提取备注(Notes)中的文字
  "ignoreEmptyText": true,    // boolean。是否过滤掉空白文本框
  "onlyBrief": true           // boolean。是否过滤空段落并返回简要结构以减小体积
}