知识工具文档
约 938 字大约 3 分钟
2026-03-27
1. 文件解析工具
从常用格式文件中精准提取文本内容与元数据,支持指定解析方式,适配不同场景下的文本提取需求。
解析策略说明
| 策略 | 解析方式 | 适用文档格式、场景 | 是否支持同步解析 |
|---|---|---|---|
| null | 默认解析策略,根据文件类型自动选择解析方式 | 通用文档格式,自动适配 | 是 |
| tika | 通过Apache Tika框架解析文档,提取文本内容和元数据 | Office文档(doc、docx、xls、xlsx、ppt、pptx)、PDF、富文本、电子书(epub、mobi等)、HTML、XML、TXT等常见格式 | 是 |
| mineru-v3 | MinerU本地版本,基于深度学习的文档智能解析 | 复杂版面的PDF文档,包含表格、公式、图片混合的文档,需要高精度还原版面结构的场景 | 否 |
| markitdown | 将各类文档转换为Markdown格式 | 需要将文档转换为Markdown格式的场景,支持多种文档格式到Markdown的转换 | 是 |
| html-to-markdown | 将HTML网页内容转换为Markdown格式 | 网页内容、HTML文件,需要将网页内容转换为Markdown格式的场景 | 是 |
| image-vl | 基于VL大模型将图片内容转换为Markdown格式 | 图片、扫描件、截图,需要提取图片中的文字、表格、图表等多模态信息的场景 | 是 |
详见:解析文档
2. 文本切片工具
将长文本按字符、句子、段落或自定义规则自动分割成符合需求的小块文本段落,方便后续处理与展示。
切片策略说明
| 策略值 | 切片原理 | 适用文本类型 |
|---|---|---|
| masked-markdown | 自研算法,基于掩码技术的智能Markdown切分:首先识别并保护表格、代码块、公式等元素不被切断,然后优先按Markdown标题层级进行切分,最后根据配置的最大长度对大块内容进行切分或对小块内容进行合并 | Markdown |
| common-text | 自研算法,根据指定的分隔符、最大长度和重叠比例,将文本分割成多个片段 | 纯文本 |
| character-spliter | 按照固定分隔符进行切分, | 纯文本 |
| recursive-character | 从优先级最高的分隔符开始尝试拆分,若片段长度小于chunk_size则保留,若片段长度大于chunk_size则取下一个优先级分隔符切分,直到用完所有分隔符。 | 纯文本 |
| markdown-header | 根据Markdown标题结构进行切分,每个标题下的内容作为一个块 | Markdown |
详见:文本分块
3. 实体、关系提取工具
从文本中精准提取知识实体及实体间的关联关系,提供可视化展示,助力知识图谱构建与知识挖掘。
- 实体提取:支持从一段文本中自动识别并提取各类知识实体(如人物、机构、地名、概念等)。
- 关系提取:在提取实体的基础上,进一步识别并提取实体之间的关联关系,梳理文本中的知识逻辑。
- 可视化展示:可视化工具,将提取的实体及关系以知识图谱的形式展示,直观呈现知识关联,支持用户交互与分析。
4. 内容抽取与结构化工具
- 关键信息提取:摘要、关键词、标题、目录、FAQ 自动生成
5. 向量化工具
依托交融嵌入模型,实现文本等内容的向量化处理,为后续语义检索、相似度计算等场景提供支持。
