模型 / 数据集
yifanfeng97/Hyper-Extract avatar
yifanfeng97/Hyper-Extract

Hyper-Extract:用一条命令把文档变成超图,但先看清它的边界

Hypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.

3,935 个 Star450 个 ForkPythonNOASSERTION

秒懂

它是什么?
Hyper-Extract 是一个把 PDF、Word、Markdown 等文档转成知识图谱、超图甚至时空图的 CLI 工具。它覆盖多种抽取模板和增量更新机制,但依赖外部 LLM,且许可证未声明,采用前需要先验证这两点。
适合谁用?
Hyper-Extract 适合需要把大量非结构化文档快速变成可查询知识结构的个人研究者、金融分析师或知识库维护者,尤其是那些已经熟悉 CLI 且愿意接受 LLM 调用成本的人。不适合对数据隐私有硬性要求且没有 GPU 的团队,因为本地 vLLM 部署需要显卡;也不适合需要精确控制抽取 schema 的场合,因为 80+ 模板虽多,但未必覆盖你的领域细节。
能商用吗?
请先确认。这个仓库使用的许可证不在我们自动归类的范围内,商用前请阅读仓库里的 LICENSE 文件。
还在维护吗?
在维护。仓库在最近一天内有新的提交。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它解决的是文档检索答非所问的问题

普通 RAG 把文档切成块,检索时按向量相似度拼凑答案,经常丢掉跨段的实体关系。Hyper-Extract 的出发点是把文本先变成图结构,再让 LLM 基于图来回答。它面向的是需要从财报、论文、法律文书里提取实体和关系的分析师、研究者或知识库管理员。README 里的例子包括把 20 页论文变成概念、作者、引用关系的交互图,或者从收益报告中识别公司、高管、财务指标。它不只是一个抽取工具,还附带查询、可视化和导出命令,形成一条从文档到知识库的流水线。

从模板到超图:一次解析发生了什么

核心命令是 `he parse`,它接受一个文档路径和一个模板名,比如 `general/biography_graph`。模板是 YAML 文件,定义了抽取的目标结构。仓库声称有 80+ 模板,覆盖金融、法律、医疗、中医、工业和通用领域。解析结果会写入你指定的输出目录,之后可以用 `he search` 查询,用 `he show` 可视化。关键机制是增量演化:同一个 source 下再次喂入更新文档,旧事实会自动回滚。这通过 `he feed` 命令实现,它需要指定 `--source` 参数来关联新旧文档。输出目录里保存的不仅是抽取结果,还有来源追踪信息,`he info --sources` 可以审计哪些文档贡献了什么。

九种结构与多种抽取引擎的选择题

Hyper-Extract 不是只有图谱一种输出。它宣称支持 9 种知识结构,从原始的 chunk 语料库、简单列表,到图、超图和时空图。超图不同于普通图,一条边可以连接多个节点,适合表达「A、B、C 共同参与了事件 D」这类多元关系。抽取引擎也有多种:`chunk_rag` 是零成本基线,不调用 LLM 做图谱构建,只做分块检索;GraphRAG、LightRAG、Hyper-RAG、KG-Gen 则是不同的图谱构建方法。这意味着用户需要根据文档类型和预算选择模板与引擎的组合。README 没有详细说明各引擎的差异,只列了名字,实际效果需要自己跑样本对比。

安装与配置:五条命令能跑通,但成本藏在后面

安装推荐用 `uv tool install hyperextract` 或 `pipx install hyperextract`。配置分两种:OpenAI 和阿里云百炼一个 key 同时提供 LLM 和 embedding,Anthropic 和 DeepSeek 只提供 LLM,需要另配一个 OpenAI 兼容的 embedding 服务。本地部署用 vLLM,需要两个端点,一个跑 LLM 一个跑 embedding,例如 `he config llm -p vllm -u http://localhost:8000/v1 -k dummy -m Qwen/Qwen3.5-9B` 和 `he config embedder -p vllm -u http://localhost:8001/v1 -k dummy -m BAAI/bge-m3`。解析命令示例是 `he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en`。文档还提供 Python API,用 `Template.create` 加 `parse` 方法,适合嵌入到自己的脚本。成本方面,README 给出 DeepSeek 大约每页 0.001 到 0.005 美元,但图谱抽取通常比普通 RAG 调用更多 token,实际费用需要按文档长度和模板复杂度估算。

增量更新与来源审计是亮点,但回滚粒度有限

`he feed` 命令允许你在同一 source 下更新文档,旧事实自动回滚,这解决了知识库与现实脱节的问题。`he remove --document` 可以按文档删除。`he tag` 给 source 打标签,`he search --tag` 可以限定范围搜索。这套机制比一次性抽取然后手工维护强得多。但要注意,回滚是基于 source 级别的,不是基于句子或事实级别的。如果你在一个 source 里改了半页内容,整个 source 的旧抽取结果可能都会被撤销重来。README 没有说明回滚的精确粒度,这是采用前需要验证的细节。对于频繁小幅更新的文档,这可能带来不必要的重复 LLM 调用。

Obsidian 导出是实用功能,但别指望完美双向同步

`he export obsidian ./output/ -o ./vault/` 能把抽取的图变成 Markdown 笔记,并用 `[[wikilinks]]` 连接。这对用 Obsidian 管理知识的用户很友好,图谱可视化可以直接在 Obsidian 里浏览。但导出是单向的,你在 Obsidian 里做的修改不会同步回 Hyper-Extract 的输出目录。如果你把 Obsidian 当作唯一知识库入口,这个限制会带来维护冲突。README 没提反向同步,所以它更适合作为展示层,而不是编辑层。

对比同类工具:GraphRAG 与 LightRAG 的差异在哪

Hyper-Extract 的独特之处是把多种抽取引擎封装在同一个 CLI 后面,并提供了模板和增量更新。而微软的 GraphRAG 和 LightRAG 是独立的图谱 RAG 库,它们各自实现了一种索引和查询方法。GraphRAG 强调社区检测和层次化摘要,适合全局性问题;LightRAG 侧重轻量级和快速索引。Hyper-Extract 更像是把这些方法变成可插拔的引擎,让用户用 `he parse` 时指定用哪个引擎。但这也意味着你被绑定在它的模板和输出格式上。如果你只需要其中一种引擎,直接用原库可能更灵活;如果你需要比较多种方法,Hyper-Extract 的一体化封装能省去大量集成工作。

维护与升级:版本节奏快,但许可证状态不明

仓库最近一次推送是 2026 年 9 月,v0.9.0 在 9 月 6 日发布,引入 Rich Document Ingestion 和 chunk_rag 基线。v0.8.2 和 v0.8.1 都在 9 月初发布,说明开发活跃,迭代快。但版本号还在 0.x,API 和命令可能有破坏性变更。文档提到安装 PDF、Word 等格式支持需要额外 `pip install "hyperextract[ingest]"`,这意味着基础包不包含所有文档解析器。许可证方面,仓库徽章显示 Apache 2.0,但 GitHub 元数据里 License 字段是 NOASSERTION,README 里也有 Apache 2.0 的徽章。这种不一致需要你打开 LICENSE 文件确认。如果许可证不明确,商业使用会有法律风险,尤其是它依赖的 LLM 提供商可能有不同的服务条款。升级成本方面,由于是 CLI 工具,重新安装新版本即可,但输出目录的格式是否向后兼容,README 没有说明。

编辑结论

Hyper-Extract 适合需要把大量非结构化文档快速变成可查询知识结构的个人研究者、金融分析师或知识库维护者,尤其是那些已经熟悉 CLI 且愿意接受 LLM 调用成本的人。不适合对数据隐私有硬性要求且没有 GPU 的团队,因为本地 vLLM 部署需要显卡;也不适合需要精确控制抽取 schema 的场合,因为 80+ 模板虽多,但未必覆盖你的领域细节。采用前务必先做三件事:确认你用的 LLM 提供商的抽取质量在你的文档类型上可接受;检查仓库 LICENSE 文件里声明的 Apache 2.0 是否与 PyPI 元数据一致,因为本仓库元数据显示 NOASSERTION;以及用 `he parse` 跑一份真实样本,对比 `chunk_rag` 零成本基线与付费图谱抽取的差异,再决定是否值得为图谱结构付费。

官方来源

  1. Issues
  2. Project website
  3. README
  4. Releases
  5. yifanfeng97/Hyper-Extract on GitHub
社区笔记

社区笔记