开源项目
Zeyi-Lin/HivisionIDPhotos avatar
Zeyi-Lin/HivisionIDPhotos

HivisionIDPhotos:用 CPU 就能跑的证件照生成流水线

HivisionIDPhotos:一款轻量高效的AI证件照工具。人工智能 。

21,528 个 Star2,497 个 ForkPythonApache-2.0

秒懂

它是什么?
HivisionIDPhotos 是一套把抠图、换底色、排版整合在一起的证件照生成工具,主打轻量级离线推理。本文拆解它的模型组合、API 部署方式和实际边界,帮你判断它是否值得接入。
适合谁用?
HivisionIDPhotos 适合需要快速生成标准证件照的个人用户、中小型应用开发者,以及想离线处理敏感照片的机构。它不适合追求高精度分割、需要复杂美颜或正装替换的场景,那些需求得靠外部服务或更重的模型。
能商用吗?
可以。Apache-2.0 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 75 天前。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它解决的是证件照制作的最后一公里

证件照看似简单,实际涉及抠图、换底色、裁剪、排版多个环节。传统做法是用 Photoshop 手动处理,或者依赖线下照相馆。HivisionIDPhotos 把这一串操作封装成一条 AI 流水线,输入一张普通照片,输出符合规格的证件照和排版图。它面向三类人:需要应急证件照的普通用户,想在应用里集成证件照功能的开发者,以及有离线处理需求的机构。项目强调纯离线推理,CPU 就能跑,这对隐私敏感场景很有吸引力。

模型组合是核心,也是性能分水岭

HivisionIDPhotos 的架构分两层:人像抠图模型和人脸检测模型。抠图模型可选 MODNet、hivision_modnet、rmbg-1.4 和 birefnet-v1-lite,人脸检测默认用 MTCNN,可换成 RetinaFace 或 Face++ 在线 API。不同组合的代价差异极大。README 给出的性能参考显示,MODNet 加 MTCNN 在 Mac M1 Max 上推理只需 0.207 秒,内存占用 410MB;换成 birefnet-v1-lite 加 RetinaFace,推理时间跳到 7 秒以上,内存飙到 6.2GB。这不是简单的精度和速度权衡,而是决定了你能否在低配机器上跑起来。默认的轻量组合足够应付纯色背景的简单场景,但复杂背景下的分割精度会明显不足。

从克隆到出图,三步走

部署流程很直接。先克隆仓库,然后装依赖,两条 pip 命令搞定:pip install -r requirements.txt 和 pip install -r requirements-app.txt。接着下载模型权重,可以执行 python scripts/download_model.py --models all 一次性拉取,也可以按需指定单个模型。模型文件放在 hivision/creator/weights 目录下。人脸检测模型是可选配置,RetinaFace 权重需要手动下载到指定路径。之后就能启动 Gradio Demo 或 API 服务。整个流程没有复杂的编译步骤,对 Python 开发者友好。

API 服务是集成关键,参数覆盖常见需求

项目提供 API 服务部署方式,支持 Docker,方便集成到现有系统。API 接口的参数在更新日志里能看到演进轨迹:2024 年 9 月增加了 dpi 和 face_alignment 参数,11 月加了美颜参数,还支持 base64 图像传入。这意味着你可以通过 HTTP 请求直接传图、设置输出尺寸和背景色,拿到处理后的图片。对于做小程序或网页应用的团队,这个 API 可以直接对接。Gradio Demo 也提供了打印排版功能,支持六寸、五寸、A4、3R、4R 五种尺寸,还带裁剪线,适合直接输出到相纸。

美颜是加分项,但正装替换还是空头支票

项目宣称支持美颜,API 里也确实有美颜参数。但 README 里明确写了智能换正装是 waiting 状态,也就是说这个功能还没实现。如果你指望用这个工具生成正式场合的证件照,比如换上一件西装,那目前做不到。美颜功能的具体效果在文档里没有详细说明,没有示例图,也没有参数范围。实际使用前需要自己试。这是一个典型的宣传和实现之间的落差,文档里画了饼,但代码还没跟上。

选错模型组合,代价是内存爆炸

性能参考表格里最刺眼的是 birefnet-v1-lite 加 RetinaFace 组合,内存占用 6.2GB,推理 7 秒以上。这还是在 Mac M1 Max 上测的,普通 PC 可能更慢。如果你只有 8GB 内存的机器,跑这个组合会非常吃力,甚至可能 OOM。项目文档也提示 GPU 加速只对 birefnet-v1-lite 有效,且需要 16GB 显存。所以,追求高分割精度的代价很高。另一个限制是 Face++ 在线 API,虽然精度高,但依赖网络,且照片要传到外部服务,对隐私敏感场景不合适。

社区扩展丰富,但官方维护节奏放缓

社区围绕 HivisionIDPhotos 建了不少周边,包括 ComfyUI 工作流、微信小程序、Windows GUI、NAS 部署教程,甚至 C++ 版本。这说明项目有一定用户基础,集成方式多样。但看发布历史,v1.3.1 是 2025 年 1 月,v1.3.0 是 2024 年 11 月,v1.2.9 是 2024 年 9 月,更新频率不算高。项目没有标记归档,但节奏明显放缓。依赖的模型文件托管在 GitHub Releases 和 Hugging Face,如果这些链接失效,下载会成问题。

许可证宽松,但模型权重各有各的条款

项目本身采用 Apache-2.0 许可证,对商用友好,可以自由修改和分发。但要注意,项目集成的模型权重来自不同来源:MODNet 有官方权重,rmbg-1.4 来自 BRIA AI,birefnet-v1-lite 来自 ZhengPeng7。这些模型各自可能有不同的使用条款,尤其 rmbg-1.4 是商业模型,虽然开源,但商用时要确认其许可证限制。文档里没有明确说明这些模型的授权细节,采用前需要自己核实。另外,Face++ 是商业 API,调用会按量计费,这和使用本地模型是两套成本逻辑。

编辑结论

HivisionIDPhotos 适合需要快速生成标准证件照的个人用户、中小型应用开发者,以及想离线处理敏感照片的机构。它不适合追求高精度分割、需要复杂美颜或正装替换的场景,那些需求得靠外部服务或更重的模型。在采用前,先确认你的 CPU 内存能否承受所选模型的峰值占用,比如 birefnet-v1-lite 组合需要 6.2GB 内存和 7 秒以上的推理时间。同时,检查默认的 MTCNN 人脸检测是否满足你的精度要求,否则要额外下载 RetinaFace 权重并调整配置。最后,Face++ 在线 API 虽然精度高,但会引入网络依赖和数据外传,需要自己权衡隐私成本。

官方来源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
社区笔记

社区笔记