模型 / 数据集
PaddlePaddle/ERNIE avatar
PaddlePaddle/ERNIE

ERNIE 4.5 与 ERNIEKit:百度开源的多模态模型家族与 PaddlePaddle 训练工具箱

The official repository for ERNIE 4.5 and ERNIEKit – its industrial-grade development toolkit based on PaddlePaddle.

7,735 个 Star1,446 个 ForkPythonApache-2.0

秒懂

它是什么?
本文基于官方仓库信息,梳理 ERNIE 4.5 模型家族的架构特点与 ERNIEKit v1.5 的训练、推理能力,并指出其适用场景、已知边界与评估要点。
适合谁用?
ERNIE 4.5 与 ERNIEKit 适合已经或准备采用 PaddlePaddle 体系、需要从文本到视觉的统一 MoE 模型、且对中文场景有需求的团队。模型权重采用 Apache-2.0,商用限制少,但训练代码与 PaddlePaddle 深度绑定,若你的基础设施以 PyTorch 为主,迁移成本会很高。
能商用吗?
可以。Apache-2.0 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 53 天前。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

仓库里有什么:模型权重之外,还有一套训练工具

这个仓库不是单纯的模型卡。它包含 ERNIE 4.5 模型家族的定义、ERNIEKit 工具包、cookbook 示例以及部署指引。ERNIEKit 从 v1.0 到 v1.5 的迭代记录显示,它的重点不只是放出权重,而是把训练流程工程化。v1.1 加入对 ERNIE-4.5-VL 系列的 SFT 和 LoRA 支持,v1.3 支持 21B-A3B-Thinking 模型的函数调用训练,v1.4 引入 padding-free 策略来减少显存占用,v1.5 则把视觉模型 ERNIE-4.5-VL-28B-A3B-Thinking 的 SFT 和函数调用训练纳入。这些更新说明,ERNIEKit 面向的是需要自己微调模型的团队,而不是只做推理调用的用户。

模型家族的结构:MoE 为主,稠密模型做补充

根据 README 的描述,ERNIE 4.5 包含 10 个变体,其中 9 个是 MoE 架构。最大的模型有 424B 总参数,激活参数为 47B。最小的 MoE 是 21B-A3B,激活参数仅 3B。此外还有一个 0.3B 的稠密模型,适合资源受限的环境。MoE 设计的关键是异构模态结构,它允许不同模态共享参数,同时为每个模态保留专用参数。这种做法的好处是,视觉理解能力的提升不会拖累文本任务的表现。所有模型的上下文窗口都是 128K,这对于长文档或长视频理解是一个实际约束。视觉语言模型支持文本、图像和视频输入,但输出只有文本。

训练与推理的底层:PaddlePaddle 是唯一路径

README 明确说所有模型都用 PaddlePaddle 训练,并强调其实现了 47% 的 MFU。这意味着训练流程与 PaddlePaddle 深度绑定。如果你熟悉 PyTorch,直接迁移会有学习成本。ERNIEKit 的工具链包括 AutoParallel 功能,用于处理并行策略,但 v1.2 和 v1.3 的修复记录显示,这个模块曾经有 checkpoint 保存和 MoE 并行相关的 bug。这些修复记录本身不是坏事,反而说明项目在快速迭代。但如果你在生产环境中使用,需要关注你所用版本是否包含这些修复。部署方面,README 链接到 FastDeploy 项目,说明推理路径可能独立于训练框架。

微调一个视觉模型:从模型选择到命令执行

仓库的 cookbook 目录和 docs 目录提供了训练示例。以 ERNIE-4.5-VL-28B-A3B-Thinking 为例,v1.5 支持其 SFT 和函数调用训练。实际操作时,你需要先通过 Hugging Face 下载权重,例如 baidu/ERNIE-4.5-VL-28B-A3B-Thinking。然后根据 docs 中的文档准备训练数据。v1.2 开始支持 query-response 格式的训练数据,v1.4 引入了 padding-free 策略,该策略会将一个 batch 内的数据打包成一个序列,避免填充带来的显存浪费。具体命令在 docs/erniekit.md 中有说明,但 README 没有给出完整的命令行示例。要跑通训练,你需要安装 PaddlePaddle 和 ERNIEKit,具体版本要求需要查阅仓库的安装文档。

硬件适配的边界:不只是 NVIDIA

v1.2 的更新提到命令行工具增加了 iluvatar GPU 硬件支持。这说明 ERNIEKit 在多硬件适配上有实际投入。但 README 没有列出所有支持的硬件型号,也没有给出不同硬件上的性能对比。对于 424B 总参数的模型,你至少需要多节点分布式训练环境。即使是 21B-A3B,激活参数 3B,但完整权重加载仍然需要大量显存。如果你只有单张消费级 GPU,0.3B 稠密模型可能是唯一能本地跑的选择。官方文档提到多硬件兼容,但兼容不等于高效,实际训练速度需要你自己验证。

与同类开源模型的差异:不是又一个 Llama 封装

与常见的 Llama 系列或 Qwen 系列不同,ERNIE 4.5 的 MoE 结构强调模态间的参数共享。Qwen2-VL 等模型通常为视觉和文本分别设计独立模块,而 ERNIE 4.5 的异构 MoE 试图在共享与专用之间取平衡。这意味着,如果你需要同时处理文本和视觉任务,并且希望用一套模型权重完成两类任务,ERNIE 的设计可能更贴合需求。但代价是,它的生态绑定在 PaddlePaddle 上。相比之下,Hugging Face Transformers 生态中的模型可以无缝对接 PyTorch、TensorFlow 等框架,社区工具和部署方案更丰富。如果你已经有基于 PyTorch 的数据管线,切换到 ERNIEKit 需要重写数据加载和训练循环。

许可证与维护成本:Apache-2.0 的甜与苦

模型权重和工具包均采用 Apache-2.0 许可证,这对商用是友好的。但开源许可证不包含技术维护承诺。仓库的默认分支是 release/v1.5,最近一次推送是 2026 年 7 月,说明项目仍在活跃维护。不过,ERNIEKit 的版本迭代很快,v1.0 到 v1.5 只用了五个月。快速迭代意味着新功能多,但也意味着接口可能变化。如果你在 v1.0 上写了训练脚本,升级到 v1.5 时可能需要调整。建议锁定版本,并为升级预留测试时间。此外,训练文档分散在 docs 目录中,包括 erniekit.md 和针对特定模型的 SFT 文档,你需要花时间通读。

编辑结论

ERNIE 4.5 与 ERNIEKit 适合已经或准备采用 PaddlePaddle 体系、需要从文本到视觉的统一 MoE 模型、且对中文场景有需求的团队。模型权重采用 Apache-2.0,商用限制少,但训练代码与 PaddlePaddle 深度绑定,若你的基础设施以 PyTorch 为主,迁移成本会很高。若你只需要小规模推理或快速原型,0.3B 稠密模型和 21B-A3B 是更现实的选择。若你追求社区生态和部署灵活性,Hugging Face Transformers 生态中的同类 MoE 模型可能更容易上手。在采用前,请先确认三件事:你的 GPU 显存能否容纳 47B 激活参数的模型,你的数据格式是否符合 ERNIEKit 的 SFT 或 LoRA 要求,以及你能否接受 PaddlePaddle 作为唯一训练框架。官方文档明确支持多硬件,但并未给出所有硬件的详细性能对比,实际效果需要你用自己的数据跑一次基准。

官方来源

  1. License: Apache-2.0
  2. PaddlePaddle/ERNIE on GitHub
  3. Project website
  4. README
  5. Releases
社区笔记

社区笔记