利用生成式 AI 实现自定义提取器

借助生成式 AI 训练和提取功能,您可以:

  • 使用零样本和少样本技术,通过基础模型获得高性能模型,而无需或只需少量训练数据。
  • 随着您提供越来越多的训练数据,可以使用微调功能进一步提高准确性。

生成式 AI 训练方法

您选择的训练方法取决于您可用的文档数量以及您愿意投入多少精力来训练模型。您可以通过以下三种方式训练生成式 AI 模型:

训练方法 零样本 少样本 微调
准确率 中至高
工作量
建议的训练文档数量 0 5 到 10 10 至 50+

自定义提取器模型版本

以下模型可用于自定义提取器。如需更改模型版本,请参阅管理处理器版本

1.4 版、1.5 版和 1.5 Pro 版支持置信度分数。

模型版本 说明 发布渠道 在美国/欧盟境内进行机器学习处理 在美国/欧盟境内进行微调 发布日期
pretrained-foundation-model-v1.5-2025-05-05 由 Gemini 2.5 Flash 大语言模型提供支持的可用于生产环境用途的候选版本。建议想要尝试使用较新模型的人使用。 稳定版 美国、欧盟 2025 年 5 月 5 日
pretrained-foundation-model-v1.5-pro-2025-06-20 由 Gemini 2.5 Pro 大语言模型提供支持的可用于生产环境用途的模型。支持在线处理请求的配额,最高可达每分钟 30 页。与 v1.5 相比,此模型的质量有所提升,但延迟时间可能会更长。 稳定版 2025 年 6 月 20 日
pretrained-foundation-model-v1.5.1-2025-08-07 由 Gemini 2.5 Flash LLM 提供支持的公开预览版模型。此模型具有与 v1.5 相同的特征,并改进了自适应少量样本学习。 候选版本 2025 年 8 月 8 日
pretrained-foundation-model-v1.6-pro-2025-12-01 由 Gemini 3 Pro LLM 提供支持的预览版模型。 候选版本 2025 年 12 月 1 日
pretrained-foundation-model-v1.6-2026-01-13 由 Gemini 3 Flash LLM 提供支持的预览版模型。 候选版本 2026 年 1 月 13 日
pretrained-foundation-model-v3.5-2026-05-26 由 Gemini 3.5 Flash LLM 提供支持的预览版模型。 候选版本 2026 年 5 月 26 日

如需更改项目中的处理器版本,请参阅管理处理器版本

如需针对默认处理器配额提出配额增加申请 (QIR),请按照申请配额调整中的步骤操作。

初始设置

如果尚未启用,请启用结算功能和 Document AI API

构建和评估生成式 AI 模型

  1. 创建处理器并按照最佳实践定义要提取的字段,这一点非常重要,因为这会影响提取质量。

    • 依次前往工作台 > 自定义提取器 > 创建处理器 > 分配名称

    processor-version-genai-1

    • 依次前往开始 > 创建新字段

    processor-version-genai-2

  2. 导入文档

    • 导入具有自动添加标签功能的文档,并将文档分配给训练集和测试集。
    • 对于零样本学习,只需要架构。如需评估模型的准确率,只需一个测试集即可。
    • 对于少样本学习,我们建议提供 5 个训练文档。
    • 所需的测试文档数量取决于具体用例。一般来说,测试文档越多越好。
    • 确认或修改文档中的标签
  3. 训练模型:

    • 依次选择构建创建新版本
    • 输入名称,然后选择创建

    processor-version-genai-12

  1. 评估:

    • 前往评估和测试,选择您刚刚训练的版本,然后选择查看完整评估

    processor-version-genai-13

    • 现在,您可以看到整个文档和每个字段的指标,例如 F1 得分、精确率和召回率
    • 确定性能是否达到您的生产目标。如果未达到,请重新评估训练集和测试集。
  2. 将新版本设为默认版本:

    • 前往管理版本
    • 选择以展开选项,然后选择设为默认

    processor-version-genai-14

    您的模型现已部署。发送到此处理器的文档会使用您的自定义版本。 您可以评估模型性能,以检查模型是否需要进一步训练。

评估参考

评估引擎可以执行完全匹配或模糊匹配。对于完全匹配,提取的值必须与标准答案完全一致,否则会被视为未命中。

即使模糊匹配提取结果存在细微差异(例如大小写差异),仍视为匹配。您可以在评估界面中更改此设置。

processor-version-genai-15

微调

通过微调,您可以使用数百或数千个文档进行训练。

  1. 创建处理器并按照最佳实践定义要提取的字段,这一点非常重要,因为这会影响提取质量。

  2. 使用自动添加标签功能导入文档,并将文档分配给训练集和测试集。

  3. 确认或修改文档中的标签

  4. 训练模型。

    • 选择构建标签页,然后在微调框中选择创建新版本

    processor-version-genai-24

    • 尝试使用提供的默认训练参数或值。 如果结果不理想,请尝试以下高级选项:

    • 训练步数(介于 100 到 400 之间):控制在调优期间,针对一批数据优化权重的频率。

      • 过低则表示训练可能会在收敛之前结束(欠拟合)。
      • 如果值过高,模型在训练期间可能会多次看到同一批数据,从而导致过拟合。
      • 步数越少,训练时间越短。如果文档的模板变化较小,则可以提高数量;如果变化较大,则可以降低数量。
    • 学习速率乘数(介于 0.1 和 10 之间):控制模型参数在训练数据上的优化速度。它大致相当于每个训练步的大小。

      • 较低的学习速率意味着模型权重在每个训练步中变化较小。如果过低,模型可能无法收敛到稳定解。
      • 较高的比率表示变化较大,但如果过高,则可能意味着模型跳过了最佳解决方案,反而收敛到次优解决方案。
      • 训练时间不受学习速率选择的影响。
    • 命名,选择所需的基础处理器版本,然后选择创建