非结构化数据的数据分析扫描在 Cloud Storage 发现扫描期间使用 Vertex AI Gemini 2.5 Pro 模型,将 Cloud Storage 中的原始非结构化文件(例如 PDF)转换为 BigQuery 中可查询的结构化资产。此自动化工作流专为从 Cloud Storage 中的原始文件开始的用户而设计。如果您已有现成的 BigQuery 对象表,或者想使用自定义提示来引导提取,请参阅使用非结构化数据的数据配置文件。
本文档介绍了如何设置必要的权限、准备非结构化文件、使用 REST API 创建启用语义推理的 Cloud Storage 发现扫描、查看生成的分析洞见、整理图谱配置文件,以及将数据提取到 BigQuery 中。
准备工作
在创建发现扫描之前,请确保您拥有所需的权限并已启用相关 API。
启用 API
在项目中启用以下 API:
dataplex.googleapis.combigquery.googleapis.comaiplatform.googleapis.com(Vertex AI)
启用 API 所需的角色
如需启用 API,您需要拥有 serviceusage.services.enable 权限。如果您创建了项目,则可能已经通过 Owner 角色 (roles/owner) 获得了此权限。否则,您可以通过 Service Usage Admin 角色 (roles/serviceusage.serviceUsageAdmin) 获得此权限。了解如何授予角色。
所需的角色和权限
如需为非结构化数据配置和运行数据分析扫描,您必须满足发现扫描的基本权限,然后授予其他角色,以便在多个服务代理之间进行语义推理。
基准发现扫描角色
确保您和 Knowledge Catalog 使用的服务账号拥有标准发现扫描所需的基准权限。如需查看完整列表,请参阅发现和编目 Cloud Storage 数据。
用于语义推理的其他角色
除了基准发现角色之外,还要确保您和服务账号具有以下额外的 Identity and Access Management (IAM) 角色。
其他身份和角色的摘要
| 身份类型 | 典型的主账号格式 | 所需 IAM 角色 | 核心用途 |
|---|---|---|---|
| 最终用户 | 您的 Google Cloud 用户账号 |
|
您可以使用这些额外的角色来配置扫描、查看 AI 生成的结果、整理图谱分析文件,以及触发最终的数据提取。 |
| Dataplex Universal Catalog 发现代理 | service-<var>PROJECT_NUMBER</var>@gcp-sa-dataplex.iam.gserviceaccount.com |
|
此 Google 代管式服务代理使用这些额外的角色来调用 Vertex AI,以生成推断的架构和元数据。 |
| BigQuery 连接服务账号 | 与您的连接相关联的唯一身份(例如 bqcx-<var>PROJECT_NUMBER</var>-<var>ID</var>@gcp-sa-bigquery-condel.iam.gserviceaccount.com) |
|