在 BigQuery 中与无边界 Lakehouse 数据互动
无边界 Lakehouse 是一种存储 引擎,它可将 Google Cloud 和开源服务整合在一起,从而为高级分析和 AI 创建统一的 界面。它为构建开放式、托管式且高性能的湖仓一体架构奠定了基础,该架构使用 Apache Iceberg,具有自动化数据管理和内置治理功能。
在 Lakehouse 中 创建表时, 系统会自动在 BigQuery 中查询该表,并且该表会显示在 控制台的 Google Cloud BigQuery 页面上。您的 Lakehouse 命名空间和架构也会自动映射到 BigQuery 数据集。
Lakehouse 资源与其他 BigQuery 资源之间的区别
Lakehouse 资源与标准 BigQuery 资源之间的主要区别如下:
- Lakehouse 数据集会显示在 控制台的 Google Cloud BigQuery 页面上,紧挨着 水滴图标。
- 您无法通过 BigQuery 修改 Lakehouse 资源。
- Lakehouse 资源在其各自的详细信息 部分中包含其他元数据。
Iceberg 表功能比较
下表比较了由 Lakehouse 运行时目录管理的 Apache Iceberg 表与由 BigQuery 管理的 Apache Iceberg 表的功能。
| 功能 | 由 Lakehouse 运行时目录管理的 Apache Iceberg 表 | 由 BigQuery 管理的 Apache Iceberg 表 |
|---|---|---|
| 目录 | Lakehouse 运行时目录(与 Iceberg REST 目录兼容) | BigQuery |
| 存储 | Cloud Storage | Cloud Storage |
| 可通过 Iceberg REST 目录端点访问 | 是 | 是,使用 BigQuery 目录联合 |
| 读/写互操作性 | ||
| BigQuery 读取查询(SELECT、BQML、AI 函数) | 支持 | 支持 |
| BigQuery DML(INSERT、UPDATE、DELETE、MERGE) | 支持(预览版) | 支持(正式版) |
| OSS 引擎读取 | 支持(正式版) | 支持(正式版)(使用 BigQuery 目录联合) |
| OSS 引擎写入 | 支持(正式版) | 不支持 |
| OSS 引擎流式写入(Kafka、Spark、Dataflow,使用 Iceberg I/O 接收器) | 支持(正式版) | 不支持 |
| 托管功能和高级功能 | ||
| 表管理(压缩、垃圾回收) | 支持(预览版) | 支持(正式版) |
| BigQuery 流式写入(存储写入 API) | 不支持 | 支持(正式版) |
| Pub/Sub 流式传输/订阅、Dataflow 流式传输(使用 BigQuery I/O 接收器) | 不支持 | 支持(正式版) |
| BigQuery 变更数据捕获 (CDC) | 不支持 | 支持(非公开预览版) |
| BigQuery 多语句事务 | 不支持 | |