在 BigQuery 中与无边界 Lakehouse 数据互动

无边界 Lakehouse 是一种存储 引擎,它可将 Google Cloud 和开源服务整合在一起,从而为高级分析和 AI 创建统一的 界面。它为构建开放式、托管式且高性能的湖仓一体架构奠定了基础,该架构使用 Apache Iceberg,具有自动化数据管理和内置治理功能。

在 Lakehouse 中 创建表时, 系统会自动在 BigQuery 中查询该表,并且该表会显示在 控制台的 Google Cloud BigQuery 页面上。您的 Lakehouse 命名空间和架构也会自动映射到 BigQuery 数据集。

Lakehouse 资源与其他 BigQuery 资源之间的区别

Lakehouse 资源与标准 BigQuery 资源之间的主要区别如下:

  • Lakehouse 数据集会显示在 控制台的 Google Cloud BigQuery 页面上,紧挨着 水滴图标。
  • 您无法通过 BigQuery 修改 Lakehouse 资源。
  • Lakehouse 资源在其各自的详细信息 部分中包含其他元数据。

Iceberg 表功能比较

下表比较了由 Lakehouse 运行时目录管理的 Apache Iceberg 表与由 BigQuery 管理的 Apache Iceberg 表的功能。

功能 由 Lakehouse 运行时目录管理的 Apache Iceberg 表 由 BigQuery 管理的 Apache Iceberg 表
目录 Lakehouse 运行时目录(与 Iceberg REST 目录兼容) BigQuery
存储 Cloud Storage Cloud Storage
可通过 Iceberg REST 目录端点访问 是,使用 BigQuery 目录联合
读/写互操作性
BigQuery 读取查询(SELECT、BQML、AI 函数) 支持 支持
BigQuery DML(INSERT、UPDATE、DELETE、MERGE) 支持(预览版) 支持(正式版)
OSS 引擎读取 支持(正式版) 支持(正式版)(使用 BigQuery 目录联合)
OSS 引擎写入 支持(正式版) 不支持
OSS 引擎流式写入(Kafka、Spark、Dataflow,使用 Iceberg I/O 接收器) 支持(正式版) 不支持
托管功能和高级功能
表管理(压缩、垃圾回收) 支持(预览版) 支持(正式版)
BigQuery 流式写入(存储写入 API) 不支持 支持(正式版)
Pub/Sub 流式传输/订阅、Dataflow 流式传输(使用 BigQuery I/O 接收器) 不支持 支持(正式版)
BigQuery 变更数据捕获 (CDC) 不支持 支持(非公开预览版)
BigQuery 多语句事务 不支持