Borderless Lakehouse 跨云缓存与连接

📌 One-Sentence Summary Google Cloud 为 Borderless Lakehouse 推出跨云缓存和 BigQuery 跨云连接,通过智能缓存和 Iceberg 压缩将跨云数据传输降至处理数据的 5% 以下。 📝 Summary Google Cloud 为其 Borderless Lakehouse 推出两项预览功能:跨云缓存和 BigQuery 跨云连接。跨云缓存以子文件块粒度运行,针对 Parquet 等列式格式,仅在 Google Cloud 本地缓存查询所需的列块。结合 Iceberg 的 Zstandard 压缩(示例中压缩比为 8.9:1),可将网络传输降至逻辑处理数据的 5% 以下。文章以 Amazon S3 中一张 10 TiB 的电商销售表为例进行演示:首次查询传输了 24.1 GiB(8.9:1 压缩),而后续添加维度的查询实现了 94.8% 的缓存命中率,仅传输了 1.33 GiB 的新增列数据。BigQuery 跨云连接将此能力扩展至 S3 和 Azure Storage 中的非 Iceberg 数据(CSV、JSON、临时 Parquet),使用标准 BigQuery 计算工作节点实现全球区域可用性和完整功能对等,包括 BigQuery AI。通过远程元数据获取进行新鲜度检查,确保缓存一致性。合作伙伴 Cross-Cloud Interconnect 提供高带宽私有链路,降低每 GB 成本。 💡 Main Points 跨云缓存以子文件粒度仅获取所需列块并在本地缓存,大幅减少数据传输。 BigQuery 不再传输整个数 GB 的文件,而是仅读取查询所需的特定 Parquet 列块和字典页。缓存未命中时,它从远程云获取并填充区域缓存。示例中一张 10 TiB 的表,逻辑处理 214.5 GiB 仅需传输 24.1 GiB(8.9:1 压缩),后续查询实现了 94.8% 的缓存命中率。 将 Iceberg 列式压缩与智能缓存相结合,使跨云传输降至处理数据的 5% 以下,让 PB 级分析具备成本效益。 在 8:1 压缩比和 80% 缓存命中率下,每处理 1 TiB 逻辑数据仅需约 26 GiB 网络传输(约 2.6%)。合作伙伴 Cross-Cloud Interconnect 相比公共互联网进一步降低每 GB 成本。这种 TCO 的降低使跨云分析和 AI 在企业规模下变得可行。 BigQuery 跨云连接将联邦查询扩展至 S3 和 Azure Storage 中的非 Iceberg 数据,并具备完整的 BigQuery 功能对等。 对于没有 Iceberg 目录的原始文件,跨云连接创建直接引用远程存储桶路径的外部表。它们使用 Google Cloud 区域中的标准 BigQuery 计算工作节点,解锁全球区域可用性和完整的 BigQuery 功能,包括对远程文件的 BigQuery AI 和 Gemini。缓存同时适用于目录联邦和跨云连接。 缓存新鲜度通过元数据检查维护,不牺牲性能或安全性。 在使用缓存数据之前,BigQuery 会获取远程对象元数据以验证数据未发生变化且访问权限仍然有效。上游修改会触发新文件获取;未被引用的块自动过期。缓存数据使用 Google 管理的密钥进行静态加密,缓存条目按项目和目录边界分区,以实现租户隔离和区域数据驻留合规。 💬 Key Quotes 将标准 Iceberg 列式压缩与跨云缓存相结合,意味着你通常只需传输跨云处理数据的不到 5%,这有助于降低总拥有成本(TCO),使跨云分析和 AI 在企业规模下变得可行。 你的组织每处理 1 TiB 数据,只需跨网络传输约 26 GiB(不到总处理数据的 3%)。 跨云连接代表了现代架构的演进,它使用 Google Cloud 区域中的标准 BigQuery 计算工作节点,而非其他云中的计算工作节点。这种方法有助于解锁全球区域可用性,并提供完整的 BigQuery 功能对等——包括对远程文件的 BigQuery AI 和 Gemini。 📊 Article Meta AI Screening: 89 Source: Google Cloud Blog Author: Will Ochandarena, Jason Ganetsky Category: 人工智能 Language: 英文 Read Time: 6 min Word Count: 1371 Tags: AI 与智能应用 , 数据工程 , 性能优化 , 云原生 / DevOps , AI Agent Read Full Article
暂无评论,快来抢沙发~