Nuevos Conjuntos de Datos Públicos Disponibles en Google Cloud Lakehouse

Google Cloud ha lanzado un conjunto de nuevos datasets públicos en su plataforma Lakehouse, diseñado para facilitar la exploración y el análisis de datos a gran escala. Estos conjuntos de datos incluyen información relevante como las vistas de página de Wikipedia y los historiales de commits de GitHub, brindando a los usuarios recursos reales y significativos para probar motores de consulta en Apache Iceberg.

El Lakehouse de Google Cloud utiliza el formato de tabla abierta Apache Iceberg para su catálogo de almacenamiento, permitiendo la separación entre el almacenamiento y el procesamiento de datos. Esto ofrece a los usuarios la flexibilidad de utilizar motores de consulta de su preferencia, como BigQuery, Apache Spark o Trino, mientras gestionan los datos en un formato abierto que previene la dependencia de proveedores específicos.

Para comenzar a interactuar con estos nuevos datasets, existen ciertos requisitos previos. Los usuarios deben contar con un proyecto en Google Cloud para la autenticación, así como con Credenciales de Aplicación por Defecto de Google configuradas en su entorno.

Una de las herramientas recomendadas para explorar los metadatos de las tablas es PyIceberg. Los usuarios pueden instalar los paquetes de Python requeridos a través de un entorno virtual y seguir un script determinado para inspeccionar el esquema de tablas que contienen los datos de vistas de página de Wikipedia, entre otros.

Además, el uso de PySpark y el Servicio Gestionado sin Servidor para Apache Spark de Google Cloud permite consultar las tablas sin necesidad de crear o gestionar un clúster. Esta opción ofrece tanto la velocidad como la flexibilidad de Apache Spark, simplificando el proceso de análisis de datos.

Mediante sesiones activas en el entorno de Google Cloud, los usuarios pueden ejecutar consultas para obtener el conteo mensual de vistas en artículos relacionados con BigQuery o recuperar los commits recientes de GitHub que hagan referencia a Iceberg.

La importación de estos datasets desde sus versiones equivalentes en BigQuery y su transformación usando Apache Iceberg y Parquet tiene como objetivo principal reducir las barreras de entrada, permitiendo a los usuarios explorar y aprender a utilizar Apache Iceberg con sus motores de consulta favoritos sin la necesidad de manejar infraestructura. Más información está disponible en la página oficial de Google Cloud Lakehouse, invitando a los interesados a comenzar su incursión en la creación de uno de estos lagos de datos abiertos, gestionados y de alto rendimiento.
vía: Google Blog Open Source

Scroll al inicio