Dados e BancoInfra e DevOps
Novos datasets públicos disponíveis no Google Cloud Lakehouse
há 55 min
O Google Cloud lançou novos datasets públicos no Google Cloud Lakehouse para exploração e benchmarking de engines de consulta com dados reais em escala. O lançamento inclui dados públicos do BigQuery, como visualizações de páginas da Wikipedia e históricos de commits do GitHub, convertidos para Apache Iceberg como formato de tabela e Parquet como formato de arquivo.
O Lakehouse separa armazenamento e computação e usa um catálogo de armazenamento baseado em Apache Iceberg. Com isso, os dados podem ser consultados por engines como BigQuery, Apache Spark e Trino em um formato aberto, reduzindo a dependência de um fornecedor específico. O objetivo declarado é permitir que desenvolvedores estudem o ecossistema Iceberg e comecem a trabalhar com dados públicos sem criar ou administrar infraestrutura.
Entre os exemplos apresentados estão:
- A página da Wikipedia sobre o Google Chrome teve mais de 36 milhões de visualizações em 2025.
- O Chromium registrou mais de 3.700 commits em abril de 2010.
- A tabela
wikipedia.pageviews_2016pode ser inspecionada com PyIceberg. - A tabela
wikipedia.pageviews_2026pode ser consultada para somar visualizações mensais de artigos relacionados ao BigQuery. - A tabela
github_repos.commitspermite localizar commits cujo assunto ou mensagem mencione Iceberg.
Para explorar metadados com PyIceberg, é necessário um projeto do Google Cloud com as credenciais padrão de aplicação, ou ADC, configuradas. O ambiente de exemplo instala google-auth, pyiceberg e pyarrow em um virtualenv. O catálogo REST usado pelo código aponta para https://biglake.googleapis.com/iceberg/v1/restcatalog, com o warehouse gs://lakehouse-public-data e autenticação Google.
O identificador real do projeto precisa substituir `. Ele é usado para autenticar e contabilizar a cota da consulta, mesmo quando o acesso aos dados públicos é gratuito. O script de exemplo carrega o catálogo, abre o namespace wikipedia, acessa a tabela pageviews_2016` e imprime seu schema.
Também é possível consultar os dados usando o serviço gerenciado e serverless de Apache Spark do Google Cloud, anteriormente chamado Dataproc. A configuração habilita IcebergSparkSessionExtensions, registra um catálogo REST chamado lakehouse-public-data, usa o GCSFileIO para acessar os arquivos no Cloud Storage e configura credenciais delegadas pelo Google.
Com a sessão Spark ativa, o exemplo consulta as visualizações de janeiro de 2026 para títulos que contenham bigquery, agrupando por título e wiki, ordenando pelo total de visualizações e limitando o resultado a 20 linhas. Outro exemplo busca até 50 commits recentes relacionados a Iceberg, filtrando o assunto ou a mensagem e exibindo autor, horário, repositório e dados do commit.
O resultado é um conjunto de dados público e gerenciado que permite testar consultas e aprender Apache Iceberg com engines diferentes, sem precisar montar clusters ou administrar a infraestrutura de armazenamento. Para quem desenvolve no Brasil, isso oferece uma forma prática de experimentar lakehouses abertos, PyIceberg e Spark com datasets reais e reproduzíveis no Google Cloud.
Fontes
- Google Open SourceNew public datasets available in Google Cloud Lakehouse