Dados e BancoInfra e DevOps

Novos datasets públicos disponíveis no Google Cloud Lakehouse

há 55 min

O Google Cloud lançou novos datasets públicos no Google Cloud Lakehouse para exploração e benchmarking de engines de consulta com dados reais em escala. O lançamento inclui dados públicos do BigQuery, como visualizações de páginas da Wikipedia e históricos de commits do GitHub, convertidos para Apache Iceberg como formato de tabela e Parquet como formato de arquivo.

O Lakehouse separa armazenamento e computação e usa um catálogo de armazenamento baseado em Apache Iceberg. Com isso, os dados podem ser consultados por engines como BigQuery, Apache Spark e Trino em um formato aberto, reduzindo a dependência de um fornecedor específico. O objetivo declarado é permitir que desenvolvedores estudem o ecossistema Iceberg e comecem a trabalhar com dados públicos sem criar ou administrar infraestrutura.

Entre os exemplos apresentados estão:

  • A página da Wikipedia sobre o Google Chrome teve mais de 36 milhões de visualizações em 2025.
  • O Chromium registrou mais de 3.700 commits em abril de 2010.
  • A tabela wikipedia.pageviews_2016 pode ser inspecionada com PyIceberg.
  • A tabela wikipedia.pageviews_2026 pode ser consultada para somar visualizações mensais de artigos relacionados ao BigQuery.
  • A tabela github_repos.commits permite localizar commits cujo assunto ou mensagem mencione Iceberg.

Para explorar metadados com PyIceberg, é necessário um projeto do Google Cloud com as credenciais padrão de aplicação, ou ADC, configuradas. O ambiente de exemplo instala google-auth, pyiceberg e pyarrow em um virtualenv. O catálogo REST usado pelo código aponta para https://biglake.googleapis.com/iceberg/v1/restcatalog, com o warehouse gs://lakehouse-public-data e autenticação Google.

O identificador real do projeto precisa substituir `. Ele é usado para autenticar e contabilizar a cota da consulta, mesmo quando o acesso aos dados públicos é gratuito. O script de exemplo carrega o catálogo, abre o namespace wikipedia, acessa a tabela pageviews_2016` e imprime seu schema.

Também é possível consultar os dados usando o serviço gerenciado e serverless de Apache Spark do Google Cloud, anteriormente chamado Dataproc. A configuração habilita IcebergSparkSessionExtensions, registra um catálogo REST chamado lakehouse-public-data, usa o GCSFileIO para acessar os arquivos no Cloud Storage e configura credenciais delegadas pelo Google.

Com a sessão Spark ativa, o exemplo consulta as visualizações de janeiro de 2026 para títulos que contenham bigquery, agrupando por título e wiki, ordenando pelo total de visualizações e limitando o resultado a 20 linhas. Outro exemplo busca até 50 commits recentes relacionados a Iceberg, filtrando o assunto ou a mensagem e exibindo autor, horário, repositório e dados do commit.

O resultado é um conjunto de dados público e gerenciado que permite testar consultas e aprender Apache Iceberg com engines diferentes, sem precisar montar clusters ou administrar a infraestrutura de armazenamento. Para quem desenvolve no Brasil, isso oferece uma forma prática de experimentar lakehouses abertos, PyIceberg e Spark com datasets reais e reproduzíveis no Google Cloud.

Fontes

Ler na fonte

A BigTon News é uma plataforma de estudo e atualização própria. A escolha das fontes é editorial; o resumo é automático. Não nos responsabilizamos pelas notícias nem pelos conteúdos das fontes. Não republicamos a matéria: leia o original.

Assinar newsletter · Termos e privacidade