A AWS integrou o DuckDB ao Amazon Aurora PostgreSQL para que uma única consulta combine registros operacionais do banco com dados Apache Iceberg e Apache Parquet no Amazon S3. Isso inclui gravações ainda não confirmadas; a proposta é consultar dados do lake sem precisar copiá-los previamente para o Aurora por um pipeline de ETL.

Aurora consulta dados operacionais e dados do lake juntos

O DuckDB fica incorporado ao Aurora PostgreSQL e processa as varreduras analíticas, segundo a AWS. Assim, a mesma consulta pode acessar os registros operacionais do banco e tabelas Iceberg ou dados Parquet armazenados no S3, incluindo S3 Tables.

O recurso atende a aplicações que precisam combinar informações recentes com dados históricos. No exemplo da AWS, uma consulta reúne sete dias de transações recentes do Aurora e cinco anos de histórico em um arquivo Parquet no S3; o Aurora identifica o esquema da tabela externa pelos metadados do arquivo.

DuckDB e catálogos compatíveis

A integração com o DuckDB descrita pela AWS faz parte do Aurora gerenciado. O pg_duckdb é uma extensão separada para PostgreSQL e não é o mecanismo que configura esse recurso do Aurora.

Para dados Iceberg, o Aurora pode usar o AWS Glue Data Catalog. Catálogos externos compatíveis com Iceberg REST Catalog podem ser registrados no Glue, com tabelas estrangeiras apontando para os dados correspondentes.

Versões e configuração

O recurso está disponível a partir do Aurora PostgreSQL 17.11 e 18.6. A configuração requer a extensão aurora_analytics e uma função do IAM associada ao recurso AuroraAnalytics, com acesso ao Amazon S3 e ao AWS Glue.

Execução das consultas e materialização

A AWS descreve otimizações como o envio de filtros para mais perto dos dados, a leitura apenas das colunas necessárias e o uso de cache. A função aurora_analytics_stat_statements() informa, por consulta, linhas examinadas, bytes lidos do S3 e ocorrências de cache.

As consultas de leitura podem ser executadas na instância gravadora ou em uma réplica de leitura. Já os comandos que materializam dados — isto é, gravam dados selecionados do lake em tabelas nativas do Aurora — são executados na instância gravadora. A AWS aponta essa opção para padrões de consulta que precisam de latência de um dígito de milissegundos.

Disponibilidade e custos

A AWS informa que o recurso está disponível em todas as regiões comerciais da AWS e nas regiões AWS GovCloud (US). Não há uma tarifa específica pelo recurso; continuam sendo cobrados os custos incrementais de computação do Aurora e de solicitações ao S3.