AWS laat Aurora PostgreSQL met ingebouwde DuckDB in één query operationele gegevens combineren met Apache Iceberg-tabellen en Apache Parquet-data in Amazon S3. Zo kunnen toepassingen actuele databasegegevens samen met data uit een datalake opvragen, zonder die data eerst via een ETL-proces naar Aurora te kopiëren. De query kan volgens AWS ook niet-gecommitte wijzigingen in Aurora meenemen.

Aurora combineert operationele gegevens met data uit S3

DuckDB is in Aurora PostgreSQL ingebouwd en verwerkt de analytische scans. De functie kan Apache Iceberg- en Apache Parquet-data in S3 bevragen, waaronder S3 Tables. Voor de query gebruikt een toepassing PostgreSQL-tools en -applicaties.

Deze beheerde Aurora-functie is iets anders dan pg_duckdb, een afzonderlijke PostgreSQL-extensie. De naam DuckDB komt in beide voor, maar AWS’ functie draait binnen Aurora en gebruikt de extensie aurora_analytics.

DuckDB en ondersteunde catalogi

AWS beschrijft optimalisaties zoals predicate pushdown — filters zo dicht mogelijk bij de data toepassen —, kolomselectie en caching. De functie biedt ook querystatistieken via aurora_analytics_stat_statements(): het aantal gescande rijen, het aantal uit S3 gelezen bytes en cachehits.

Voor Iceberg-data uit een compatibele externe Iceberg REST Catalog loopt de route via AWS Glue Data Catalog. De catalogus wordt daar geregistreerd; vervolgens kunnen foreign tables naar de data verwijzen.

Versies en configuratie

De functie ondersteunt Aurora PostgreSQL vanaf versie 17.11 en vanaf 18.6. Voor gebruik moet de database de extensie aurora_analytics inschakelen. Daarnaast is een IAM-rol nodig met de functie AuroraAnalytics; die rol geeft Aurora toegang tot S3 en AWS Glue.

Query-uitvoering en materialisatie

Leesquery’s kunnen op de writer-instantie of een read replica draaien. Opdrachten die data naar native Aurora-tabellen materialiseren, draaien op de writer. AWS noemt materialisatie als optie voor querypatronen waarvoor een latentie van enkele milliseconden nodig is.

In een voorbeeld combineert AWS zeven dagen aan recente Aurora-transacties met vijf jaar historische transacties in een Parquet-bestand op S3. Aurora leidt daarbij het schema van de foreign table af uit de bestandsmetadata.

Beschikbaarheid en kosten

AWS zegt dat de functie beschikbaar is in alle commerciële AWS-regio’s en AWS GovCloud (VS)-regio’s. Er geldt geen aparte vergoeding voor de functie zelf; extra verbruik van Aurora-rekenkracht en S3-verzoeken brengt wel kosten mee.