Bedrijven investeren elk jaar miljoenen euro's in het opslaan en verwerken van data, maar stuiten vaak op een rigide scheiding tussen twee werelden: razendsnelle operationele databases (zoals PostgreSQL voor webshops en apps) en goedkope, enorme data lakes (zoals Amazon S3 voor historische analyses).
Het traditionele verbinden van deze twee systemen vereiste zware, complexe en kostbare ETL-pipelines (Extract, Transform, Load). Deze pipelines kopiëren en dupliceren data, wat veel geld kost, lang duurt en snel crasht wanneer de datastructuur (schema-evolutie) verandert.
- De AWS-Update van 30 September 2026:
- AWS heeft een grote update uitgerold voor Amazon Aurora PostgreSQL.
- Aurora ondersteunt nu rechtstreeks Foreign Tables die wijzen naar Apache Iceberg- en Parquet-bestanden in Amazon S3.
- Dit maakt het mogelijk om met standaard SQL vanuit je operationele database direct queries uit te voeren op historische data in het data lake, zonder de data eerst te kopiëren of te verplaatsen.
- De Onzichtbare Motor (DuckDB):
- Om te voorkomen dat de standaard PostgreSQL-motor (die georiënteerd is op rijen) vertraagt bij het scannen van gigantische analytische bestanden, heeft AWS de DuckDB-engine onder de motorkap ingebed.
- DuckDB maakt gebruik van vectorized query execution en verwerkt kolomgeoriënteerde data in grote blokken in het geheugen.
- Ontwikkelaars merken hier niets van: de vertrouwde PostgreSQL-interface en SQL-syntaxis blijven exact hetzelfde, terwijl DuckDB op de achtergrond de loodzware analytische scans uitvoert.
- Snelheidstechnieken bij het Scannen:
- Column Pruning: Alleen de kolommen die nodig zijn voor de query worden gelezen uit de S3-bestanden; de rest wordt genegeerd.
- Predicate Pushdown: Filters worden direct naar de opslaglaag gestuurd, waardoor alleen de strikt noodzakelijke bytes over het netwerk worden verzonden.
- Geen ETL meer of Direct Materaliseren:
- Voor veruit de meeste analyses kunnen ontwikkelaars direct de S3-data bevragen via Foreign Tables.
- Voor extreem vertragingsgevoelige toepassingen (latency-sensitive workloads) biedt de update een materialisatieproces. Met één enkel SQL-commando (CREATE TABLE ... AS SELECT) worden S3-bestanden fysiek in de lokale Aurora-database geladen, zonder dat daar externe orkestratietools (zoals Apache Spark of Airflow) voor nodig zijn.
- Beschikbaarheid en Kosten:
- De functionaliteit is per direct wereldwijd beschikbaar in alle commerciële AWS-regio's (vanaf Aurora PostgreSQL versies 17.11 en 18.6) én in de streng beveiligde AWS GovCloud-regio's in de VS.
- De ingebouwde DuckDB-functionaliteit wordt geleverd zonder extra licentie- of featurekosten (at no additional charge); je betaalt enkel voor de gebruikelijke rekenkracht en opslag.
- Conclusie / Toekomstperspectief:
- De frictie en kosten voor het experimenteren met grote datasets naderen nul.
- Het opent de deur naar een toekomst waarin de database niet meer een fysieke container voor opslag is, maar een slimme, dynamische "lens" waarmee je rechtstreeks naar een universeel datameer kijkt.