DuckDB i AWS Glue: tańsza alternatywa dla Sparka w ETL
Artykuł pokazuje, jak zbudować efektywny pipeline ETL używając DuckDB zamiast Apache Sparka na AWS Glue 6.0 – czytając Parquety z S3 i zapisując tabele Iceberg do Amazon S3 Tables. Autor porównuje koszty i czas wykonania obu podejść na konkretnym przykładzie, więc dowiesz się, ile możesz zaoszczędzić na pojedynczym workerze.
źródło: [aws/big-data-blog]