Amazon S3 Tables : des tables Apache Iceberg gérées dans S3

2024-12-03 · Éditeur : AWS · Domaine : Cloud & DevOps

À re:Invent 2024, AWS lance S3 Tables, un nouveau type de compartiment S3 qui stocke des tables Apache Iceberg avec maintenance automatique. AWS annonce jusqu'à 3 fois plus de vitesse de requête et 10 fois plus de transactions par seconde.

Ce qui change

  • S3 Tables ajoute un type de compartiment S3 dédié aux tables Apache Iceberg.
  • AWS annonce jusqu'à 3 fois plus de performance de requête et 10 fois plus de transactions par seconde.
  • La compaction, la gestion des instantanés et le nettoyage sont automatiques.
  • Disponible au lancement dans trois régions américaines, avec Athena, EMR, Redshift et Spark.

### Ce qui change Le 3 décembre 2024, pendant AWS re:Invent (2-6 décembre à Las Vegas), AWS lance Amazon S3 Tables. C'est un troisième type de compartiment S3, à côté des compartiments à usage général et des compartiments de répertoire : le « table bucket ». Il stocke des données tabulaires au format Apache Iceberg et se comporte comme un entrepôt analytique dans le stockage objet. AWS rappelle qu'Apache Iceberg est, selon lui, la façon la plus répandue de gérer des fichiers Parquet, avec des milliers de clients d'AWS qui l'utilisent déjà. ### Caractéristiques - Jusqu'à 3 fois plus de performance de requête et jusqu'à 10 fois plus de transactions par seconde que des tables Iceberg gérées soi-même dans S3 (chiffres d'AWS). - Maintenance automatique : compaction, gestion des instantanés et suppression des fichiers non référencés ; cible de compaction réglable entre 64 et 512 Mio. - Intégrations : Amazon Athena, EMR, Redshift, QuickSight, Apache Spark, et le catalogue AWS Glue Data Catalog (en préversion). - Disponibilité au lancement dans trois régions : US East (Ohio, Virginie du Nord) et US West (Oregon). - Facturation sur le stockage, les requêtes, la surveillance des objets et la compaction. - Le service interroge des milliards de fichiers représentant des pétaoctets, voire des exaoctets, de données. ### Pourquoi c'est important Apache Iceberg est devenu le format de table ouvert de référence pour les architectures lakehouse. En intégrant sa gestion dans S3, AWS supprime une part de l'exploitation (compaction, nettoyage) que les équipes données assumaient elles-mêmes. Pour une ESN, c'est un point d'entrée simple vers un lakehouse, avec une dépendance accrue au service managé. ### À retenir AWS fait d'Iceberg un type de stockage natif de S3 : moins d'exploitation, mais une couche de plus chez le fournisseur.

Liens

Tags : AWS, Données, Cloud, Conférence