AnalytiqueService régional
Glue
Permet de préparer, transformer et charger des données (ETL)
Cas d’utilisation
- Construction d’un datalake
- Traitement de données par lots
- Normalisation, nettoyage, dédoublonnage des données
- Transformation de format (CSV, parquet, JSON…)
Composants principaux
Glue Data Catalog
- Base centralisée contenant les schémas, tables, partitions, emplacements S3
- Utilisée par Athena, Redshift Spectrum, EMR, Glue…
- Permet le schema discovery et les évolutions de schéma
Glue Crawlers
- Analyse automatique des données sur S3, RDS, DynamoDB…
- Détecte le format, les schéma et partitions
- Met à jour le Data Catalog
Glue Jobs
- Job ETL (Spark ou Python) exécuté de façon serverless
- Transformations via :
- Scala / Python / PySpark
- Glue DynamicFrame (optimisé pour JSON, schémas variables)
- DataFrame Spark
Glue Workflows
- Orchestration complète de jobs, crawlers, triggers ETL
Composants principaux
Glue Triggers
- Déclenchement des jobs (programmés, dépendances, events)
Glue Studio
- Interface visuelle pour créer des workflows ETL sans écrire de code
Modes de traitement
- Mode batch : transformation sur Spark dans un cluster serverless
- Glue streaming : Flux Kinesis ou Kafka, quasi temps réel
- Glue Interactive Sessions : session de développement intéractif (Jupyter, notebooks)
Coûts
- Basé sur les DPU (Data Processing Units)
- Facturation à la seconde après 1 minute
- Glue Catalog est souvent peu coûteux (prix par requête)
Sécurité
Il est possible de configurer Glue pour fonctionner dans un VPC Privé