Clément Schanen

AnalytiqueService régional

Glue

Permet de préparer, transformer et charger des données (ETL)

Cas d’utilisation

  • Construction d’un datalake
  • Traitement de données par lots
  • Normalisation, nettoyage, dédoublonnage des données
  • Transformation de format (CSV, parquet, JSON…)

Composants principaux

Glue Data Catalog

  • Base centralisée contenant les schémas, tables, partitions, emplacements S3
  • Utilisée par Athena, Redshift Spectrum, EMR, Glue…
  • Permet le schema discovery et les évolutions de schéma

Glue Crawlers

  • Analyse automatique des données sur S3, RDS, DynamoDB
  • Détecte le format, les schéma et partitions
  • Met à jour le Data Catalog

Glue Jobs

  • Job ETL (Spark ou Python) exécuté de façon serverless
  • Transformations via :
    • Scala / Python / PySpark
    • Glue DynamicFrame (optimisé pour JSON, schémas variables)
    • DataFrame Spark

Glue Workflows

  • Orchestration complète de jobs, crawlers, triggers ETL

Composants principaux

Glue Triggers

  • Déclenchement des jobs (programmés, dépendances, events)

Glue Studio

  • Interface visuelle pour créer des workflows ETL sans écrire de code

Modes de traitement

  • Mode batch : transformation sur Spark dans un cluster serverless
  • Glue streaming : Flux Kinesis ou Kafka, quasi temps réel
  • Glue Interactive Sessions : session de développement intéractif (Jupyter, notebooks)

Coûts

  • Basé sur les DPU (Data Processing Units)
  • Facturation à la seconde après 1 minute
  • Glue Catalog est souvent peu coûteux (prix par requête)

Sécurité

  • Intégration IAM
  • Chiffrement des Data Catalog avec KMS

Il est possible de configurer Glue pour fonctionner dans un VPC Privé