Clément Schanen

AnalytiqueService régional

Redshift

Permet d’analyser de très gros volumes de données avec des performances élevées

Présentation

  • Amazon Redshift est un service managé de data warehouse conçu pour le Big Data et l’analytique
    • Basé sur PostgreSQL
    • Optimisé pour les requêtes analytiques (OLAP)
  • Répond aux contraintes des 3V du Big Data :
    • Volume : Très grandes quantités de données (en To, Po…)
    • Variété : Plusieurs formats (CSV, JSON, Parquet…)
    • Vélocité : Données générées et analysées rapidement

Cas d’utilisation

  • Business Intelligence (BI)
  • Reporting et tableaux de bord
  • Analyse de logs
  • Data lake analytics
  • Consolidation de données multi-sources

Fonctionnement

Stockage en colonnes

  • Données stockées par colonne
  • Lecture optimisée pour l’analytique Réduit fortement le volume de données à lire

Traitement parallèle (MPP)

  • Massive Parallel Processing
  • Requêtes exécutées sur plusieurs nœuds en parallèle Très performant pour les requêtes complexes

Redshift Spectrum

  • Permet d’analyser directement des données stockées dans S3 sans les charger dans Redshift
    • Requêtes SQL sur un datalake
    • Utilisation du parallélisme massif

Scalabilité

  • Jusqu’à plusieurs pétaoctets de données
    • Ajout de nœuds possible
    • Modes : provisioned cluster ou serverless

Haute disponibilité & Sauvegarde

  • Haute disponibilité (support multi AZ, réplication automatique des données)
  • Sauvegarde (snapshots incrémentaux automatiques, restauration à un instant donné)

Tarification

  • Basée sur :
    • Type et nombre de nœuds
    • Stockage utilisé
    • Requêtes Spectrum

Limitations

  • Moins adapté aux workloads transactionnels (OLTP)
  • Optimisation nécessaire sur gros volumes
  • Coût élevé si cluster surdimensionné
  • Bonne modélisation des données requise