AnalytiqueService régional
Redshift
Permet d’analyser de très gros volumes de données avec des performances élevées
Présentation
- Amazon Redshift est un service managé de data warehouse conçu pour le Big Data et l’analytique
- Basé sur PostgreSQL
- Optimisé pour les requêtes analytiques (OLAP)
- Répond aux contraintes des 3V du Big Data :
- Volume : Très grandes quantités de données (en To, Po…)
- Variété : Plusieurs formats (CSV, JSON, Parquet…)
- Vélocité : Données générées et analysées rapidement
Cas d’utilisation
- Business Intelligence (BI)
- Reporting et tableaux de bord
- Analyse de logs
- Data lake analytics
- Consolidation de données multi-sources
Fonctionnement
Stockage en colonnes
- Données stockées par colonne
- Lecture optimisée pour l’analytique Réduit fortement le volume de données à lire
Traitement parallèle (MPP)
- Massive Parallel Processing
- Requêtes exécutées sur plusieurs nœuds en parallèle Très performant pour les requêtes complexes
Redshift Spectrum
- Permet d’analyser directement des données stockées dans S3 sans les charger dans Redshift
- Requêtes SQL sur un datalake
- Utilisation du parallélisme massif
Scalabilité
- Jusqu’à plusieurs pétaoctets de données
- Ajout de nœuds possible
- Modes : provisioned cluster ou serverless
Haute disponibilité & Sauvegarde
- Haute disponibilité (support multi AZ, réplication automatique des données)
- Sauvegarde (snapshots incrémentaux automatiques, restauration à un instant donné)
Tarification
- Basée sur :
- Type et nombre de nœuds
- Stockage utilisé
- Requêtes Spectrum
Limitations
- Moins adapté aux workloads transactionnels (OLTP)
- Optimisation nécessaire sur gros volumes
- Coût élevé si cluster surdimensionné
- Bonne modélisation des données requise