Vue d'ensemble
Qu'est-ce que le Data Lakehouse ?
Le Data Lakehouse est la couche analytique de votre workspace Databricks : des tables et des vues gouvernées par Unity Catalog et alimentées par Lakeflow. Lakeflow est la suite de services d'ingénierie des données de Databricks, qui couvre l'ingestion, l'orchestration et la gestion des pipelines. Depuis une application AppKit, vous lisez ses tables, déclenchez des Lakeflow Jobs et affichez les horodatages de « dernière mise à jour » issus des pipelines qui les ont alimentées.
Le plugin Analytics gère les lectures depuis un SQL warehouse (voir Lectures analytiques et Pipelines et fraîcheur). Le plugin Jobs gère le déclenchement des exécutions et leur progression (voir Lakeflow Jobs).
Quand utiliser le Data Lakehouse
- Vous devez lire des données analytiques curées : revenus, clients, événements, sorties de modèles.
- Vous affichez des agrégats de type tableau de bord ou des vues en liste portant sur des millions de lignes.
- Vous déclenchez un réentraînement de modèle, un traitement ETL ou un long backfill de façon asynchrone suite à une action de l'utilisateur.
Quand ne pas l'utiliser
- Lectures inférieures à la seconde sur une requête utilisateur, comme la saisie prédictive ou l'autocomplétion. Utilisez directement Lakebase Postgres, ou répliquez une table UC vers Lakebase sous forme de table synchronisée.
- Écritures transactionnelles depuis votre application (commandes, sessions, journaux d'audit). Utilisez Lakebase Postgres.
- Questions-réponses en langage naturel sur des tables gouvernées. Utilisez Genie.
Vous n'avez pas non plus à écrire de pipelines, à configurer Spark ni à dimensionner des clusters : ce sont des tâches d'ingénierie des données, qui s'effectuent dans le workspace Databricks ou via les Declarative Automation Bundles.
Choisissez un modèle de départ
Chacun réunit les mécanismes décrits dans les pages ci-dessus en un schéma fonctionnel.
| Vous souhaitez... | Modèle |
|---|---|
| Répliquer une table UC dans Lakebase pour des lectures à faible latence | Sync Tables (Autoscaling) |
| Mettre en place le pipeline complet UC + Lakebase Change Data Feed + médaillon | Operational Data Analytics |
Pour aller plus loin
- Lectures analytiques avec le plugin Analytics, les fichiers SQL et les requêtes on-behalf-of-user.
- Lakeflow Jobs pour le plugin Jobs,
runNowet la progression via SSE. - Pipelines et fraîcheur des données pour les indicateurs de fraîcheur via le plugin Analytics.