Accéder au contenu principal

Vue d'ensemble

Qu'est-ce que le Data Lakehouse ?

Le Data Lakehouse est la couche analytique de votre workspace Databricks : des tables et des vues gouvernées par Unity Catalog et alimentées par Lakeflow. Lakeflow est la suite de services d'ingénierie des données de Databricks, qui couvre l'ingestion, l'orchestration et la gestion des pipelines. Depuis une application AppKit, vous lisez ses tables, déclenchez des Lakeflow Jobs et affichez les horodatages de « dernière mise à jour » issus des pipelines qui les ont alimentées.

Le plugin Analytics gère les lectures depuis un SQL warehouse (voir Lectures analytiques et Pipelines et fraîcheur). Le plugin Jobs gère le déclenchement des exécutions et leur progression (voir Lakeflow Jobs).

Quand utiliser le Data Lakehouse

  • Vous devez lire des données analytiques curées : revenus, clients, événements, sorties de modèles.
  • Vous affichez des agrégats de type tableau de bord ou des vues en liste portant sur des millions de lignes.
  • Vous déclenchez un réentraînement de modèle, un traitement ETL ou un long backfill de façon asynchrone suite à une action de l'utilisateur.

Quand ne pas l'utiliser

  • Lectures inférieures à la seconde sur une requête utilisateur, comme la saisie prédictive ou l'autocomplétion. Utilisez directement Lakebase Postgres, ou répliquez une table UC vers Lakebase sous forme de table synchronisée.
  • Écritures transactionnelles depuis votre application (commandes, sessions, journaux d'audit). Utilisez Lakebase Postgres.
  • Questions-réponses en langage naturel sur des tables gouvernées. Utilisez Genie.

Vous n'avez pas non plus à écrire de pipelines, à configurer Spark ni à dimensionner des clusters : ce sont des tâches d'ingénierie des données, qui s'effectuent dans le workspace Databricks ou via les Declarative Automation Bundles.

Choisissez un modèle de départ

Chacun réunit les mécanismes décrits dans les pages ci-dessus en un schéma fonctionnel.

Vous souhaitez...Modèle
Répliquer une table UC dans Lakebase pour des lectures à faible latenceSync Tables (Autoscaling)
Mettre en place le pipeline complet UC + Lakebase Change Data Feed + médaillonOperational Data Analytics

Pour aller plus loin

Databricks Developer Hub

Prêt à lancer votre prochaine application agentique en quelques minutes ?

Lire la documentation