Descripción general
¿Qué es el Data Lakehouse?
El Data Lakehouse es la capa analítica de tu workspace de Databricks: tablas y vistas gobernadas por Unity Catalog y alimentadas por Lakeflow. Lakeflow es el conjunto de servicios de ingeniería de datos de Databricks que abarca la ingesta, la orquestación y la gestión de pipelines. Desde una app de AppKit, puedes leer sus tablas, disparar Lakeflow Jobs y mostrar las marcas de tiempo de «última actualización» de los pipelines que las alimentaron.
El Analytics plugin se encarga de las lecturas en el SQL warehouse (consulta Lecturas analíticas y Pipelines y actualidad de los datos). El Jobs plugin se encarga de disparar las ejecuciones y seguir su progreso (consulta Lakeflow Jobs).
Cuándo usar el Data Lakehouse
- Necesitas leer datos analíticos curados: ingresos, clientes, eventos, resultados de modelos.
- Muestras agregaciones tipo dashboard o vistas de lista sobre millones de filas.
- Disparas de forma asíncrona el reentrenamiento de modelos, procesos ETL o un backfill prolongado a partir de una acción del usuario.
Cuándo no usarlo
- Lecturas de menos de un segundo en una solicitud del usuario, como sugerencias mientras se escribe o autocompletado. Usa Lakebase Postgres directamente o replica una tabla de UC en Lakebase como tabla sincronizada.
- Escrituras transaccionales desde tu aplicación (pedidos, sesiones, registros de auditoría). Usa Lakebase Postgres.
- Preguntas y respuestas en lenguaje natural sobre tablas gobernadas. Usa Genie.
Tampoco escribes pipelines, configuras Spark ni dimensionas clústeres: esas son tareas de ingeniería de datos que se realizan en el workspace de Databricks o mediante Declarative Automation Bundles.
Elige un template para empezar
Cada uno combina la integración descrita en las páginas anteriores en un patrón funcional.
| Quieres... | Template |
|---|---|
| Replicar una tabla de UC en Lakebase para lecturas de baja latencia | Sync Tables (Autoscaling) |
| Montar el pipeline completo de UC + Change Data Feed de Lakebase + medallion | Operational Data Analytics |
Siguientes pasos
- Lecturas analíticas con el Analytics plugin, archivos SQL y consultas on-behalf-of-user.
- Lakeflow Jobs para el Jobs plugin,
runNowy el progreso vía SSE. - Pipelines y actualidad de los datos para obtener señales de actualidad mediante el Analytics plugin.