Visão geral
O que é o Data Lakehouse?
O Data Lakehouse é a camada analítica do seu workspace Databricks: tabelas e views governadas pelo Unity Catalog e populadas pelo Lakeflow. O Lakeflow é o conjunto de serviços de engenharia de dados da Databricks que abrange ingestão, orquestração e gerenciamento de pipelines. A partir de um app AppKit, você lê essas tabelas, dispara Lakeflow Jobs e exibe os carimbos de data/hora de "última atualização" dos pipelines que as populam.
O Analytics plugin cuida das leituras no SQL warehouse (consulte Leituras analíticas e Pipelines e atualidade dos dados). O Jobs plugin cuida do disparo de execuções e do acompanhamento do progresso (consulte Lakeflow Jobs).
Quando usar o Data Lakehouse
- Você precisa ler dados analíticos curados: receita, clientes, eventos, resultados de modelos.
- Você exibe agregações no estilo de dashboard ou visualizações em lista sobre milhões de linhas.
- Você dispara retreinamento de modelos, ETL ou um backfill demorado de forma assíncrona a partir de uma ação do usuário.
Quando não usar
- Leituras com latência de milissegundos em uma requisição do usuário, como typeahead ou autocompletar. Use o Lakebase Postgres diretamente ou replique uma tabela do UC no Lakebase como uma synced table.
- Gravações transacionais a partir do seu app (pedidos, sessões, logs de auditoria). Use o Lakebase Postgres.
- Perguntas e respostas em linguagem natural sobre tabelas governadas. Use o Genie.
Você também não cria pipelines, não configura o Spark nem dimensiona clusters. Essas são tarefas de engenharia de dados, realizadas no workspace do Databricks ou por meio dos Declarative Automation Bundles.
Escolha um template para começar
Cada um reúne as integrações das páginas acima em um padrão funcional.
| Você quer... | Template |
|---|---|
| Replicar uma tabela do UC no Lakebase para leituras de baixa latência | Sync Tables (Autoscaling) |
| Montar o pipeline completo de UC + Change Data Feed do Lakebase + medalhão | Operational Data Analytics |
Próximos passos
- Leituras analíticas com o plugin Analytics, arquivos SQL e consultas on-behalf-of-user.
- Lakeflow Jobs para o plugin Jobs,
runNowe progresso via SSE. - Pipelines e atualidade para sinais de atualidade por meio do plugin Analytics.