1. Home
  2. Glossário de Marketing

Data Lake

O que é um data lake? Vantagens do data lake

Um data lake, ou lago de dados, é um repositório centralizado para todos os nossos dados, onde é possível armazenar tanto dados estruturados quanto não estruturados, com seus respectivos metadados, e que ficam disponíveis sob demanda a todo momento.

O data lake comporta todos os tipos de arquivos, independentemente de sua origem, escala ou formato. Com isso, é possível executar análises, visualizações e processos de acordo com as necessidades específicas da empresa.

1. Como criar um data lake?

Embora não exista uma metodologia padrão para criar um data lake, os seguintes passos devem ser considerados no processo:

– Aquisição de dados para processamento. Como ponto de partida, é necessário obter os dados e metadados, preparando-os para a incorporação ao data lake. É fundamental identificar as fontes e os dados de maior valor para as tarefas nas quais serão aplicados.

– Curadoria de dados (data curation ou grooming). Em seguida, entram em ação os processos que transformam dados brutos em dados consumíveis por aplicativos analíticos. Dessa forma, os dados passam a ter formatos interpretáveis e reconhecíveis.

– Fornecer os dados. Com base na metainformação dos dados, são executados processos que permitem o acesso às informações contidas no data lake conforme as políticas estabelecidas. Isso impede o acesso a dados inadequados e garante que eles estejam prontos para serem usados corretamente.

– Preservação dos dados. Por fim, entram em jogo os processos e políticas que determinam quais dados devem ser mantidos e por quanto tempo. Isso também serve para garantir a disponibilidade das informações e que o desempenho e os recursos necessários para acessá-las sejam sustentáveis.

2. Vantagens de usar um data lake

Os principais benefícios do uso de um data lake são os seguintes:

  • Mesmo que a fonte original dos dados esteja obsoleta, seu conteúdo ainda pode ser útil para análise.
  • Centralizam todos os dados em um só lugar, independentemente de sua origem.
  • Com a permissão adequada, qualquer usuário autorizado pode acessar e enriquecer as informações para melhorar a tomada de decisões.
  • Os dados processados podem ser analisados por ferramentas de Big Data.
  • A totalidade dos dados inseridos pode ser normalizada e tratada.
  • Coletam-se apenas os dados conforme as necessidades específicas, reduzindo custos e tempo.

3. Data lake vs. Data warehouse

Quando se trata de armazenar uma quantidade enorme de dados, é comum associar o conceito de data lake ao de data warehouse (armazém de dados). O data warehouse é composto basicamente pelos diferentes componentes do data lake cuja missão é processar dados estruturados.

Ambos têm como foco o armazenamento de dados, mas existem algumas diferenças:

– Acessibilidade. Um data lake oferece uma acessibilidade muito simples, enquanto em um data warehouse esse processo é mais complexo.

– Armazenamento. O data lake tem um custo menor e é escalável na nuvem, enquanto um data warehouse costuma ser mais caro.

– Esquema. Os data lakes baseiam-se em esquemas On-Read e os data warehouses em esquemas On-Write.

– Estrutura dos dados. O data warehouse coleta apenas dados já estruturados, enquanto o data lake recebe dados tanto estruturados quanto não estruturados.

– Finalidade dos dados. O uso dos dados deve estar sempre definido em um data warehouse, enquanto em um data lake isso nem sempre acontece.

– Flexibilidade. Em um data lake, é mais fácil fazer modificações devido à ausência de estrutura, ao passo que em um data warehouse isso é muito mais complicado.

– Usuários. Os dados em um data lake são manipulados por analistas; já em um data warehouse, qualquer usuário autorizado pode manipular os dados.

Artigos relacionados