Configuração de Cluster Distribuído com Hadoop 3.2.2 e Hive 3.1.3
Compatibilidade de Versões e Arquitetura
A partir da versão 3.2.3, o ecossistema Hadoop passou a exigir obrigatoriamente o JDK 11. No entanto, o Apache Hive 3.1.3 ainda apresanta dependências críticas do JDK 1.8. Para viabilizar a execução conjunta e estável de ambos os componentes, este guia detalha a implantação do Hadoop 3.2.2 em conjunto co ...
Publicado em 7-28 07:28
Configurando o Secondary NameNode no Hadoop
O Secondary NameNode (SNN) é um componante essencial na arquitetura do HDFS, mas seu nome pode levar a interpretações equivocadas. Ele não é um backup quente do NameNode (NN), mas sim um nó que auxilia na manutenção e recuperação dos metadados do HDFS, além de reduzir o tempo de reinicialização do NN.
Entendendo o Papel do NameNode e Secondary ...
Publicado em 7-26 01:40
Interagindo com o HDFS usando três métodos distintos em máquinas cliente
Três abordagens para operar no HDFS
1. Uso da Linha de Comando (Shell)
As ferramentas de linha de comando do HDFS, acessadas via hdfs dfs ou hadoop fs, permitem executar operações rapidamente. A sintaxe segue convenções do Linux.
Exemplos de comandos frequentes:
Listar conteúdo de diretório: hdfs dfs -ls /user
Enviar arquivo: hdfs dfs -put loc ...
Publicado em 7-22 13:37
Pipeline ETL com PDI/Kettle: Arquitetura, Ingestão de CSV e Carga no Hive
O Pentaho Data Integration (PDI), também conhecido pelo nome histórico Kettle, é uma ferramenta de ETL visual amplamente utilizada para movimentação, transformação e carga de dados. O ambiente gráfico Spoon permite construir fluxos de dados por meio de componentes arrastáveis, reduzindo a necessidade de codificação manual.
Principais capacidade ...
Publicado em 6-26 02:44
Implementação de Replicação de Dados do MySQL para o Hadoop com Tungsten Replicator
Aqruitetura e Dependências do Sistema
Para construir um data warehouse analítico baseado no ecossistema Hadoop, é frequentemente necessário ingerir dados transacionais de bancos de dados relacionais em tempo real. O Tungsten Replicator atua como uma solução robusta para catpurar alterações no MySQL e aplicá-las no HDFS, formatando-as para consu ...
Publicado em 6-10 21:29
Guia Prático sobre o YARN: Componentes Principais e Configurações Essenciais
Noções Fundamentais
Recuperação do ResourceManager
Quando o ResourceManager é reiniciado, é crucial que os aplicativos em execução possam continuar a partir de seu último estado, em vez de recomeçar do zero. Para isso, o YARN armazena informações de estado durente a execução. Os armazenamentos de estado suportados incluem ZooKeeper, sistemas de ...
Publicado em 6-6 20:04