Автоматический отказоустойчивый не работает в Hadoop

Я пытаюсь построить кластер из 3 узлов (2 Namenode(nn1,nn2) и 1 datanode (dn1)). С помощью Namenode WEBUI я могу видеть, что nn1 активен, а nn2 находится в режиме ожидания. однако, когда я убиваю активный nn1, резервный nn2 не становится активным. Пожалуйста, помогите мне, что я делаю неправильно или что нужно изменить

nn1 / etc / hosts

127.0.0.1 localhost
192.168.10.153 nn1
192.168.10.154 dn1
192.168.10.155 nn2

nn2 / etc / hosts

127.0.0.1       localhost nn2
127.0.1.1       ubuntu

    # The following lines are desirable for IPv6 capable hosts
    ::1     ip6-localhost ip6-loopback
    fe00::0 ip6-localnet
    ff00::0 ip6-mcastprefix
    ff02::1 ip6-allnodes
    ff02::2 ip6-allrouters

core-site.xml (nn1, nn2)

<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.10.153:8020</value>
</property>

<property>
<name>dfs.journalnode.edits.dir</name>
<value>/usr/local/hadoop/hdfs/data/jn</value>
</property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

</configuration>

HDFS-site.xml (nn1, NN2, DN1)

<property>
 <name>dfs.replication</name>
 <value>1</value>
 </property>
 <property>
 <name>dfs.permissions</name>
 <value>false</value>
 </property>
 <property>
 <name>dfs.nameservices</name>
 <value>ha-cluster</value>
 </property>
 <property>
 <name>dfs.ha.namenodes.ha-cluster</name>
 <value>nn1,nn2</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn2</name>
 <value>192.168.10.155:9000</value>
 </property>
 <property>/usr/local/hadoop/hdfs/datanode</value>
 <name>dfs.namenode.http-address.ha-cluster.nn1</name>
 <value>192.168.10.153:50070</value>
 </property>
 <property>
 <name>dfs.namenode.http-address.ha-cluster.nn2</name>
 <value>192.168.10.155:50070</value>
 </property>
 <property>
 <name>dfs.namenode.shared.edits.dir</name>
 <value>qjournal://192.168.10.153:8485;192.168.10.155:8485;192.168.10.154:8485/ha-cluster</value>
 </property>
 <property>
 <name>dfs.client.failover.proxy.provider.ha-cluster</name>
 <value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>
 </property>
 <property>
 <name>dfs.ha.automatic-failover.enabled</name>
 <value>true</value>
 </property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

<property>
 <name>dfs.ha.fencing.methods</name>
 <value>sshfence</value>
 </property>
 <property>
 <name>dfs.ha.fencing.ssh.private-key-files</name>
 <value>/home/ci/.ssh/id_rsa</value></property></configuration>

ЛОГИ:(zkfc nn1,nn2)(namenode nn1,nn2) при остановке nn1 (активный узел) https://pastebin.com/bWvfnanQ

2 ответа

Ваше упоминание <IP>:<port> за fs.defaultFS в core-site.xml для кластера высокой доступности. Таким образом, при закрытии вашего активного namenode, он не знает, куда перенаправить.

Выберите логическое имя для службы имен, например "mycluster".

Затем измените файл hdfs-site.xml, dfs.namenode.http-address.[nameservice ID].[name node ID] - полный HTTP-адрес для каждого NameNode для прослушивания

В вашем случае вы должны дать

ядро-site.xml

<property>
<name>fs.defaultFS</name>
<value>hdfs://myCluster</value>
</property>

HDFS-site.xml

 <property>
 <name>dfs.namenode.rpc-address.myCluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>

Внимательно прочитайте руководство https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

Надеюсь, что это поможет вам.

Вы должны смотреть ограждение для автоматического перехода на другой ресурс

/questions/26551775/namenode-vremya-otrabotki-otkaza/26551799#26551799

https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

Другие вопросы по тегам