Hadoop 在 Debian 上“慢”通常不是 Debian 本身的问题,而是环境、配置或资源使用方式导致的。下面按常见原因分类说明,并给出排查/优化建议。
Hadoop 对磁盘 I/O 非常敏感。
表现
解决
dfs.datanode.data.dir 指向多个磁盘Debian 默认 Java 可能是 OpenJDK,且 Hadoop 默认堆内存偏小。
典型问题
检查
jstat -gcutil <pid> 1000
优化
HADOOP_HEAPSIZE=4096
或
export HADOOP_OPTS="-Xms2g -Xmx4g"
Hadoop 严重依赖 hostname 解析。
问题
/etc/hosts 配置不对表现
解决
hostname
hostname -f
/etc/hosts 示例:
127.0.0.1 localhost
192.168.1.10 master
192.168.1.11 node1
并禁用 IPv6(如不需要):
sysctl -w net.ipv6.conf.all.disable_ipv6=1
Debian 默认偏“通用”。
建议
ext4 或 xfsdefaults,noatime,nodiratime
dfs.replication=3
单机或测试环境会非常慢。
测试环境建议
dfs.replication=1
yarn.nodemanager.resource.memory-mb
yarn.scheduler.maximum-allocation-mb
问题
查看
yarn node -list
HDFS 不适合小文件。
表现
解决
Hadoop 对 Java 版本敏感。
推荐
java -version
Debian 默认可能启用 swap。
解决
sysctl vm.swappiness=10
# 磁盘
iostat -x 1
# 内存
free -h
# CPU
top
# Hadoop 日志
tail -f $HADOOP_HOME/logs/*.log
你可以告诉我:
我可以给你针对性配置示例。