08-08 Linux 与系统运维 SSH 突然无法连接:从网络、端口、服务到密钥认证的系统排查 SSH 失联可能发生在 DNS、路由、防火墙、安全组、sshd 服务、连接数、认证策略或客户端代理任一环节。先根据错误信息判断故障阶段,再逐层排查,比反复更换密钥更有效。 一、先识别客户端错误 ssh -vvv -o ConnectTimeout=8 user@host Connection tim 7 0 0
08-08 Linux 与系统运维 Linux 服务器频繁 OOM:从现场证据、内存泄漏到容量治理 OOM 不是“内存使用率高”这么简单。它表示内核或容器在满足内存分配请求时无法继续,只能选择进程终止。处理 OOM 的关键是区分宿主机 OOM、cgroup OOM、应用主动退出和 Kubernetes OOMKilled。 一、确认是否真的发生 OOM journalctl -k --since 8 0 0
08-08 Linux 与系统运维 磁盘还有空间却提示 No space left on device:inode、删除未释放与配额排查 df -h 明明显示还有剩余空间,应用却报 No space left on device,原因通常不在磁盘容量本身,而是 inode 耗尽、文件被删除后仍被进程占用、用户配额、只读文件系统或容器存储层异常。 一、先确认容量和 inode df -hT df -i findmnt -T /path/ 7 0 0
08-08 Linux 与系统运维 Linux 服务器负载突然升高:从现象、定位到止血的完整排查流程 生产环境收到 CPU 或 Load Average 告警时,最忌讳直接重启。负载升高不一定等于 CPU 使用率高:大量不可中断 I/O、锁等待和僵死任务同样会推高负载。正确做法是先确认影响,再保存现场,最后按 CPU、内存、I/O、进程和外部依赖逐层定位。 一、先判断业务影响 接口延迟和错误率是否升 7 0 0
07-25 Linux 与系统运维 Linux 服务管理:Systemd、日志、Supervisord 与可靠启停 现代 Linux 服务优先由 systemd 管理。Supervisord 适合管理部分前台进程,但不应与 systemd 重复托管同一个服务。 ## Systemd 常用操作 ```bash systemctl status app.service systemctl start app.serv 14 0 0