个人服务器的日常运维清单:磁盘、内存、服务、安全

750 字
4 分钟
个人服务器的日常运维清单:磁盘、内存、服务、安全

一台个人服务器,上面跑着几个业务服务和 Docker 容器。系统盘只有几十 G,某天构建一个东西把盘打满,所有服务一起卡死。运维的核心不是”出事才修”,是定期检查 + 预判红线

日常检查四件套#

Terminal window
# 1. 磁盘空间(系统盘是红线,数据盘才是大仓库)
df -h /
# 2. 内存(历史上有过突发尖峰挂死)
free -h
# 3. 常驻服务健康
systemctl list-units --state=running | grep -E "nginx|sshd|docker"
# 4. Docker 容器
docker ps

三条用挂一次换来的教训#

教训一:系统盘有红线,大东西放数据盘。 系统盘空间有限(几十 G),任何大于几 G 的操作(构建镜像、装大数据集、日志堆积)都可能打满。大项目必须放到数据盘(几百 G)。构建大东西之前先 df -h,别赌。

教训二:重启验证。 改文件、改路径、迁移数据后,立刻 systemctl restart 验证一次。运行正常 ≠ 重启后正常——有些 bug 只在冷启动时暴露,长期运行的进程会把它藏起来。

教训三:uptime 会隐藏 bug。 一个服务跑了 200 天没出过事,不代表它”健康”,只代表”还没触发那个 bug”。定期滚动重启、定期做状态巡检,让隐藏问题提前暴露。

常驻服务清单(可审计)#

每个常驻服务都应该有:systemd 管理 + 开机自启 + 归属说明

服务类型说明
网关入口systemd所有流量的入口
API 管理DockerLLM API 统一管理
容器运行时systemd容器基础设施(有独立纪律
代理网关systemd网络代理

核心纪律:基础设施容器绝不能随意重启——重启容器运行时会杀掉所有容器,等于一次全站停机。要重启某个容器,用 docker restart <容器名>

安全规则#

  1. SSH 端口暴露公网:公网端口每天被大量扫描,靠强密码 + 云安全组兜底
  2. 关闭不必要的注册 / 开放:开源服务默认开着注册就有人来白嫖资源,第一时间关
  3. 本机不放多余的防火墙:云安全组管入口,本机别叠一堆规则增加复杂度
  4. 对外不裸露真实地址:前端 / 给外部看的链接不带服务器真实 IP

清理动作#

Terminal window
# Docker 无用资源
docker system prune -f
# 系统日志(保留 3 天)
journalctl --vacuum-time=3d
# 包管理器缓存
# (pip 等按实际清理)

日志和缓存是磁盘的隐形杀手,定期清理比扩容便宜得多。

结论#

个人服务器运维就三句话:

红线提前设,检查定期做,重启勤验证。

系统盘容量、内存尖峰、日志堆积都是”慢性病”,等它爆发那天就是全站卡死。每天花 30 秒跑一遍四件套,比出事修一晚上划算。

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!

打赏
个人服务器的日常运维清单:磁盘、内存、服务、安全
https://heaven-1314.github.io/posts/server-ops-checklist/
作者
赵培州
发布于
2026-08-05
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
赵培州
AI 应用研发工程师 · 用 Agent 做默认交付
公告
记录 AI 应用落地实践与踩坑经验,欢迎交流。
分类
标签
最新动态
站点统计
文章
32
分类
9
标签
81
总字数
41,808
运行时长
0
最后活动
0 天前
站点信息
构建平台
GitHub Actions
博客版本
Firefly v6.15.6
文章许可
CC BY-NC-SA 4.0