从架构设计到故障抢险,为您的业务保驾护航
7年运维实战经验,覆盖 Linux/Windows、容器化、数据库、监控、自动化等全栈领域
立即咨询7年运维实战经验,曾主导数十个企业级基础设施项目。
擅长从0到1搭建高可用架构,也擅长在凌晨3点紧急抢险。
技术领域:Linux/Windows运维、K8s/Docker容器化、数据库高可用、自动化运维、监控体系建设。
服务理念:用工程师的严谨,做让人省心的运维。
kubectl describe pod 查看 Events 确认 OOMKilled 或探针失败原因;
2. 使用 kubectl logs --previous 获取上一次崩溃日志;
3. 调整 startupProbe.initialDelaySeconds 至 60s,failureThreshold 改为 5;
4. 同步优化 JVM 启动参数,减少初始化内存峰值;
5. 滚动更新后监控 Pod Ready 状态恢复,业务 SLA 恢复正常。
SHOW SLAVE STATUS\G 确认 Seconds_Behind_Master 飙升;
2. 发现从库磁盘 IO 瓶颈 —— 将 innodb_flush_log_at_trx_commit 从 1 临时调为 2;
3. 开启并行复制:slave_parallel_workers=8,slave_parallel_type=LOGICAL_CLOCK;
4. 临时将部分非核心读流量切回主库分担压力;
5. 事后升级从库 SSD 并启用半同步复制,延迟降至 1s 以内。
INFO memory 确认 used_memory 接近 maxmemory,分析 BigKey 使用 redis-cli --bigkeys;
2. 发现某业务缓存未设置 TTL 且序列化膨胀 —— 紧急清理过期数据并设置 maxmemory-policy allkeys-lru;
3. 横向扩容 Redis 节点,将大 Key 拆分到不同 Slot;
4. 通过 Prometheus + Grafana 配置内存告警阈值(>80% 预警,>90% 紧急),接入 AlertManager 电话告警;
5. 推动业务方接入本地缓存(Caffeine)+ 多级缓存架构,降低 Redis 单点压力。
connect() failed (111: Connection refused);
2. 核对 upstream 配置与后端实际监听端口,发现不一致;
3. 紧急回滚 upstream 配置并 nginx -s reload;
4. 优化 CI/CD 流程:部署脚本增加端口一致性校验,配置中心统一管理 Nginx upstream;
5. 增加 proxy_next_upstream 与主动健康检查模块,故障转移时间从 30s 缩短至 3s。
df -h 确认分区已满,du -sh /* | sort -rh 定位大文件;
2. 紧急清理过期日志,压缩归档 30 天前的 Kafka 日志释放约 15GB;
3. 在线扩容:LVM 场景下 lvextend -L +100G /dev/vg_data/lv_data && resize2fs;
4. 配置 logrotate 策略,Kafka 日志保留 7 天并启用 Snappy 压缩;
5. 部署 Prometheus Node Exporter + 磁盘使用率告警(>85% 预警),实现 5 分钟内感知。
留言将通过服务器直接发送至我的邮箱,无需跳转