闫工的工具箱 · 博客
欢迎来到闫工的技术博客。这里同步更新微信公众号《闫工的算力工具箱》的硬核实战经验。
主要话题:
- 数据中心网络架构与排障(CCIE 视角)
- GPU / AI 算力集群的散热、压测、交付实战
- 自研运维小工具(脚本、自动化、经验沉淀)
如果你也对 GPU 集群运维感兴趣,或者正在为夜间告警头疼,欢迎常来看看。
最近的文章
所有文章 →运维实战
ESXi系统盘重装后虚拟机消失?别慌,三步救回数据盘里的虚拟机
ESXi 系统盘重装后,原本的虚拟机全不见了?别急着格式化数据盘!只要数据盘没被碰过,里面虚拟机文件都还在。挂载快照卷 + 重新注册虚拟机,三步救回全部业务。
算力基建8卡变7卡、93°C还在Throttling:卡没坏,是热到'自我降速'了
凌晨训练任务挂了,8 卡只剩 7 卡,温度 93°C 还带 Throttling——卡没坏,是太热了。从确认告警、风道检查、清灰换硅脂到 vBIOS 更新,完整排查流程,满载压回 80°C。
算力基建GPU全在、驱动正常,训练就是卡死——NVLink悄悄坏了一半
8 卡 A800 训练卡死,显卡全在、驱动正常,可训练就是跑不动。查下来是 GPU 之间的 NVLink 高速通道废了 5 条。改一行配置让服务"带伤上岗",集群满血复活。
运维实战100 台 BMC 改密码,从半天缩到 20 分钟:一个脚本搞定批量改密 + 建监控账号
新机房上架 100 多台服务器,BMC 还是出厂默认密码?逐台登 Web 改要一整天。用 IPMI 写个批量脚本:改密、建监控账号、并发重试、失败清单,100 台 20 分钟跑完。
运维实战服务器红灯告警说硬盘坏了,我没换——结果真救活了
服务器报警说硬盘坏了,监控群里喊换盘。我没换——因为那多半是 RAID 卡误报的「疑似坏盘」标记,盘根本没坏。用 StorCLI 5 分钟平反:先看全局、再查 SMART 和健康日志,逻辑问题一键重建,真有物理坏道才换。别让一块好盘白白被换掉。
算力基建凌晨3点的GPU服务器:一次BMC故障排查全记录
凌晨3点,集群一台8卡GPU节点硬掉线。SSH连不上、ping不通,但BMC还活着。翻SEL发现供电在抖,锁定了坏掉的PSU3,顺带挖出NVIDIA驱动和内核的兼容性雷。不卖工具,卖教训。