跳过正文

闫工的工具箱 · 博客

欢迎来到闫工的技术博客。这里同步更新微信公众号《闫工的算力工具箱》的硬核实战经验。

主要话题:

  • 数据中心网络架构与排障(CCIE 视角)
  • GPU / AI 算力集群的散热、压测、交付实战
  • 自研运维小工具(脚本、自动化、经验沉淀)

如果你也对 GPU 集群运维感兴趣,或者正在为夜间告警头疼,欢迎常来看看。

最近的文章

所有文章 →
运维实战

ESXi系统盘重装后虚拟机消失?别慌,三步救回数据盘里的虚拟机

ESXi 系统盘重装后,原本的虚拟机全不见了?别急着格式化数据盘!只要数据盘没被碰过,里面虚拟机文件都还在。挂载快照卷 + 重新注册虚拟机,三步救回全部业务。

📅 2026-08-30 ⏱ 5 分钟
#ESXi#虚拟化#数据恢复
算力基建

8卡变7卡、93°C还在Throttling:卡没坏,是热到'自我降速'了

凌晨训练任务挂了,8 卡只剩 7 卡,温度 93°C 还带 Throttling——卡没坏,是太热了。从确认告警、风道检查、清灰换硅脂到 vBIOS 更新,完整排查流程,满载压回 80°C。

📅 2026-08-26 ⏱ 8 分钟
#GPU#运维实战#故障排查
算力基建

GPU全在、驱动正常,训练就是卡死——NVLink悄悄坏了一半

8 卡 A800 训练卡死,显卡全在、驱动正常,可训练就是跑不动。查下来是 GPU 之间的 NVLink 高速通道废了 5 条。改一行配置让服务"带伤上岗",集群满血复活。

📅 2026-08-23 ⏱ 5 分钟
#GPU#NVLink#故障排查
运维实战

100 台 BMC 改密码,从半天缩到 20 分钟:一个脚本搞定批量改密 + 建监控账号

新机房上架 100 多台服务器,BMC 还是出厂默认密码?逐台登 Web 改要一整天。用 IPMI 写个批量脚本:改密、建监控账号、并发重试、失败清单,100 台 20 分钟跑完。

📅 2026-08-21 ⏱ 5 分钟
#BMC#自动化#运维实战
运维实战

服务器红灯告警说硬盘坏了,我没换——结果真救活了

服务器报警说硬盘坏了,监控群里喊换盘。我没换——因为那多半是 RAID 卡误报的「疑似坏盘」标记,盘根本没坏。用 StorCLI 5 分钟平反:先看全局、再查 SMART 和健康日志,逻辑问题一键重建,真有物理坏道才换。别让一块好盘白白被换掉。

📅 2026-07-31 ⏱ 7 分钟
#RAID#硬盘#故障排查
算力基建

凌晨3点的GPU服务器:一次BMC故障排查全记录

凌晨3点,集群一台8卡GPU节点硬掉线。SSH连不上、ping不通,但BMC还活着。翻SEL发现供电在抖,锁定了坏掉的PSU3,顺带挖出NVIDIA驱动和内核的兼容性雷。不卖工具,卖教训。

📅 2026-07-26 ⏱ 6 分钟
#GPU#BMC#故障排查