7 天死机统计 — HP Z620 已进入不可用状态
崩溃事件汇总
| 日期 | 0x124 蓝屏 | 硬关机/冻结 | 当日备注 |
|---|---|---|---|
| 6/30 | 0 | 0 | WHEA 内存错误集中爆发 8 次 |
| 7/1 | 2 | 0 | 22:28、22:42 各一次 |
| 7/2 | 1 | 1 | 06:28 蓝屏 + 19:13 硬关机 |
| 7/3 | 0 | 2 | 系统冻结(无 dump) |
| 7/4 | 5 | 0 | 凌晨 + 下午各一波 |
| 7/5 | 2 | 0 | 03:28、06:32 |
| 7/6 | 5 | 0 | 12-15 点 4 小时内 4 次 |
| 7/7 | 1 | 1 | 00:16 蓝屏 + 16:09 硬关机 |
总计:7 天内 16 次 0x124 蓝屏 + 4 次硬关机/系统冻结
所有 dump 100% 都是 0x124 WHEA_UNCORRECTABLE_ERROR
参数 1 =0x10(Machine Check Exception)。这是CPU 硬件级不可恢复错误,100% 确认是硬件问题。
关键发现
1. 趋势在恶化
- 6/30:WHEA 内存错误集中爆发
- 7/1:一天 2 次蓝屏
- 7/4:一天 5 次蓝屏(峰值)
- 7/6:再次 5 次蓝屏
2. 时间段高度集中
蓝屏集中在两个时段:
- 凌晨 01:00-08:00(机器空闲/计划任务时)
- 下午 13:00-15:00(高负载时段)
空闲时段也崩,说明不是过热问题(如果是过热,应该只在高负载时崩)。空闲时也崩 → 内存颗粒在自发放电产生位翻转。
3. WHEA 错误减少但蓝屏没停
7/1-7/2 WHEA 错误明显减少(7/1 只剩 8 条),但蓝屏频率反而增加。这说明CPU MCE 汇报机制(CPU → BIOS → Windows)可能也在退化,但底层硬件错误没停。
紧急建议
⚠️这台机器已经接近不可用状态,数据丢失风险很高。
- 立即备份所有重要数据— 别再拖延,接到外部硬盘或云端
- 不要再做高强度工作(编译、训练、压缩等)— 直接加剧内存退化
- 今晚就做 DIMM 拔插测试— 关电、断电,拔 CPU0-DIMM8,只留 DIMM1,开机观察
- 准备好备用内存— DDR3 ECC RDIMM 16GB 京东/淘宝 100-200 元
- 如果工作紧急— 把数据迁到 C 盘 SSD 上先顶着
你的 7 月初一直在与一台正在死去的机器搏斗
7 月以来的每一次蓝屏都是同一根内存条在加速死亡。到 7/6 已经 4 小时 5 次,再拖下去大概率会遇到写入错误导致文件系统损坏。今晚必须处理。
昨晚已经做的操作:
拆机,重新插了电子硬盘
停掉360,换成火绒
具体见:安装了火绒,插拔了电子硬盘:近几天电脑一直在重启或者死机...实在找不到故障点....希望这两步管用。-CSDN博客
现在开始观察吧