5090显卡Xid79错误排查报告
RTX 5090 高负载黑屏与 Xid 79 系统排查手册
最后更新:2026-07-15
适用机器:
- GPU:技嘉 RTX 5090
- CPU:AMD Ryzen 9 9950X
- 主板:华硕 TUF GAMING X870E-PLUS WIFI7
- 电源:安钛克 NE 1300 金牌,ATX 3.0,原生 12V-2x6
- 系统:Ubuntu 24.04.4 LTS
- 当前驱动:NVIDIA 580.126.20 open kernel module + GSP
1. 当前结论
当前已经完成驱动版本和受控功率负载对照。现有证据不支持继续把驱动版本作为第一嫌疑,应把排查重点放在:
- 12V-2x6 插头、原装线材和 PSU 供电路径。
- RTX 5090 本体,包括板上 VRM、GDDR7、PCIe 控制器和其他未暴露温度传感器的部件。
- PCIe Gen5 链路、显卡插槽、显卡下垂和主板 BIOS。
- 机箱内显卡与主板之间的局部热区和整体风道。
- NVIDIA 驱动与图形显示路径,当前降为次要方向,但不能在逻辑上完全排除。
当前已经在 450W 复现 Xid 79,立即停止 500W、550W 和 600W 测试,也不要继续用完整 SmokeSeg 训练复现。重启后应先把功率限制恢复为 400W,再保存证据、断电检查连接和散热、更新稳定版 BIOS、做 PCIe Gen4 对照,最后进行双向交叉换卡。
1.1 已有证据
- 32/32 线程 CPU-only 压力测试持续 600 秒,CPU 达到 100% 使用率,所有 worker 正常退出。
- CPU 测试峰值温度为:
- Tctl:85.9°C
- Tccd1:88.1°C
- Tccd2:85.2°C
- CPU 测试未复现黑屏、死机或重启。
- CPU 测试日志位于:
- work_dirs/diagnostics/cpu_only_stress_20260715_111025.log
- 发生训练黑屏的上一启动周期中,内核明确记录:
- Xid 79: GPU has fallen off the bus
- GPU lost from the bus [NV_ERR_GPU_IS_LOST]
- Xid 154: Node Reboot Required
- 多个 GSP RPC 清理失败
- NVIDIA 580.126.20 已完成干净安装,当前没有 590/595 分支包混装;DKMS 已为 6.17.0-35 和 6.17.0-40 两个内核构建。
- 确定性的 GPU-only FP16 GEMM 在 400W 下:
- 60 秒冒烟测试通过,退出码为 0。
- 第一次 300 秒测试通过,平均功耗 399.8W,峰值 402.8W,最高 70°C,平均利用率 96%。
- 第二次 300 秒测试通过,平均功耗 399.9W,峰值 402.8W,最高 70°C,平均利用率 97%。
- 相同工具、相同矩阵和相同软件环境仅把功率限制改为 450W 后:
- 从 GPU 负载开始约 201.6 秒后失败,工具记录
CUDA error: unspecified launch failure,退出码为 5。 - 失败前实际平均功耗 424.1W、1 秒采样峰值 438.9W、最高温度 70°C、平均利用率 97%。
- 内核在 2026-07-15 16:37:36 记录
Xid 79: GPU has fallen off the bus,随后记录 Xid 154 和必须重启恢复。 - 日志中没有在 Xid 79 之前出现明确的 AER 错误;这不能排除 PCIe 链路故障。
- 从 GPU 负载开始约 201.6 秒后失败,工具记录
- 595.71.05 与 580.126.20 均出现过同型 Xid 79;用户历史上使用 590 时也只能确认 400W 稳定,不能证明其在更高功率稳定。
因此,CPU、SmokeSeg 数据管线、BD 代码、显存容量和 GPU 核心过热都已显著降级为低优先级。当前最强证据是可重复的功率相关性:400W 稳定,而允许更高功率后 GPU 从 PCIe 总线上失联。1 秒 nvidia-smi 采样会漏掉瞬时尖峰,不能把 438.9W 当成精确电气故障阈值。
NVIDIA 官方对 Xid 79 的解释是:驱动尝试通过 PCIe 访问 GPU 时,GPU 已不可访问;常见方向包括 PCIe 链路、硬件连接、GPU 故障,也不能完全排除驱动问题:
- https://docs.nvidia.com/deploy/xid-errors/archive/index.html
- https://docs.nvidia.com/deploy/gpu-debug-guidelines/
日志中的 pid/name=cursor 只表示 Cursor 恰好是发现 GPU 已经失联的客户端,不能据此认定 Cursor 是故障原因。GPU 失去驱动控制后风扇进入高转速保护状态,也不等于单纯过热。
1.2 当前平台快照
- GPU 重启后当前运行在 PCIe Gen5 x16,32.0 GT/s。
- GPU 默认及最大功率限制为 600W,最小可设功率为 400W。
- GPU VBIOS:98.02.2E.80.39。
- 主板 BIOS:0208,日期 2025-04-24。
- 当前 Linux 内核:6.17.0-40-generic。
- 当前 NVIDIA 驱动:580.126.20-open,纯 580 包栈并由 580.126.20 pin 包锁定。
- 已验证故障点:450W 功率限制下约 201.6 秒出现 Xid 79。
- 当前安全基线:每次重启后先手动设回 400W;功率限制可能在重启后恢复为 600W。
- 当前图形桌面的 Xorg、GNOME Shell 和 Cursor 均使用 RTX 5090。
以上只是 2026-07-15 的诊断快照。以后继续排查前,应重新采集并记录,避免软件升级后混淆结果。
2. 排查原则
2.1 最终目标
最终目标是在显卡默认 600W 条件下稳定运行,而不是长期依靠 400W 限功率掩盖故障。
400W 在排查期间仍然有价值:
- 作为已知安全基线。
- 用于确认系统和测试工具可以正常运行。
- 用于建立故障功率阈值。
2.2 操作原则
- 除了必要的安全处理,一次只改变一个变量。
- 每一步都记录时间、硬件设置、软件版本和结果。
- 优先运行短时间、确定性的 GPU-only 测试,不直接启动完整实验队列。
- 测试 600W 前必须确保 SSH 可用,最好让显示器由 9950X 核显驱动。
- 一次通过不能作为结论;关键条件至少重复 2~3 次。
- 一旦出现 Xid 79、烧焦味、接口变色、熔化或异常高温,立即停止继续加压。
3. 安全检查
在重新插拔显卡供电线或显卡前:
- 正常关机。
- 关闭 PSU 后部开关。
- 拔掉交流电源线。
- 等待残余电量释放。
- 不熟悉拆装时,请师姐、师兄或熟悉装机的人现场协助。
禁止事项:
- 不要带电插拔 12V-2x6。
- 不要拆开 PSU 外壳。
- 不要把另一台模块化电源的线接到本机 PSU。
- 不要因为接口难插而强行扭曲、斜插。
- 不要使用来源不明的延长线、转接线或 90 度转接器。
NVIDIA 官方线材说明:
4. 第一阶段:不拆机比较两台电脑
目标:确认“配置一样”是否真的包括 BIOS、VBIOS、驱动、内核和功率限制。
在本机和师姐电脑上分别执行:
1 | uname -r |
填写对照表:
| 项目 | 本机 | 师姐电脑 | 是否一致 |
|---|---|---|---|
| RTX 5090 完整型号 | nvidia-smi 仅显示 GeForce RTX 5090,需查技嘉具体子型号 |
nvidia-smi 仅显示 GeForce RTX 5090,需查具体子型号 |
待确认 |
| GPU VBIOS | 98.02.2E.80.39 | 98.02.2E.00.D4 | 不一致 |
| 主板 BIOS | 0208 | ||
| Linux 内核 | 6.17.0-40 | 6.17.0-35 | 不一致 |
| NVIDIA 驱动 | 580.126.20-open | 580.126.18-open | 同分支、构建号不同 |
| 默认/最大功率 | 600W / 600W | 600W / 600W | 一致 |
| PSU 完整型号及批次 | |||
| 12V-2x6 线材 | 原装 | ||
| 插座、排插或 UPS |
重点检查:
- 两张卡是否真的是同一具体子型号。
- VBIOS 是否相同。
- 师姐主板 BIOS 是否明显更新。
- 师姐使用的是否是另一个 NVIDIA 驱动或内核。
- 两台电脑是否使用不同插座、排插或 UPS。
当前截图已经证明两张卡的 VBIOS 不同,因此“硬件一样”尚不能视为严格成立。不要把师姐机器的稳定性直接归因于 580 驱动;应继续核对显卡背面标签、技嘉具体 SKU/Revision、VBIOS、PSU 和主板 BIOS。任何 VBIOS 更新都必须匹配本机精确 SKU 和 Revision,不得刷入师姐显卡的 VBIOS 文件。
5. 第二阶段:检查供电和安装
这一阶段比直接交叉换卡工作量小,而且直接针对 Xid 79 和功率相关性。
由熟悉装机的人协助检查:
- [ ] GPU 侧 12V-2x6 完全插到底。
- [ ] 卡扣已经锁紧,没有肉眼可见的缝隙。
- [ ] 如果 PSU 侧是模块化接口,PSU 侧也完全插紧。
- [ ] 使用该 PSU 自带的原装线材。
- [ ] 没有延长线、转接头或第三方 90 度转接器。
- [ ] 接口附近没有急弯,也没有被机箱侧板强压。
- [ ] 插头和插座没有发黄、变色、熔化、焦味或针脚异常。
- [ ] 显卡 PCIe 金手指完全进入主板插槽。
- [ ] 显卡挡板螺丝没有将显卡拉歪。
- [ ] 显卡支架有效,显卡没有明显下垂。
- [ ] 主板插槽和显卡周围没有异物。
- [ ] 显卡与主板之间没有被线材或其他部件堵成明显的风道死角。
- [ ] 机箱进风、出风和主板附近风扇在负载时确实升速。
如果发现变色、熔化或烧焦味,不要再次开机,应直接联系显卡、电源或整机售后。
GPU 核心只有 70°C 不能排除局部热问题。Linux 下可能看不到 GDDR7 结温、显卡背面 VRM、GPU PCIe 控制器或主板局部热区。完成插头和接口安全检查后,可以把“打开侧板并用外部风扇增强整体风道”作为一次有明确边界的热对照;它只用于判断方向,不能作为长期修复,也不要在通电状态下触碰或晃动线材。
还应进行一次低成本交流供电对照:
- 使用已知正常、容量合适的墙上插座或高质量排插。
- 暂时绕开来源不明的排插或 UPS。
- 不要与大功率设备共用明显过载的插座。
1300W 额定功率在规格上足够,并不能排除电源个体故障、线材问题、接触不良或瞬态响应异常。
6. 第三阶段:让 RTX 5090 脱离图形桌面
关闭 Linux 图形界面有诊断价值,但它不是修复方案。它要回答的问题是:
RTX 5090 只做 CUDA 计算时,是否仍然出现相同的 Xid 79?
6.1 推荐方案:使用 9950X 核显
- 将显示器连接到主板 HDMI 或 DP。
- 在 BIOS 中启用集成显卡,并将其设置为主要显示设备。
- 启动系统。
- 执行 nvidia-smi。
- 确认进程列表中没有 Xorg、GNOME Shell、Cursor 等图形进程占用 RTX 5090。
这比单纯关闭图形界面更有价值:即使 5090 再次掉线,核显和 SSH 仍有机会保留系统控制权。
6.2 备选方案:临时进入纯命令行模式
先从另一台电脑测试 SSH 登录,并在 tmux 中操作。不要直接在即将被关闭的 GNOME Terminal 中启动测试。
临时关闭图形界面:
1 | sudo systemctl isolate multi-user.target |
确认 nvidia-smi 中已经没有 Xorg、GNOME Shell、Cursor 等图形进程。
测试完成后恢复:
1 | sudo systemctl isolate graphical.target |
此阶段不要永久修改默认启动目标,即暂时不要执行:
1 | systemctl set-default multi-user.target |
7. 第四阶段:建立持久监控
至少使用两个 SSH/tmux 窗口。
7.1 内核日志
1 | sudo journalctl -kf -o short-precise |
7.2 GPU 遥测
1 | mkdir -p work_dirs/diagnostics/rtx5090 |
如果发生物理重启,重新开机后立即提取上一启动周期:
1 | sudo journalctl -b -1 -k -o short-precise \ |
发生 Xid 79 后,应在重启并恢复到 400W 安全功率后保存完整证据:
1 | mkdir -p work_dirs/diagnostics/rtx5090/580_450_failure |
nvidia-bug-report.sh 可能自动在文件名后添加 .gz。提交售后前应检查报告中是否包含用户名、路径等不希望公开的信息。
7.3 如何解释黑屏时的系统状态
| 现象 | 解释方向 |
|---|---|
| 显示器黑屏,但 SSH 仍能登录 | GPU 或显示路径掉线,系统主体可能仍存活 |
| SSH 同时断开,整机死机或重启 | 更关注 PSU 保护、主板、PCIe 或整机供电 |
| 出现 Xid 79 和 Xid 154 | GPU 已经从 PCIe 总线失联,需要重启 |
| 只有应用异常退出,没有 Xid | 再检查 CUDA、PyTorch、显存和训练代码 |
8. 第五阶段:GPU-only 功率阶梯测试
不要先跑完整 SmokeSeg/BD 队列。应使用同一个确定性的 GPU-only 负载,排除数据加载、训练代码和 CPU 负载的干扰。
说明:
- tools/stress_cpu_only.py 不能用于本阶段。
- 本仓库已提供 tools/stress_gpu_only.py;使用确定性的 CUDA GEMM 作为负载。
- 该工具支持固定时长、预热、温度保护、每秒 NVIDIA 遥测、持久化日志和异常退出码。
- 该工具只读取当前功率上限,不会自行修改功率限制。
先从 400W 开始,不要直接测试 600W:
1 | sudo nvidia-smi -pm 1 |
默认日志写入 work_dirs/diagnostics/:同名 .log 是逐秒状态,.csv 是功耗、温度、利用率、频率和显存遥测。每行都会立即刷新到磁盘;如果黑屏或重启,恢复后先查看时间最新的两个文件。--expected-power-limit 会在档位不匹配时拒绝启动,防止误在 600W 下压测。
退出码:
| 退出码 | 含义 |
|---|---|
| 0 | 完整通过 |
| 2 | 参数或启动前检查失败,GPU 负载没有开始 |
| 3 | 达到温度上限,已主动停止 |
| 4 | 压测期间 nvidia-smi 遥测失败 |
| 5 | CUDA 负载失败、显存不足或结果出现非有限值 |
| 130 / 143 | Ctrl+C / SIGTERM 中止 |
本机已经完成首次功率阶梯并在 450W 复现 Xid 79。因此当前不再继续寻找 425W/450W 之间的精确阈值,也不测试 500W、550W 或 600W。只有完成物理检查或单一变量修正后,才在 400W 重新建立基线,并只回到已知失败档 450W 验证该修正是否有效。
建议阶梯:
| 阶段 | 功率限制 | 单次时长 | 建议重复次数 | 结果 |
|---|---|---|---|---|
| 工具冒烟 | 400W | 60 秒 | 1 | 通过,退出码 0,峰值 400.1W,最高 69°C |
| 基线 | 400W | 5 分钟 | 2 | 两次均通过,退出码 0,峰值均为 402.8W,最高均为 70°C |
| 已知失败档 | 450W | 计划 5 分钟 | 1 | 约 201.6 秒失败,退出码 5,Xid 79/154,采样峰值 438.9W,最高 70°C |
| 更高档 | 500W | 不执行 | 0 | 因 450W 已失败而停止 |
| 更高档 | 550W | 不执行 | 0 | 因 450W 已失败而停止 |
| 默认上限 | 600W | 不执行 | 0 | 因 450W 已失败而停止 |
对应日志:
work_dirs/diagnostics/gpu_only_stress_20260715_160722.logwork_dirs/diagnostics/gpu_only_stress_20260715_161049.logwork_dirs/diagnostics/gpu_only_stress_20260715_162019.logwork_dirs/diagnostics/gpu_only_stress_20260715_163402.log
设置功率限制:
1 | sudo nvidia-smi -pl 400 |
完成某项纠正措施后,如果要重新验证 450W,必须同时保留 --expected-power-limit 450,并确保 SSH、日志、核显显示或纯命令行环境已准备好。一次再次出现 Xid 79 就立即停止,不再重复该档位。
每个功率档位都应记录:
- 实际最高 power.draw。
- GPU 最高温度。
- GPU 利用率。
- 是否出现 Xid。
- SSH 是否仍可用。
- 是否需要物理重启。
- 第几秒发生故障。
一旦某档位出现 Xid 79,不再继续更高档位。
8.1 无图形界面的判定
| 测试结果 | 结论倾向 |
|---|---|
| 无图形界面仍复现相同 Xid 79 | 基本排除桌面环境,继续查供电、GPU、PCIe、BIOS |
| 无图形界面多次通过,开启桌面后稳定复现 | 驱动/显示路径或 5090 同时承担显示与计算的问题 |
| 400W 稳定,某个更高档位稳定失败 | 存在清晰功率阈值,关注 GPU、线材、PSU 和高负载链路 |
| 各功率档位都通过 | 再使用相同环境短跑 SmokeSeg,检查是否为特定训练路径触发 |
一次无图形界面通过不能排除图形路径问题,关键档位至少重复 2~3 次。
9. 第六阶段:更新主板 BIOS
当前 BIOS 0208 较旧。华硕官方页面在 2026-07-15 可见:
- 稳定版 2306,发布日期 2026-06-17。
- 稳定版 2306 使用 AGESA ComboAM5 PI 1.3.0.1b。
- 测试版 2401,发布日期 2026-06-26,使用 1.3.0.1b Patch A。
官方页面:
建议:
- 记录或拍照保存当前 BIOS 设置。
- 下载稳定版 2306,不使用测试版 2401。
- 在供电稳定、系统空闲状态下使用华硕官方方法升级。
- 升级后加载默认设置。
- 暂时保持 PBO、Curve Optimizer、EXPO/内存超频关闭或 Auto。
- 先保持 PCIe Auto/Gen5。
- 驱动保持 580.126.20 不变,避免同时更换多个变量。
- 重启后立即把功率限制设为 400W,先完成一次 300 秒基线。
- 400W 通过后,只回到已知失败档 450W 做一次验证;不要直接测试 500W 或 600W。
注意:部分新版 BIOS 可能限制回退。升级前必须阅读华硕页面的版本说明。社区中存在“更新 BIOS 后改变 Xid 79 频率”的报告,但也有发帖者后续撤回单一 BIOS 根因判断并转向局部散热;因此 2306 是合理的固件对照,不是承诺能够修复。
10. 第七阶段:驱动版本对照(已完成)
当前不再继续更换驱动:
- 595.71.05 下已经记录过 Xid 79、GPU lost、Xid 154 和 GSP RPC 清理失败。
- 580.126.20 下使用独立 GPU-only 工具在 450W 再次记录同型 Xid 79 和 Xid 154。
- 当前所有 NVIDIA 分支包、
nvidia-settings、固件和 DKMS 均为 580.126.20,不存在旧分支混装。 - 400W 稳定、允许更高功率后失败的规律跨越了驱动版本,驱动特定回归的优先级已经明显下降。
继续排查期间保留 580 pin:
1 | apt-cache policy nvidia-driver-580-open nvidia-dkms-580-open \ |
除非以后获得 NVIDIA 明确针对该签名的修复说明,或者硬件/PCIe/BIOS 对照全部排除,否则不再通过安装 590、595、610 或切换开源/闭源内核模块来反复试错。
11. 第八阶段:固定 PCIe Gen4 对照
如果完成供电检查和 BIOS 2306 更新后,PCIe Gen5 在 450W 仍出现 Xid 79:
- 在 BIOS 中把显卡主插槽从 Auto/Gen5 固定为 Gen4 x16。
- 其他条件保持不变。
- 启动后用
current_link_speed和current_link_width确认已经是 Gen4 x16。 - 先运行一次 400W、300 秒基线。
- 400W 通过后只测试一次 450W;再次出现 Xid 79 就停止。
1 | cat /sys/bus/pci/devices/0000:01:00.0/current_link_speed |
判定:
| 结果 | 结论倾向 |
|---|---|
| Gen4 稳定、Gen5 失败 | PCIe Gen5 信号完整性、主板 BIOS/插槽或 GPU PCIe 接口 |
| Gen4 和 Gen5 都在高功率失败 | 更关注 GPU 本体、12V-2x6、PSU |
| Gen4 和 Gen5 都稳定 | 再检查图形桌面和特定 SmokeSeg 训练路径 |
Gen4 是诊断手段,不代表最终必须长期使用 Gen4。
不要在这一阶段盲目加入 pcie_aspm=off、pci=nommconf 等内核参数;这些参数会同时改变多个行为,并可能掩盖真正的问题。
12. 第九阶段:交叉换卡
只有前面的低成本排查仍无法定位时,才进行交叉换卡。由熟悉装机的人协助。
最有价值的是双向矩阵:
- 把本机 RTX 5090 装到师姐电脑,使用师姐电脑自己的 PSU 和原装线。
- 把师姐已知正常的 RTX 5090 装到本机,使用本机自己的 PSU 和原装线。
- 两边先以 400W 建立基线,再使用已知失败档 450W、相同 GPU-only 负载和相同时长。
- 不需要在交叉测试中直接使用 600W;450W 已足以区分本机已知故障。
| 结果 | 结论倾向 |
|---|---|
| 本机显卡在师姐电脑也失败;师姐显卡在本机正常 | 本机 RTX 5090 本体,优先联系技嘉售后 |
| 本机显卡在师姐电脑正常;师姐显卡在本机也失败 | 本机 PSU、供电线、主板或 PCIe 插槽 |
| 两张卡都只在本机 450W 失败 | 本机供电或主板平台 |
| 重新插线或升级 BIOS 后两张卡均正常 | 原连接或固件兼容性问题 |
只做“本机显卡装到师姐电脑”的单向测试也有价值,但结论不如双向矩阵完整。
再次强调:任何情况下都不要在两台模块化电源之间混用 PSU 线材。
13. 故障分支与下一步
13.1 供电或接口方向
满足以下任一条件时,优先检查/替换整套 PSU 与其原装线:
- 故障功率阈值非常稳定。
- 两张已知正常显卡都只在本机失败。
- 更换墙上插座没有改善。
- PCIe Gen4/Gen5 都失败。
- 显卡在另一台机器稳定。
如果要测试另一只 PSU,应更换“完整 PSU + 该 PSU 自己的原装线”,不能只换 PSU 而继续使用旧模块线。
13.2 GPU 本体方向
满足以下组合时,应准备显卡 RMA:
- 本机显卡在另一台已知正常机器也复现。
- 另一张已知正常显卡在本机通过。
- BIOS、驱动、PCIe Gen4/Gen5 和线材检查都不能解决。
- 450W 已稳定复现 Xid 79,而 400W 多次稳定。
13.3 主板或 PCIe 方向
满足以下条件时,优先联系主板售后或继续检查插槽:
- Gen4 稳定而 Gen5 稳定失败。
- 两张显卡都只在本机 Gen5 失败。
- 更新 BIOS 后现象发生明显变化。
13.4 驱动或显示路径方向
满足以下条件时,继续排查驱动/桌面组合:
- 5090 作为纯计算卡时多次通过。
- 让 Xorg/GNOME 使用 5090 后可以稳定复现。
- 切换驱动版本后现象随驱动版本变化。
此时可以长期让核显负责桌面、5090 专用于 CUDA,作为进一步验证;但仍应确认默认 600W 计算负载本身稳定。
13.5 局部散热方向
GPU 核心温度正常时,满足以下现象仍应检查局部散热:
- 故障只在持续负载数分钟后出现。
- 打开侧板并增强机箱整体风道后,故障时间明显延后或不再复现。
- 显卡体积遮挡主板、芯片组、M.2、VRM 或 CPU/内存控制器附近风道。
- Linux 无法读取 GDDR7 结温、显卡背板 VRM 或 PCIe 控制器温度。
外部风扇/开侧板只能作为一次变量对照。如果它改善稳定性,应重新规划进出风和风扇曲线,而不是长期敞开机箱;如果没有改善,就回到 Gen4 和交叉换卡,不继续盲目增加风扇转速。
14. 恢复稳定的验收标准
不能因为一次 5 分钟测试通过就宣布解决。建议满足:
- [ ] 600W GPU-only 测试连续通过至少 3 次。
- [ ] 每次均达到高 GPU 利用率和足够高的实际功耗。
- [ ] 内核没有 Xid、AER 或 GSP 致命错误。
- [ ] SSH、桌面和系统响应正常。
- [ ] 开启图形桌面后再连续通过至少 2 次。
- [ ] SmokeSeg 训练短跑通过。
- [ ] SmokeSeg 完整训练至少通过一个原先容易复现故障的阶段。
- [ ] 12V-2x6 接口没有异常气味、变色或物理松动。
只有仍依靠 400W 才能稳定,不算根因已经解决。
15. 售后证据包
如果最终需要联系技嘉、安钛克或华硕,建议整理:
- 完整硬件型号、序列号和购买信息。
- 主板 BIOS、GPU VBIOS、驱动、内核版本。
- 400W 两次稳定、450W 约 201.6 秒失败的受控测试表。
- Xid 79、Xid 154 和 GSP 错误日志。
- nvidia-bug-report.log.gz。
- GPU 遥测 CSV。
- 12V-2x6 接口和线材清晰照片。
- Gen4/Gen5 对照结果。
- 两台电脑双向换卡结果。
- PSU 或插座对照结果。
这些证据可以明确区分 GPU、PSU/线材、主板/PCIe 和驱动问题,避免售后只建议“重装系统”或“降低功率”。
16. 相关社区讨论与使用方式
以下讨论与本机症状相似,但都只是个案旁证,不能覆盖本机受控实验:
- NVIDIA Developer Forums:Gigabyte RTX 5090、AM5/X870、Ubuntu、持续 CUDA 负载下出现 Xid 79。发帖者测试 580、595-open、595-closed、不同内核和显示服务器后仍会复现;最初怀疑 BIOS/AGESA,后续长期测试转而认为机箱/主板局部风道是关键变量,增强风道后稳定。
- NVIDIA Developer Forums:另一台 RTX 5090 在 590 和 595 上都记录 Xid 79/GSP timeout,说明跨驱动复现并非本机独有;但该用户在 400W 也会失败,与本机“400W 稳定、450W 失败”并不相同。
- Reddit LinuxHardware:一台用于 PyTorch 训练的 RTX 5090 在 Xid 79 前出现 PCIe AER/RxErr,用户报告重新安装显卡后改善。这支持检查 PCIe 接触、下垂和插槽,但本机本次故障前没有记录到同样的 AER,因此不能直接套用其结论。
- NVIDIA open-gpu-kernel-modules issue #900:RTX 5090 通过 OCuLink PCIe 4.0 x4 外接链路时,负载下稳定复现 Xid 79。它说明中间链路质量可产生同型症状,但本机是主板 CPU 直连 Gen5 x16,没有 OCuLink,不能直接类比。
使用社区信息时遵循:
- 优先级始终是本机日志和一次一变量实验,高于帖子标题或单次“修好了”。
- 不因为帖子建议就同时加入
pcie_aspm=off、禁用 GSP、修改多个内核参数或刷新未知 VBIOS。 - 社区案例只用于生成候选假设:连接/供电、Gen5、BIOS、局部散热、GPU 本体;每个假设都必须在本机单独验证。
- NVIDIA 官方对 Xid 79 的定义仍是驱动经 PCIe 访问 GPU 时发现 GPU 不可达,常见方向包括 PCIe 链路故障、GPU 硬件故障或驱动问题:
17. 推荐执行顺序摘要
- 每次重启后先把功率上限设回 400W,停止 500W、550W、600W 和完整训练复现。
- 保存 450W 失败的上一启动周期内核日志和
nvidia-bug-report.log.gz。 - 完全断电,由熟悉装机的人检查并重新插紧 12V-2x6 两端和显卡,检查变色、焦味、急弯、下垂和风道死角。
- 使用核显或 SSH,让 RTX 5090 脱离图形桌面;保持 580.126.20 驱动不变。
- 将主板 BIOS 从 0208 更新到正式版 2306,加载默认设置并关闭 EXPO/PBO/Curve Optimizer;Gen5 下先测 400W,再只测一次 450W。
- 如果 Gen5 仍失败,只把插槽固定为 Gen4 x16,重复 400W 基线和一次 450W 对照。
- 如果 Gen4 也失败,进行双向交叉换卡;双方都使用各自 PSU 的原装线,已知失败档使用 450W 即可。
- 如果师姐显卡也只在本机失败,测试“完整替换 PSU + 新 PSU 自己的原装线”;如果本机显卡在师姐电脑也失败,准备技嘉 RMA。
- 只有某项修正已经让 450W 重复稳定,才恢复 500→550→600W 阶梯;任何档位再次出现 Xid 79 都立即停止。
- 根据 Gen4/Gen5、双向换卡和完整 PSU 对照矩阵决定联系技嘉、安钛克或华硕售后。