一块20B的AI模型跑在配备16GB GDDR7 VRAM的RTX 5070 Ti上毫无压力,但一位用户觉得这个LLM对自己的日常工作流来说太受限了。于是他选择换用35B的模型,为了在不出现性能问题的情况下分担模型负载,他借用了工作站上的128GB DDR4 ECC内存。不幸的是,仅仅运行了90分钟,一条DDR4内存条就神秘死亡,该用户声称并非散热杀死了这条内存。

令人意外的是,该用户只提到了CPU和GPU温度,而第二条DDR4内存在运行35B模型8至9天后开始报错。
在启动Ornith-1.5-35B-A3B之前,Reddit用户Future_Fuel_8425还能轻松把20B的LLM塞进RTX 5070 Ti的显存里,但到了运行复杂数据库任务时,显然只有运行更密集的AI模型才是唯一出路。他用8GB单条凑齐了128GB DDR4 ECC内存,搭好必要硬件后开始运行35B的LLM,90分钟后回到家,发现系统已经崩溃了。
调查后他发现其中一条8GB DDR4内存条已经损坏,将其拔掉后再次运行Ornith-1.5-35B-A3B。至于这位Reddit用户为何偏爱运行这个AI模型,他表示自己很欣赏它带来的质量,而且在RTX 5070 Ti的显存用尽、系统内存开始填补缺口之后,token性能也不会下降。他以为自己可能只是遇到了内存条损坏的情况,这种事太常见了。
不幸的是,在运行该LLM8至9天后,他检查错误日志,意识到自己又要失去一条内存条了,这表明运行较老的DDR4内存并不是应对如此高负载任务的最佳选择。虽然该用户说温度不是问题,但他只提到了CPU和GPU温度,二者从未超过80°C。除了这些内存条的寿命之外,消费级内存本就不是为长时间连续顺序读取而设计的。
当然,你可以尝试在DDR5内存上运行更密集的AI模型,因为它的温度和读取容忍度更高,但我们的直觉是,更高的温度杀死了那条8GB DDR4 ECC内存,并迅速让第二条降级。假设并非如此,那为什么这位Reddit用户没有展示任何内存温度读数呢?寿命、长期压力和气流不足的组合很可能是摧毁这些DDR4内存条的元凶,但在没有完整信息的情况下,我们永远无法得知真相。



