一块20B的AI模型跑在配备16GB GDDR7 VRAM的RTX 5070 Ti上毫无压力,但一位用户觉得这个LLM对自己的日常工作流来说太受限了。于是他选择换用35B的模型,为了在不出现性能问题的情况下分担模型负载,他借用了工作站上的128GB DDR4 ECC内存。不幸的是,仅仅运行了90分钟,一条DDR4内存条就神秘死亡,该用户声称并非散热杀死了这条内存。

DDR4-ECC-memory-running-35B-AI-model.jpeg

令人意外的是,该用户只提到了CPU和GPU温度,而第二条DDR4内存在运行35B模型8至9天后开始报错。

在启动Ornith-1.5-35B-A3B之前,Reddit用户Future_Fuel_8425还能轻松把20B的LLM塞进RTX 5070 Ti的显存里,但到了运行复杂数据库任务时,显然只有运行更密集的AI模型才是唯一出路。他用8GB单条凑齐了128GB DDR4 ECC内存,搭好必要硬件后开始运行35B的LLM,90分钟后回到家,发现系统已经崩溃了。

调查后他发现其中一条8GB DDR4内存条已经损坏,将其拔掉后再次运行Ornith-1.5-35B-A3B。至于这位Reddit用户为何偏爱运行这个AI模型,他表示自己很欣赏它带来的质量,而且在RTX 5070 Ti的显存用尽、系统内存开始填补缺口之后,token性能也不会下降。他以为自己可能只是遇到了内存条损坏的情况,这种事太常见了。

不幸的是,在运行该LLM8至9天后,他检查错误日志,意识到自己又要失去一条内存条了,这表明运行较老的DDR4内存并不是应对如此高负载任务的最佳选择。虽然该用户说温度不是问题,但他只提到了CPU和GPU温度,二者从未超过80°C。除了这些内存条的寿命之外,消费级内存本就不是为长时间连续顺序读取而设计的。

当然,你可以尝试在DDR5内存上运行更密集的AI模型,因为它的温度和读取容忍度更高,但我们的直觉是,更高的温度杀死了那条8GB DDR4 ECC内存,并迅速让第二条降级。假设并非如此,那为什么这位Reddit用户没有展示任何内存温度读数呢?寿命、长期压力和气流不足的组合很可能是摧毁这些DDR4内存条的元凶,但在没有完整信息的情况下,我们永远无法得知真相。


文章标签: #AI模型 #DDR内存 #RTXTi #硬件故障 #数据库
菠萝老师先生

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。