运行更高质量的AI模型意味着你现有的GPU必须配备大量显存才能获得流畅体验。对于一位RTX 4080用户来说,运行那些对图形要求最高的游戏或许轻而易举,但要运行大语言模型则是一项艰巨的任务。为了在游戏PC上同时实现这两个目标,一位改装者成功让英伟达(NVIDIA)的特斯拉V100(Tesla V100)在他的系统中工作,但过程中也遇到了一些挑战。

加入特斯拉V100后,这位改装者获得了32GB可用显存,足以以每秒32个词元的速度运行像Qwen 3.6这样性能显著提升的AI模型。
需要说明的是,将特斯拉V100像即插即用设备一样连接到台式机主板是不可能的,这需要用户Tymscar购买一个SXM2转PCIe适配器。他采购这块拥有16GB HBM2显存的GPU及配件共花费了200英镑,约合266美元。在eBay上,这类显卡每块仅需100美元。凭借5,120个CUDA核心和4,096位位宽(提供900GB/s带宽),特斯拉V100仍具备不俗的计算能力。
成功找到一个SXM2转PCIe适配器并非最难的挑战,但也绝不简单,尤其是当你后来发现特斯拉V100没有PCIe插槽、显示输入接口或电源连接器时。对于那些不介意巨大噪音的人来说,将GPU安装到均热板式散热器上或许完全没问题,但它在82分贝(dB)的噪音水平会让任何人感到不适。
通过使用一个9V电池和一个PWM跳线来降低风扇噪音,改装后的V100散热器现在以原始最大转速的10%运行。解决了这个问题后,这位改装者成功将32GB可用显存集成到了他的系统中。没有游戏会需要如此巨大的显存,除非你决定以16K分辨率运行新游戏,因此最好的用途是启动Qwen3.6 27B模型。
这位改装者运行的是经过量化(Q5_K_M级别)的Qwen3.6-27B-MTP模型,该模型占用19GB显存。在128K词元的上下文长度下,有足够的显存以每秒32个词元的速度运行这个大语言模型。提示处理速度在每秒133到160个词元之间,如果你碰巧在家庭计算用途中遇到上一代的AI GPU,这将是不错的性能。最重要的是,花费不到300美元,你就可以在家运行自己的中小型AI模型,无需任何成本,也无需互联网连接。



