英伟达(NVIDIA)笔记本平台上的RTX 5090显卡拥有充足的VRAM,足以在要求最严苛的3A大作中拉满各项画质设置,但一旦运行AI工作负载,这款GPU的24GB显存就完全是另一番考验了。不过,一系列测试显示,它依然能与苹果(Apple)的M5 Max一较高下——在多轮大语言模型(LLM)测试中全面胜出,直到跑分环节启动一个重量级AI模型并联手加长上下文长度(Context Length)为止。

Laptop-RTX-5090-vs-M5-Max.jpeg

上下文长度增加后,M5 Max统一内存架构显著反超RTX 5090

全新雷蛇灵刃18(Razer Blade 18)与苹果最新最强的16英寸MacBook Pro正面交锋,亚历克斯·齐斯金德(Alex Ziskind)对两者进行了各类基准测试,其中就包括AI工作负载。首先登场的是以4比特量化、上下文长度262,144运行的Qwen3 4B,显然RTX 5090的原始图形算力在这里派不上太大用场,因为它几乎用尽了全部24GB显存,最终生成速度仅为每秒25.28个token。作为对比,M5 Max取得了每秒181.40个token的成绩。

不过,当上下文长度缩短至68,014时,大量VRAM从RTX 5090中释放出来,让这块GPU达成了每秒160.36个token的成绩。至于显卡芯片为何仍比M5 Max慢,原因很可能在于两者使用的程序不同——在Windows上运行的是LM Studio,而苹果芯片则使用了MLX。

幸运的是,RTX 5090还没有就此出局,因为这位YouTuber使用llama.cpp跑了一大批大语言模型,例如Gemma 4 12B、Qwen3.5 27B以及Qwen3.6 35B A3B。无论在提示处理还是token生成环节,RTX 5090相比M5 Max都笑到了最后。不过话说回来,别忘了英伟达最快的笔记本GPU,只要还没塞满那24GB显存,它就永远是性能王座上的霸主。

上下文长度一增加,M5 Max就占据明显领先优势

遗憾的是,如果要运行像Qwen3.5 122B这样复杂度极高的模型,RTX 5090绝无可能毫发无损地通过这项测试。反观拥有128GB统一内存的M5 Max,其提示处理速度达到每秒139个token,token生成速度为每秒47.4,同时消耗了94GB内存。如果你想知道英伟达为何急于推出RTX Spark,运行更重的AI模型绝对是一个重要原因。


文章标签: #AI性能 #RTX #MMax #显存容量 #笔记本
菠萝老师先生

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。