英伟达为RTX和DGX平台带来更简化的本地AI能力,并为其GPU添加多项优化。英伟达(NVIDIA)宣布的首项进展是更快速的本地智能体。这一成果源自英伟达与开源llama.cpp和vLLM社区持续合作推进的优化工作。最新测试结果基于AIPerf工具的SpeedBench-Coding 8K吞吐量基准测得,具体数据如下。

从llama.cpp开始,英伟达RTX平台(如GeForce RTX 5090)在Qwen3.6-27B模型上的词元(Token)吞吐量(tok/s)最高提升50%,在Qwen3.6-35B模型上则实现了90%的加速。NVIDIA RTX PRO 6000 Blackwell在vLLM框架下同样表现出色,两款模型的推理速度均提升了至多20%。
此外,英伟达的DGX Spark平台在Qwen3.6-27B的vLLM推理上实现了1.4倍性能增长,在DeepSeek v4 Flash上AI推理性能提升20%。借助这些核级优化,英伟达RTX和DGX平台将获得增强的投机解码技术与更快的预填充速度。在vLLM中,FlashInfer库新增的XQA注意力内核及后端优化,进一步加速了两大平台的本地AI推理。
除提升本地AI速度外,英伟达还通过为Hermes Agent、OpenClaw和Perplexity Computer提供全新的一键式AI支持,让本地AI的使用变得更加简单。这些功能将面向搭载24GB或以上显存英伟达GPU的用户开放。
上个月,Perplexity推出了其Portable Computer智能体,为用户提供了一种在Linux系统(如NVIDIA DGX Spark)上本地运行Perplexity的简便方式。该应用将模型、编排工具和工具链整合为单一应用体验,开箱即用。
今年9月,Perplexity Portable Computer将正式登陆搭载至少24GB显存VRAM、运行Linux或Windows系统的NVIDIA RTXGPU,将同样便捷的部署流程带给更广泛的PC用户。用户可在本地完整运行工作流而无需消耗云端配额,同时可根据需求,选择性地将部分复杂任务升级至云端15余款前沿模型进行深度研究或推理。Portable Computer在向云端发送任何内容前都会征得用户许可,从而确保敏感数据始终保留在本地设备上。
由Nous Research开发的Hermes Agent是一款拥有数百万用户的通用型智能体,以高可靠性和自我改进能力著称。它不依赖特定模型或供应商,专为全天候本地系统运行而设计,因此与RTXPC、RTX PRO工作站及DGX Spark可以说是天然契合。
Hermes即将推出一项新功能:用户在本地配置模型时,可直接在Windows和Linux系统的RTX与DGX平台上实现一键式部署。该智能体将自动识别NVIDIAGPU、选择合适的模型和配置,并通过已集成英伟达推理优化的llama.cpp运行,彻底省去手动下载和调优模型的繁琐步骤。
一旦运行起来,Hermes便能像在其他环境中一样正常工作。它能够使用各类工具、跨任务保持上下文连贯、在会话之间记忆信息,并随着时间积累沉淀出可复用的技能,使智能体在使用中不断变得更加强大。在本地GPU上运行模型,既能确保持续的高性能表现,又能将数据安全地保留在本地系统内。一键式本地模型设置功能即将上线,欢迎了解更多Hermes Agent信息。
OpenClaw已成为开放智能体运动中最具标志性的项目之一——它是GitHub上规模最大的AI项目,拥有超过38万颗星标,社区生态快速成长,围绕研究、工程、项目管理和日常生产力持续开发各类工具与技能。
英伟达、微软(Microsoft)与OpenClaw三方正携手合作,致力于让Windows PC上的部署体验更加顺畅。为降低入门门槛,OpenClaw Windows App简化了在任何配备至少24GB显存的RTX GPU上设置优化本地模型的操作流程。



