2026 年 5 月底到 6 月初的一周里,四个看似独立的事件拼出了同一个画面:NVIDIA 在台北 Computex 发布了 RTX Spark 芯片和 Windows 版 DGX Station,微软在 Build 大会上推出了 Scout 个人代理和两个端侧 Aion 模型,Nous Research 发布了 Hermes Desktop。芯片制造商、操作系统厂商、开源代理社区在同一个月、同一周里各自交出了答卷。
这不是巧合。过去几年,本地 AI 一直是"理论上可行"——你当然可以在自己的电脑上跑模型,但体验总是差一口气。这一次,硬件、操作系统、代理运行时终于被设计成同一个目的:让你的 AI 代理常驻在你的机器上,云端只是可选的后备,而不是默认选项。
Hermes Agent 由 Nous Research 开发,在不到三个月的时间里 GitHub 星标突破了 14 万,截至 2026 年 6 月已经成为 OpenRouter 上使用量最大的代理框架。它的定位很明确:可靠、自进化、始终在线的本地代理。
与传统 AI 助手最大的不同在于,Hermes 不是每次对话重新开始,而是通过内置的学习闭环实现自我进化。每一次任务完成、每一次收到反馈,它都会把学到的东西保存为技能(Skill),下次遇到类似任务时直接调用。这种机制让它越用越聪明。
Hermes 的架构也有几个值得注意的设计选择。
子代理隔离执行。 Hermes 把子代理当作短命、隔离的工作单元,每个子代理只专注于一个子任务,拥有独立的上下文和工具集。这让 Hermes 能够在较小的上下文窗口下高效运行,特别适合本地部署的场景。
技能经过压力测试。 Nous Research 对随 Hermes 发布的每一个技能、工具和插件都进行了策展和压力测试。结果是即使搭配 300 亿参数级别的本地模型,Hermes 也能稳定运行,不需要像其他代理框架那样频繁调试。
框架即编排层。 开发者对比测试显示,使用相同模型在不同框架下,Hermes 的结果更强。区别在于 Hermes 是一个活跃的编排层,而不是一个简单的包装器,这使得它能实现持久的设备端代理,而不是每次任务单独执行。
Hermes 的能力再强,也需要硬件来承载。NVIDIA 在这方面的布局非常清晰。
RTX Spark 是消费级超芯片,搭载 20 核 Grace CPU(与联发科联合设计)加上 Blackwell RTX GPU,拥有 6,144 个 CUDA 核心、第五代 FP4 Tensor Cores、最高 128GB LPDDR5X 统一内存和 300GB/s 内存带宽。NVIDIA 声称它能在本地运行 1200 亿参数的模型,上下文窗口达到 100 万 token。超过 30 款笔记本型号将在 2026 年秋季上市。
DGX Spark 则是桌面级设备,售价 4,699 美元,拥有 128GB 统一内存和 1 petaflop 的 AI 算力,专为全天候代理工作负载设计。它可以全天运行 1200 亿参数的混合专家模型,而新的 Qwen 3.6 35B 模型以更小的 footprint 提供同等智能。
端侧推理的速度优势也很直观:据报道,端侧的首 token 延迟在 15-80 毫秒之间,而云端需要 180-600 毫秒,差距达到 4 到 13 倍。对于交互式任务来说,本地往返完成时,云端请求甚至还没开始生成。
NVIDIA 特别推荐了阿里巴巴的 Qwen 3.6 系列作为本地代理的首选模型。这个选择背后有几个原因。
Qwen 3.6 35B 模型仅需约 20GB 内存就能运行,性能超越了前代 1200 亿参数的模型。而 Qwen 3.6 27B 是一个新的稠密模型,活跃参数更多,精度匹配 4000 亿参数级别的模型,但体积只有后者的十六分之一。
Tensor Cores 加速 AI 推理,让 Hermes 可以在几秒钟内完成多步任务或自我技能的优化,而不是几分钟。
Satya Nadella 在 NVIDIA 的新闻稿中说:"RTX Spark 标志着朝着向每个家庭和办公桌上的用户提供无计量智能迈出的一步。"这句话的关键在于"无计量"——当模型运行在你已经拥有的硬件上时,额外一次推理的边际成本趋近于电费。
当然,硬件成本不是免费的。DGX Spark 售价 4,699 美元,RTX Spark 笔记本的价格尚未公布。分析师的测算显示,DGX Spark 需要每月约 250 美元的云端 API 支出才能达到盈亏平衡,但这个数字高度依赖使用频率。
对于重度使用者来说,本地代理意味着不再需要为每次推理付费,不再受限于云端服务的可用性,也不再担心数据隐私问题。
过去两年,AI 代理的竞争主要集中在模型能力和框架特性上。但当 NVIDIA、微软、Nous Research 在同一周各自交出答卷时,竞争的维度发生了微妙的变化:硬件基础设施正在成为新的护城河。
芯片的内存带宽决定了能跑多大的模型,统一内存架构决定了能不能放下完整的上下文窗口,而推理引擎的优化程度决定了代理响应有多快。这些指标不像模型参数那样容易被营销,但它们才是决定用户体验的真实因素。
Hermes Agent 选择了本地优先路线,NVIDIA 选择了硬件加速路线,两者在 2026 年的夏天碰头了。这可能不是 AI 代理赛道的终点,但无疑是一个重要的转折点。
*请认真填写需求信息,我们会在24小时内与您取得联系。