▲
一、一个被低估的信号
2026年8月11日,Nvidia同时发布了两款产品:Nemotron 3.5 Lightning,一个30B参数的开源模型;NeMo Switchyard,一个开源模型路由库。如果你只看标题,这似乎只是一次常规的模型更新。但如果你仔细看合作伙伴名单——LangChain、Cognition、Ramp、LiteLLM,以及Nous Research的Hermes Agent——你会发现:Nvidia正式杀入了AI Agent基础设施赛道,而且出手就是全链路。
这两款产品加在一起,解决的是所有AI创业者都在头疼的问题:Agent太贵了,而且不知道该怎么省钱。
一个典型的AI Agent工作流,从接收指令到完成任务,需要经历阅读文件、搜索信息、调用API、生成代码、验证结果等十几步甚至几十步操作。每一步都要调一次大模型。如果全程用Claude Opus 4.8或GPT-5.6,一个复杂任务的成本可以轻松突破几十美元。一家创业公司如果每天跑几十个Agent任务,月成本直接冲击四位数美元。这不是猜想——这是当前AI创业的真实账本。
二、Nemotron 3.5 Lightning:为Agent高强度劳动量身打造
先拆解模型本身。Nemotron 3.5 Lightning总参数量30B,但采用混合专家架构(MoE),每次推理仅激活3B参数。这个设计思路非常明确:它不是用来写论文或解奥数题的,它是用来"干活的"。
具体来说,它的核心能力指向Agent最常见的操作:读取文件内容、调用外部工具、对返回结果排序、格式化输出、执行失败后自动重试。这些操作占Agent任务的80%以上,但每一轮都调用前沿模型是巨大的浪费。Nvidia用一个3B激活参数的模型来做这些事,速度是同级别模型的4倍,Agent任务整体完成速度快30%。
架构上更有意思。它用了Mamba-2 + MoE + Attention的混合设计,上下文窗口拉到100万token。这意味着它能处理超长对话历史,不需要频繁压缩上下文——这对需要记住几十步操作历史的Agent来说,是刚性需求。
更令人意外的是透明度。Nvidia公开了训练数据和专门用于微调Agent能力的强化学习数据集(Nemotron-RL-Agentic-Terminal-Pivot)。在业界普遍把训练数据当商业机密的当下,这个举动相当罕见。它让开发者可以把模型拿来做自己的定制微调,适配特定领域的Agent工作——比如代码审查(CodeRabbit已在用)、网络安全(CrowdStrike已接入)、法律文件处理(Harvey已部署)、科学研究(Lila Sciences在物理和生命科学场景中使用)。
还有一个关键点:这个模型能在本地跑。支持RTX PC、DGX Spark、DGX Station,甚至Jetson边缘设备。对于做企业服务的一人公司来说,本地部署意味着客户数据不出本地网络,合规压力骤降。
▲
三、NeMo Switchyard:模型路由从手艺活变成标准件
如果Lightning是Agent的"手脚",Switchyard就是"神经中枢"。
Switchyard做的事情听起来简单:每次Agent需要调模型时,自动判断该用贵的还是便宜的。但"判断"这件事的复杂度远超想象。什么时候需要推理能力?任务复杂度如何量化?成本和质量怎么权衡?以前这些全凭开发者直觉和手动调参,Switchyard把它变成了一套可配置、可优化的系统。
重点看数据。LangChain用Switchyard跑了145个多轮Agent任务,结果令人震惊:只有7%的调用被路由到前沿模型,另外93%交给了更小更便宜的模型。最终成本暴降74%,而任务准确率仅下降了6个百分点。用数学来算:原来100美元的任务,现在只要26美元,质量几乎不变。
Ramp在软件工程基准测试SWE-Bench上的结果更激进:匹配前沿模型性能的前提下,成本降58%,运行时间缩短33%。Cognition把Switchyard嵌入Devin Desktop,成本降28%,性能接近前沿。Classmethod内部测试成本直接降了27%。
对AI创业者来说,这意味着一个根本性的成本结构变化。如果你现在的Agent系统所有调用都用同一个模型,你大概率在浪费至少一半的钱。Switchyard这类路由工具很快会从"可选"变成"标配"。
更重要的是,Hermes Agent已经集成了Switchyard。Nous Research把Switchyard作为可配置的路由系统嵌入Hermes,开发者只需要配置就能用,不需要自己实现路由逻辑。这意味着AI创业内参的读者,很可能在未来几周内就能在自己的Agent工作流中直接使用这套系统。
Switchyard的生态还在快速扩张:LiteLLM把它作为插件接入代理层,Kong通过AI Gateway原生支持路由,LangChain、OpenCode、Fireworks等平台都在对接。它正在变成Agent基础设施中的"标准管道件"。
四、Nvidia的野心:从卖GPU到定义Agent运行方式
把这套发布放在更大的图景里看,Nvidia的战略意图非常清晰。
Nvidia的AI基础设施投入已超过千亿美元规模。但卖GPU是一锤子买卖,客户买完后用什么模型、怎么调度、成本如何,跟Nvidia关系不大。所以它要做的是向下延伸到模型层,横向扩展到调度层。从硬件(RTX、DGX)到模型(Nemotron全系列)到路由(Switchyard),一条完整的Agent管线正在成型。
Nvidia把这套理念称为"system of models"——模型系统。一个持续运行的Agent不应该依赖单一模型,而应该由一组专业化模型通过智能路由协作完成工作。前沿模型负责规划和复杂推理,小模型负责执行高频、低难度的子任务。
这个思路其实已经在顶级AI创业者中被验证。Pieter Levels公开表示用不同层级的模型处理不同任务,Andrej Karpathy多次强调"小模型+路由"才是Agent的正确架构。问题是,之前做路由需要大量的手写规则和反复试错,进入门槛极高。Switchyard做的事情,就是把这种"高手的手艺"变成"人人都能用的工具"。
五、三个立刻能用的实操启示
第一,重新审视你的Agent成本结构。 如果你现在的Agent系统所有模型调用都使用同一个前沿模型,立刻算一笔账:你的任务中有多少步是"查资料"、"格式化输出"、"简单判断"这类低难度操作?这些步骤完全可以用更便宜(甚至免费)的模型处理。在Switchyard成熟之前,你可以手动做一层简单的路由:规划用大模型,执行用小模型。
第二,本地Agent不再是空想。 Nemotron 3.5 Lightning仅3B活跃参数,一张RTX 4090就能流畅运行。对于处理敏感数据的企业服务(法律、医疗、金融),本地部署意味着数据不出客户机房,合规成本大幅降低。如果你正在做面向企业的AI Agent服务,这个卖点可以直接写进方案里。
第三,观察Agent基础设施的标准化趋势。 Nvidia、Anthropic(Claude Code的模型选择机制)、OpenAI(GPT-5.6的分层定价策略)都在推自己的Agent架构。但Switchyard是开源且模型无关的——它可以路由OpenAI、Anthropic、Google的模型,也可以路由开源模型。在巨头争相建立围墙花园的时代,开源的基础设施给了独立开发者一条不被锁定的路。Agent时代的自由度,很大程度上取决于基础设施层有多开放。
数据来源:Nvidia官方博客(2026年8月11日)、Ollama官方博客、Hugging Face模型卡、Nvidia NIM技术文档
HN热度:192 points / 100 comments
发布日期:2026年8月12日
本文由AI辅助创作,经人工审核编辑发布
更多一人公司案例与工具,微信搜索「AI创业内参」关注我们
