全模态“小而美”重塑AI智能体效率天花板
当地时间4月28日,英伟达正式推出开源全模态推理模型Nemotron 3 Nano Omni,试图为企业级AI智能体(AI Agent)提供一个整合视觉、音频与语言能力的一体化基础模型底座。
Nemotron 3 Nano Omni采用30B-A3B混合专家(MoE)架构,虽总参数达300亿,但每次推理仅激活30亿参数,在算力成本与推理性能之间找到了精巧的平衡点。它支持最高百万Token的超长上下文,并将视觉与音频编码器集成于一体,无需额外调用独立的感知模型,从而简化了传统多模态链路“视觉模型→语言模型→音频模型”之间的碎片化数据传递与编排延迟。
以客服智能体处理全高清屏幕录制为例:传统方案需多个模型接力推理,耗时数秒;而基于该模型,智能体可实现实时顺畅的解读与响应。在六大行业基准排行榜上,Nemotron 3 Nano Omni均跻身同尺寸模型榜首,其系统吞吐量最高可达其他同级别全模态模型的9.2倍。
该模型权重、数据集与训练配方完全开放,目前已可在Hugging Face、NVIDIA NIM微服务等多个平台获取。富士康、Palantir等公司已率先采用,戴尔、甲骨文等正在评估。英伟达正加速从“算力霸主”向“模型平台商”延伸,试图以“开放+高性能”在闭源阵营主导的市场中开辟一条中间路线。