
技术原理:基于 Meta 视觉 Transformer 模型
SVD 隶属于英伟达推理微服务(NIM)及 " 媒体 AI 私有访问计划 ",主要面向新闻机构、广播公司和媒体等企业用户,普通消费者无法直接使用。该技术基于计算机视觉国际会议(ICCV)的获奖研究,核心逻辑并非将视频作为整体分析,而是将其拆解为多个 504x504 分辨率的裁剪帧。
这些帧被输入到 Meta 开发的两款视觉 Transformer 模型—— DINOv2 和 DINOv3 中。借助 Transformer 在无标注数据下学习模式的能力,系统能迅速评估每帧的空间特征,并赋予 0 到 1 之间的分数(0 为完全真实,1 为完全伪造)。最终,系统通过计算所有帧的平均分,以百分比形式呈现视频的真实性概率。即便视频经过社交媒体常见的压缩处理,掩盖了表面瑕疵,该模型仍能捕捉人类肉眼无法察觉的内在人工痕迹。
性能表现:高准确率与低延迟
基准测试数据显示,SVD 在未压缩视频上的检测准确率高达 92%。即使在 15% 的压缩率下,准确率仍保持在 87%;在 50% 的高压缩率下,准确率亦有 82%。作为微服务,SVD 具备极低延迟:在英伟达 RTX GPU 上处理 1080p 视频仅需 22 毫秒,在工作站型号上为 30 毫秒。
部署限制与合作进展
值得注意的是,SVD 依赖 NVENC 编码器支持,因此包括 B100 在内的部分数据中心显卡无法原生运行该工具。英伟达已宣布与 Wowza 合作,旨在将实时合成视频检测集成至直播工作流中。
目前,用户可在 build.nvidia.com 体验演示版。但由于处理过程在云端进行,存在耗时较长、经常超时以及最大文件大小限制为 100MB 等问题。
【星途科讯 图文丨小林 首发于 ZAKER 科技,转载请注明出处】