你用过英伟达显卡的DLSS功能吗?它能轻易地让游戏帧率翻倍。这也是AI在计算机图形学上的最前沿的应用,可以说,虽然游戏在英伟达的业务中现在已经不到10%,英伟达也依然引领着游戏界图形学的最前沿。

目录

一、AI图像生成模型引言

二、NVIDIA的入场

三、DLSS的引入

四、市场验证与技术推进

五、相关技术基础

5.1 卷积网络及其局限性

5.2循环神经网络的局限

5.3Transformer与自注意力机制

六、3A游戏性能约束

七、AI驱动渲染的动机

八. DLSS技术原理与演进

8.1 DLSS 1.0:基于CNN的超分辨率初探

8.2 DLSS 2.0:基于CNN的多帧时序重建

8.3 DLSS 3/3.5:帧生成与光线重建

8.4 与其他技术对比(FSR、XeSS)


一、AI图像生成模型引言

神经网络的生成模型已从单一模态的文字生成扩展到多模态内容生成,广泛应用于图像、视频、音频等领域。从AlexNet在ImageNet图像识别任务中取得突破性成果,到ChatGPT等大语言模型实现自然语言、图像与视频的联合生成,神经网络技术深刻影响了社会生产与艺术创作。在图像生成领域,基于人工智能的模型已达到可与人类艺术家媲美的水平:经过适当训练的AI能在数分钟内生成大量高质量图像,而同等质量的人工创作通常需要数天甚至数周。因此,AI生成模型正逐步成为图像内容创作的核心生产力。

二、NVIDIA的入场

2012年,AlexNet以超出第二名近10个百分点的准确率赢得ImageNet竞赛,使深度学习进入公众视野。更重要的是,研究者发现图形处理器相较于中央处理器可将神经网络训练速度提升数百倍,这得益于NVIDIA推出的CUDA并行计算架构。CUDA项目在初期投入巨大但回报有限,曾长期压制NVIDIA股价。然而,NVIDIA首席执行官黄仁勋敏锐意识到神经网络将变革社会,并决定将公司资源全面转向AI。他深入研究cuDNN项目后断言:“既然神经网络能解决毫无规律的图像识别问题,那还有什么是它们不能做的?答案是:所有事物。”这一战略使NVIDIA转型为AI芯片公司,并为其后续主导市场奠定了基础。

三、DLSS的引入

除生成图像外,AI图像模型还可用于数据增强与数据挖掘。例如,车企利用AI去除自动驾驶场景中的雾气,从模糊图像中恢复清晰的道路信息。在电子游戏领域,AI被用于图像超分辨率运算——通过生成模型将低分辨率图像转化为高分辨率图像,从而降低显存占用并提升渲染效率。其中最具颠覆性的是NVIDIA的DLSS技术,它开启了AI驱动渲染的新范式。

在高端实时渲染应用中,尤其是3A游戏,存在“画质-性能”悖论:在固定显存条件下,提升画质会降低帧率,反之提升帧率需牺牲画质。原因是显卡对每一帧的精美渲染会延长单帧计算时间,从而减少单位时间内的帧数。NVIDIA率先将AI图像生成模型应用于帧间插值,推出了DLSS帧生成技术。以RTX 4070为代表的显卡利用AI模型在渲染帧之间生成额外帧,可实现2倍甚至更高的帧率提升。

四、市场验证与技术推进

NVIDIA股价自2014年起持续攀升。在ChatGPT引发的生成式AI浪潮中,全球AI企业争相采购NVIDIA显卡训练大模型,包括OpenAI、Anthropic、Google等。这些模型实现了从文本到多模态的跨越,涵盖代码生成、股市分析、图像视频生成乃至蛋白质分析。截至2026年5月,NVIDIA市值突破5.5万亿美元,超越苹果(4.4万亿美元),成为全球市值最高的公司。

从DLSS 2.0开始,NVIDIA采用基于Transformer或卷积神经网络的超分辨率架构,实现了游戏图形领域的颠覆性技术。纵观图像生成模型从CNN到Transformer的发展历程,可以看到NVIDIA数亿个晶体管上发生的革命性变化。如果说AlexNet是摇摇欲坠的第一架飞机,那么Transformer就如同喷气式飞机般强大。如今,新开发的3A级游戏厂商普遍要求支持DLSS以迎合主流市场。

五、相关技术基础

我查了一下,英伟达的DLSS是基于Transformer和卷积神经网络进行开发的,这也是AI大模型的开发方向。

5.1 卷积网络及其局限性

卷积神经网络是早期应用最广泛的图像模型。CNN通过局部感受野捕捉图像特征(如边缘、纹理),但为捕获全局依赖需要堆叠大量卷积层。此外,CNN在处理长序列(如高分辨率图像的百万级像素或长文本)时难以建模远距离依赖,导致训练效率下降。

5.2循环神经网络的局限

RNN虽适合序列建模,但面临梯度消失/爆炸问题,且长序列中易“遗忘”早期信息。这使其无法支撑如ChatGPT所需的大规模上下文处理(数万乃至十几万字)。

5.3Transformer与自注意力机制

2017年,Google团队发表《Attention Is All You Need》,提出Transformer架构。其核心是自注意力机制,允许模型直接计算序列中任意两个位置的相关性,从而高效捕获全局依赖。该架构简洁且可扩展,奠定了GPT、BERT、Gemini等模型的基础。衍生出的Vision Transformer将Transformer引入计算机视觉,在分类、检测、生成等任务上逐步超越CNN。

DLSS正是Transformer在工业级图像生成中的典型应用:利用自注意力进行超分辨率重建与帧生成。

六、3A游戏性能约束

实时渲染是3A游戏的核心技术挑战,与传统离线渲染(如电影特效)不同,游戏渲染必须在极短的时间内完成——通常每帧仅仅约16毫秒(对应60FPS)至33毫秒(对应33FPS).在这一时间约束下,GPU需要完成顶点处理,光栅化,像素着色、光照计算、阴影映射、后期特效等一系列复杂的图形管线操作。

随着显示设备向高分辨率(4K乃至8K)和高刷新率(144Hz、240Hz)演进,实时渲染的性能压力呈指数级增长。具体而言,渲染一帧所需要的计算量与像素数量成正比:4K分辨率的像素数量是1080P的四倍,这意味着在相同画质设置下,4K渲染的计算负载是1080P的四倍。

近年的光线追踪技术进一步加剧了这一矛盾。光线追踪通过模拟光的物理传播路径来实现逼真的反射、折射和阴影效果,但代价是极高的计算开销。以《赛博朋克2077》的全景光线追踪模式为例,即使强如RTX 4090的旗舰显卡,在4K分辨率下不开启任何优化技术时,帧率也仅有十几帧,完全无法达到流畅游玩的标准。这一数据清晰地揭示了现代3A游戏面临的“画质-性能”悖论:追求更精美的画面(高分辨率+光线追踪)必然导致帧率断崖式下降,而维持流畅帧率则必须牺牲视觉质量。

超分辨率(Super-Resolution)技术的目标是从低分辨率输入中重建高分辨率输出。在AI技术普及之前,游戏和图形应用主要依赖基于插值的传统超分辨率方法,其中最典型的是双线性插值和双三次插值。

双线性插值通过对目标像素周围2×2邻域内的四个像素进行加权平均来计算新像素值,计算简单、速度快,但结果图像边缘模糊,缺乏锐利度。双三次插值则使用周围4×4共16个像素进行更复杂的加权计算,能够在一定程度上保留边缘信息,但仍无法生成真实的高频细节。

这些传统方法的根本局限在于:它们仅基于局部像素的数学关系进行推算,而缺乏对图像内容的“理解”。正如相关研究所指出的,双三次插值只是“通过已有像素猜出中间像素”,但无法判断“黑白像素之间是否应该是蓝色或红色”。换言之,传统插值方法只能实现平滑过渡,无法真正“创造”出缺失的纹理细节。当放大倍数超过2倍时,插值结果的模糊感尤为明显,难以满足现代游戏对画质的苛刻要求。

七、AI驱动渲染的动机

上述局限催生了AI驱动渲染的技术范式转向。其核心洞察在于:与其让GPU暴力渲染每一个像素,不如让GPU以较低分辨率完成基础渲染,再利用AI模型智能地“补全”或“生成”高分辨率画面所需的细节。

这一思路的优势是多方面的。首先,AI模型可以通过大规模预训练学习到图像的先验知识——例如纹理结构、边缘走向、材质反射规律等,从而能够从低分辨率输入中“推理”出合理的高频细节,而非单纯依赖像素插值。其次,AI推理过程可以借助专用硬件加速(如NVIDIA的Tensor Core),与CUDA核心的渲染任务并行执行,避免了对主渲染管线的资源挤占。最后,AI模型可以融合时序信息——即利用前后多帧的数据来重建当前帧——这比单帧超分辨率能获得更稳定、更高质量的输出。

NVIDIA的DLSS技术正是这一理念的工业级实现。从2018年首次亮相至今,DLSS经历了多次重大迭代,逐步从初探性的AI超分演进为一套完整的AI驱动渲染技术栈。

八. DLSS技术原理与演进

8.1 DLSS 1.0:基于CNN的超分辨率初探

2018年,NVIDIA随RTX 20系显卡(Turing架构)首次推出DLSS 1.0(Deep Learning Super Sampling)技术。这一版本的核心思路是利用深度学习模型进行图像超分辨率重建:将低分辨率渲染帧输入一个卷积神经网络,由网络“脑补”出高分辨率输出帧。

DLSS 1.0的训练过程采用游戏专属模型策略:针对每一款游戏,NVIDIA使用超算让AI模型学习大量该游戏的1080p画面与8K超清画面对照数据,从中总结低分辨率到高分辨率的映射规律。在运行时,RTX显卡上的Tensor Core负责执行这一预训练模型,从而实现实时的AI超分。

然而,DLSS 1.0存在明显的技术缺陷。第一,“猜”的成分过多:由于模型是从大量训练数据中“强行总结规律”,在画面快速变化的游戏场景中,模型频繁出现“猜错”的情况,导致画面出现模糊、伪影等问题,动态画质尤差。第二,部署成本高昂:每款游戏都需要单独训练模型,严重限制了技术的推广速度和游戏开发者的采用意愿。

作为初代产品,DLSS 1.0被业界普遍认为是“粗糙的第一步”,但它验证了AI驱动渲染的技术可行性,为后续迭代奠定了方向。

8.2 DLSS 2.0:基于CNN的多帧时序重建

2020年,NVIDIA推出DLSS 2.0,这是一次彻底的重构而非简单升级。DLSS 2.0抛弃了依赖单帧“猜测”的方法,转而采用多帧时序重建策略。

其核心原理如下:GPU以较低分辨率(如540p或720p)渲染连续多帧画面,DLSS 2.0的AI网络结合运动矢量(Motion Vectors)和历史帧缓冲(History Buffer),将这些低分辨率帧的信息“累积”起来,重建出一幅高分辨率(如1080p或4K)的输出帧。这一过程类似于计算摄影中的多帧合成降噪技术,本质上是将多个低质量样本融合为一个高质量结果。

DLSS 2.0相比前代的优势显著。其一,通用模型:NVIDIA训练了一个可在不同游戏间通用的AI模型,开发者只需简单集成SDK即可启用DLSS支持,无需为每款游戏单独训练,极大降低了部署门槛。其二,画质突破:由于每个输出像素都来自多帧真实采样的“证据”而非猜测,DLSS 2.0在静态画面中的画质甚至超越原生分辨率渲染——锯齿更少、边缘更锐利。事实上,DLSS 2.0本质上是一种AI驱动的时序抗锯齿上采样(Temporal Anti-Aliasing Upsampling, TAAU),它一次性解决了性能提升和抗锯齿两个问题。

DLSS 2.0的发布标志着AI超分技术从“实验室玩具”走向“工业级解决方案”,游戏采用率自此开始快速攀升。

8.3 DLSS 3/3.5:帧生成与光线重建

DLSS 3(2022年) 在超分辨率基础上引入了革命性的新功能——帧生成(Frame Generation)。其原理是利用光流加速器(Optical Flow Accelerator)分析连续两帧之间的像素运动轨迹,结合运动矢量和深度数据,由AI模型插值生成全新的一整帧,插入在传统渲染的两帧之间输出。这意味着:传统渲染输出第1帧和第2帧,DLSS 3在此基础上额外生成第1.5帧。实际测试表明,在《赛博朋克2077》中开启DLSS 3后,RTX 4080能在4K分辨率下流畅运行全景光追模式,帧率从原生十几帧跃升至60 FPS以上。

帧生成功能是RTX 40系显卡独占的,因为它依赖于第四代Tensor Core中新引入的光流加速器硬件。

DLSS 3.5(2023年) 则聚焦于光线追踪质量的提升,新增光线重建(Ray Reconstruction)技术。在传统光追管线中,光线采样后需要多个人工设计的降噪器(Denoiser)来填补稀疏采样留下的噪点和空洞——这一过程不仅效率低下,还会丢失细节、产生“鬼影”。DLSS 3.5用一个AI降噪模型取代了所有这些手工降噪器,该模型经过5倍于DLSS 3的训练数据量,能够更智能地识别光照模式、保留高频细节。开启光线重建后,游戏中的反射倒影更加锐利,阴影过渡更符合物理规律,甚至能实现“光线正确避开遮挡物”的效果。

8.4 与其他技术对比(FSR、XeSS)

DLSS并非市场上唯一的超分技术。AMD的FSR(FidelityFX Super Resolution)和Intel的XeSS(Xe Super Sampling)是其主要竞品,三者形成了差异化的技术路线。

FSR采用纯数学算法(空间上采样),不依赖AI也无需专用硬件,因此兼容性极佳——可在NVIDIA、AMD、Intel甚至集成显卡上运行。FSR 1.0是纯粹的空间放大,画质有限;FSR 2.0引入了时序数据,画质显著提升,但仍逊于DLSS 2.0;FSR 3增加了帧生成功能,与DLSS 3对标。FSR的核心优势是开放与普适,但代价是无法利用AI的推理能力,在极端放大场景(如4K性能模式)下的画质不如DLSS。

XeSS采用AI模型进行时序重建,与DLSS 2.0技术路线相近。XeSS支持两种运行模式:在Intel Arc显卡上利用XMX引擎(AI专用硬件)高速运行;在非Intel显卡上则回退到DP4a指令集进行纯数学模拟(但性能下降明显)。XeSS 2增加了帧生成功能,整体技术栈日趋成熟。

对比总结如下

特性DLSSFSRXeSS
核心技术AI时序重建(Transformer/CNN)数学时序重建(非AI)AI时序重建
专用硬件依赖需要Tensor Core(NVIDIA RTX)需要XMX(Intel Arc)或回退到DP4a
硬件兼容性仅NVIDIA RTX显卡所有显卡Intel Arc最佳,其他显卡降效
帧生成支持DLSS 3/4FSR 3XeSS 2
画质水平最优(尤其光线重建)良好优秀

总体而言,DLSS凭借硬件专用加速和持续的AI模型迭代,在画质和技术先进性上保持领先;FSR则以开放兼容性占据了广泛的市场份额;XeSS作为后起之秀正在快速追赶。三大技术的竞争正在加速AI驱动渲染的整体进步。

参考文献

[1] 百度开发者中心. 超分辨率重建:解锁画质增强的技术密码

[2] 太平洋科技. AI超分游戏显卡是什么意思?

[3] 电子产品世界. 游戏技术的未来?——浅谈DLSS技术

[4] NVIDIA Developer. NVIDIA DLSS

[5] 驱动之家. DLSS 3.5体验:RTX 40系显卡再上一个新台阶

[6] Wccftech. DLSS vs FSR vs XeSS Explained

[7] 太平洋科技. 耕升RTX SUPER显卡DLSS2.0重新定义AI渲染

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐