“生成一张漂亮的游戏画面”已经不稀奇,稀奇的是让这张画面知道自己身处哪一个世界:这堵墙是不是刚被玩家炸开过,这盏灯是不是任务里被打碎的那一盏,视角转回来的时候,墙上的弹痕还在不在。这些问题的答案不存在于任何图像里,它们存在于游戏的状态里。所以当神经渲染开始生成光影和材质时,最重要的问题不是模型能画多好,而是它和游戏引擎之间怎么分工。
先看一个典型的分工:DLSS 5 的做法
NVIDIA 对 DLSS 5 的定位是“3D 引导的神经渲染(3D-Guided Neural Rendering)”。它的流程是:游戏引擎照常渲染几何、相机、动画和基本的场景结构,得到颜色帧和运动信息;神经模型读取这些已经渲染好的内容,去改写光照和材质的外观。它不是纯粹的图像重建,也不是完全自由的图像生成。DLSS 5 于 2026 年 9 月 3 日随《NBA 2K27》发布,可用于 GeForce RTX 50 系列和 GeForce NOW。这个设计说明了一个重要的取向:模型有很大的表现空间,但它被 3D 信息“引导”着,而不是被放出去自由发挥。
六个角色,各管什么
把一个含神经渲染的游戏拆开,可以看到六个角色:游戏引擎、世界状态、几何、规则、渲染器和生成模型。世界状态是“现在发生了什么”:每个实体的位置、血量、任务进度、物体是否被破坏。几何是“世界长什么形状”:网格、碰撞体、相机。规则是“接下来允许发生什么”:物理、战斗结算、脚本触发。渲染器把几何和状态变成一帧画面。生成模型则站在渲染器之后或之中,改写这帧的光照与材质。引擎的职责,是把前面四个东西管理好,并提供给渲染器和模型。
| 角色 | 负责什么 | 为什么不交给生成模型 |
|---|---|---|
| 世界状态 | 实体、进度、破坏记录 | 必须精确、可存档、可联机同步 |
| 几何与相机 | 形状、碰撞、视角 | 决定玩家能否走过去、打不打得中 |
| 规则 | 物理、战斗、脚本 | 结果要确定,可复现,可测试 |
| 渲染器 | 把状态变成画面 | 提供模型所需的颜色、深度、运动信息 |
| 生成模型 | 改写光影与材质外观 | 这是它擅长且可以容忍一定随机性的部分 |
为什么规则和状态不能交给模型
研究 AI 原生游戏的综述(arXiv 2607.00527)指出,运行时生成最难的地方是让输出与游戏状态和规则保持一致,而持久记忆、世界状态追踪和长期后果管理仍然脆弱。世界模型如 Matrix-Game 3.0 已经可以带着记忆以约 40fps 实时生成 720p 画面,并在分钟级的序列里保持场景一致;但分钟级的一致,离游戏需要的“十个小时之后这堵墙还是那堵墙,存档后重新加载仍然一致”还差得很远。如果让模型既生成画面又维护状态,就等于把游戏的真相放进一个会“遗忘”和“脑补”的系统里。所以更稳的路线是让引擎持有真相,让模型只做外观。
模型需要引擎给它什么
这个分工反过来对引擎提出要求。模型要改写光影,就需要知道场景的几何、深度、材质类别和光源信息,也需要运动信息来保证相邻帧之间的连贯,这与神经渲染的时域稳定性是同一个问题。模型要改写材质,就需要引擎标出“这是金属、这是皮肤、这是玻璃”,否则它可能把一块石头改成看起来像塑料。此外,HUD、文字这类不该被改写的东西,需要由引擎分层交付或打上遮罩,参见超分辨率最容易露馅的地方。可以说,模型的表现上限,很大程度上取决于引擎交给它的信息质量。
引擎仍要保留的三样东西
第一是可复现性:同样的存档、同样的输入,规则层的结果必须一致,这样才能做回归测试、录像回放和联机校验。神经渲染即便带有随机性,也只能停留在“表现层”。第二是可关闭:当设备算力不足,或者玩家不喜欢生成的风格,引擎必须能退回传统渲染,游戏本身照样成立。第三是可约束:美术需要能够限制模型的风格范围,比如不允许它改变角色脸部的辨识特征,不允许把任务关键物品的颜色改到看不清。
用一个假设场景检验分工
设想一个赛博朋克风格的开放世界:玩家在雨夜里打碎了路边的一盏霓虹灯。在这个场景里,“灯被打碎”是规则层的事件,写进世界状态;引擎据此渲染出没有光的灯管和地面上少了一块的反光;神经模型读取这一帧,把湿润路面上的霓虹反射、雨滴的散射改写得更真实。如果模型自己“决定”这盏灯还亮着,画面也许更好看,但已经和游戏状态矛盾了,玩家会立刻感到不对劲。这正是真实渲染与生成画面的边界的实际含义:边界不在于像素是不是模型生成的,而在于谁对“世界是什么样”负责。
衡量这种架构是否健康,可以看几个问题:关闭神经渲染,游戏规则和存档是否完全不受影响;同一存档在不同设备上,规则结果是否一致;模型改写的内容,能否用遮罩和标签被明确限制;镜头转走再转回来,关键物体的外观是否稳定。这四个答案都是“是”,说明引擎仍在做它该做的事。