VR里的NPC能自由聊天以后,下一步为什么不是让它说得更多,而是让它真正知道玩家正在看哪里、拿什么、站在哪里?
VR 里的 NPC 如果可以回答任何问题,却不知道玩家正把一把钥匙举到它眼前,沉浸感仍然会瞬间消失。本文讨论的问题是:大模型让 VR 的 NPC 能够自由聊天以后,下一步为什么不是让它说得更多,而是让它真正知道玩家正在看哪里、拿什么、站在哪里。核心判断有三点。第一,一个可信的 VR 中的 AI NPC 至少需要三层能力叠加:语音(Speech)与大语言模型(LLM)提供的语言理解,视线(Gaze)、手部追踪(Hand Tracking)与位置提供的空间上下文(Spatial Context),以及游戏世界里物品状态(Object State)和 NPC 记忆(NPC Memory)提供的世界状态。缺任何一层,NPC 都会说出“语法正确但与场景无关”的话。第二,空间信息必须以结构化的方式喂给模型,而不是让模型自己从对话里猜,例如把“玩家注视的物品”“手中的物品”“距离”作为明确字段。
第三,延迟是硬约束,云端语言模型的端到端延迟实测区间约为 1.42 至 2.90 秒,在 VR 里会打断社交节奏,所以需要把“立刻的空间反应”和“较慢的语言回答”分开处理。文章还提到开放式交互的安全风险与玩家认知负荷,并给出一套设计清单,帮助团队判断一个 VR NPC 是否真的具备“在场感”,这也是金沙娱乐AI VR研究关注的方向,需要说明的是,这些都是研究方向与设计思路,不代表已经发布的功能。具体到设计上,文章建议把空间上下文整理成“玩家注视的物品、手中的物品、与 NPC 的距离”这样的结构化字段,让“这个”“那个”这类指代词有明确的所指;把物品状态与任务进度交给游戏系统作为权威来源,语言模型只读取并转述;并且让本地规则驱动的视线转向、点头等快速反应,与云端语言模型较慢的完整回答分开,避免玩家在等待中感到 NPC 停机。同时,开放式对话会抬高玩家的认知负荷,也可能被“套话”套出设定和秘密,因此秘密内容需要访问控制,而不是完全依赖提示词。