金沙娱乐 · AI GAME CREATION LABAI UGC · MOD · 云游戏与AI画质 · 神经渲染 · AI VR
金沙娱乐虚拟世界研究组 头像图标

金沙娱乐虚拟世界研究组

关注VR中的大模型NPC、语音与空间交互、长期记忆和沉浸感,研究语言之外的世界状态怎样进入NPC的判断。

AI VRLLM NPC空间交互长期记忆沉浸感

金沙娱乐虚拟世界研究组的文章(6篇)

VR里的NPC能自由聊天以后,下一步为什么不是让它说得更多,而是让它真正知道玩家正在看哪里、拿什么、站在哪里? 配图
金沙娱乐AI VR2026年9月14日阅读 4 分钟

VR里的NPC能自由聊天以后,下一步为什么不是让它说得更多,而是让它真正知道玩家正在看哪里、拿什么、站在哪里?

VR 里的 NPC 如果可以回答任何问题,却不知道玩家正把一把钥匙举到它眼前,沉浸感仍然会瞬间消失。本文讨论的问题是:大模型让 VR 的 NPC 能够自由聊天以后,下一步为什么不是让它说得更多,而是让它真正知道玩家正在看哪里、拿什么、站在哪里。核心判断有三点。第一,一个可信的 VR 中的 AI NPC 至少需要三层能力叠加:语音(Speech)与大语言模型(LLM)提供的语言理解,视线(Gaze)、手部追踪(Hand Tracking)与位置提供的空间上下文(Spatial Context),以及游戏世界里物品状态(Object State)和 NPC 记忆(NPC Memory)提供的世界状态。缺任何一层,NPC 都会说出“语法正确但与场景无关”的话。第二,空间信息必须以结构化的方式喂给模型,而不是让模型自己从对话里猜,例如把“玩家注视的物品”“手中的物品”“距离”作为明确字段。

第三,延迟是硬约束,云端语言模型的端到端延迟实测区间约为 1.42 至 2.90 秒,在 VR 里会打断社交节奏,所以需要把“立刻的空间反应”和“较慢的语言回答”分开处理。文章还提到开放式交互的安全风险与玩家认知负荷,并给出一套设计清单,帮助团队判断一个 VR NPC 是否真的具备“在场感”,这也是金沙娱乐AI VR研究关注的方向,需要说明的是,这些都是研究方向与设计思路,不代表已经发布的功能。具体到设计上,文章建议把空间上下文整理成“玩家注视的物品、手中的物品、与 NPC 的距离”这样的结构化字段,让“这个”“那个”这类指代词有明确的所指;把物品状态与任务进度交给游戏系统作为权威来源,语言模型只读取并转述;并且让本地规则驱动的视线转向、点头等快速反应,与云端语言模型较慢的完整回答分开,避免玩家在等待中感到 NPC 停机。同时,开放式对话会抬高玩家的认知负荷,也可能被“套话”套出设定和秘密,因此秘密内容需要访问控制,而不是完全依赖提示词。

AI VR游戏AI NPCSpatial ContextGaze
阅读全文 →
金沙娱乐官网游戏科技观察:VR里的NPC越来越像真人以后,真正决定沉浸感的可能为什么不是语言模型大小? 配图
金沙娱乐官网观察2026年9月11日阅读 4 分钟

金沙娱乐官网游戏科技观察:VR里的NPC越来越像真人以后,真正决定沉浸感的可能为什么不是语言模型大小?

VR 里的 NPC 回答得再聪明,如果玩家问完两秒以后它才开口,开口时目光还望着别处,玩家记住的只会是那两秒。本文是金沙娱乐官网的观察,判断沉浸感取决于一条由延迟(Latency)、空间感知(Spatial Awareness)、记忆(Memory)、语音(Voice)、动画(Animation)与世界交互(World Interaction)串成的链条,最弱的一环决定体验,而语言模型的大小只是其中一个变量。文章引用了近年的 VR 语音代理与临场感研究:玩家看重表达自由,回应可信时沉浸感很强,但节奏不自然、前后不一致、信息量低会立刻破坏沉浸;云端大模型的端到端延迟在实测中约为 1.42 到 2.90 秒,会打断社交节奏。我们更倾向的设计是分层:高频的社交反应交给小模型和规则,难问题才交给大模型,同时用点头、转头等动画先行来遮住等待,并对 NPC 的记忆和秘密做分级,避免被套话泄露设定。

分层之后,模型大小就成了可以按场景调节的成本。文末给出四项可以直接拿去测的检查:可见反应出现的时间、回答是否提到玩家举起的物品、十小时前的关键事实是否仍被引用,以及面对套话诱导时能否守住秘密。换句话说,沉浸感更像一份需要逐项验收的工程清单,而不是某个模型参数的函数,模型大小只是其中一项可以调节的成本。

VRAI NPC沉浸感Latency
阅读全文 →
金沙娱乐AI VR:玩家直接和NPC说话以后,系统怎样判断一句话是在聊天还是在下达游戏指令? 配图
金沙娱乐AI VR2026年9月1日阅读 4 分钟

金沙娱乐AI VR:玩家直接和NPC说话以后,系统怎样判断一句话是在聊天还是在下达游戏指令?

VR 里玩家直接对 NPC 说话,难点不是听懂字面,而是判断这句话是闲聊、剧情提问,还是要改变游戏状态的指令。核心判断是:不能每句都送到云端大模型,因为实测端到端延迟约 1.42–2.90 秒,会打断社交节奏。更合理的做法是分层:本地先做轻量意图分类并给出置信度,高置信度的指令直接执行,低置信度的按误触发代价决定追问、确认还是当作闲聊;云端模型只负责真正开放的对话。文章还给出按“执行代价”而非“识别准确率”设计确认策略的方法,以及让澄清追问不出戏的写法。

Speech IntentConfidenceClarificationLatency Budget
阅读全文 →
VR里的AI NPC为什么必须知道玩家正在指向哪件物品? 配图
金沙娱乐AI VR2026年8月31日阅读 4 分钟

VR里的AI NPC为什么必须知道玩家正在指向哪件物品?

玩家在 VR 里说“把那个给我”,NPC 必须在几百毫秒内知道“那个”是哪件物品,否则再流畅的语言模型也只能反问“哪个?”。本文把指示词消解拆成四路信号:视线(Gaze)、手部追踪(Hand Tracking)、物体 ID(Object ID)和语言本身的空间词,再用对话上下文兜底。核心结论是,各路信号不应投票取平均,而应按“谁更接近说话瞬间、谁的歧义更小”加权,并始终输出候选列表而非单一答案。文章讨论了视线抖动、手指遮挡、物体重叠等常见失败场景,以及候选打分不够自信时怎样用一次自然的追问收尾。

GazeHand TrackingObject IDSpatial Language
阅读全文 →
AI NPC记住玩家十小时前说过的话以后,VR剧情会发生什么变化? 配图
金沙娱乐AI VR2026年8月30日阅读 4 分钟

AI NPC记住玩家十小时前说过的话以后,VR剧情会发生什么变化?

NPC 记住十小时前说过的话,会改变剧情结构:关系值、任务分支、玩家历史和世界状态都要被同一套记忆系统读写。本文讨论记忆的写入(什么值得记)、检索(此刻该想起什么)、遗忘(何时降权或合并)和一致性(NPC 不能自相矛盾)。核心判断是,记忆不应是把整段对话塞回提示词,而应是分层的结构化事实,并区分“NPC 主观记得”和“世界客观发生”。记忆越丰富,被玩家“套话”而泄露秘密的风险越大,需要给每条记忆标注可披露范围,并在生成前做过滤。

Long-term MemoryRelationshipQuestPlayer History
阅读全文 →
大模型进入VR以后,NPC正在从固定语音指令走向开放式自然语言交互 配图
金沙娱乐动态2026年9月19日阅读 4 分钟

大模型进入VR以后,NPC正在从固定语音指令走向开放式自然语言交互

2026 年 9 月,VR 里的 NPC 正在从“只听得懂固定语音指令”转向“可以用自然语言自由对话”。据公开研究,玩家很看重表达自由,NPC 回应可信时沉浸感很强;但对话节奏不自然、回答前后不一致、信息量低都会破坏沉浸。云端大模型的语义理解更强,可端到端延迟不稳定,实测区间约 1.42–2.90 秒,会打断 VR 的社交节奏;开放式交互还会抬高玩家的认知负荷,并带来被“套话”泄露设定或秘密的安全风险。本文的判断是,开放语言只是第一步,延迟预算、一致性和空间理解同样重要。可观察的指标是:NPC 首次回应时间与前后回答矛盾率。

VRLLM NPCSpeechSpatial Interaction
阅读全文 →
在线询盘

请留下您的联系方式,我们会尽快与您联系。

扫码联系我们