Project Genie,谷歌用于创建交互式世界的AI原型

  • Project Genie 结合了 Genie 3、Nano Banana Pro 和 Gemini,可以根据文本或图像生成交互式虚拟世界。
  • 仅限美国境内的 Google AI Ultra 订阅用户访问,每次会话时长最多 60 秒,分辨率约为 720p。
  • 该工具允许你实时绘制、探索和混合世界,但它存在真实性问题、延迟问题和角色控制不佳等问题。
  • 它模仿知名游戏的能力引发了关于版权的争论,也让部分电子游戏行业感到担忧。

人工智能项目:生成交互式世界

谷歌在其攻势中采取了新的举措 人工智能在电子游戏中的应用 虚拟世界 随着Project Genie的推出,这款原型产品允许用户根据少量文本提示或图像生成并浏览交互式环境,该公司将其定位为仍在测试阶段的实验性工具。然而,其初步演示在业内引发了既兴奋又质疑的双重情绪。

目前,访问权限仅限于 美国谷歌AI Ultra计划的订阅用户会话时间短,性能也明显体现了该系统的实验性质。即便如此,该项目也预示着未来任何用户都可以…… 只需几秒钟即可创建一个小型“可玩世界”。无需了解如何编程或操作图形引擎。

Project Genie是什么?它结合了哪些技术?

人工智能世界生成器

Project Genie 是一个 由谷歌DeepMind和谷歌人工智能开发的研究原型 它是一款交互式世界生成器。其技术基础基于三大支柱:Genie 3 模型,专门用于模拟动态环境;Nano Banana Pro,负责视觉效果和草图绘制;以及 Gemini,这款多模态模型能够解读用户指令并在创作过程中提供辅助功能。

该系统的核心是 Genie 3 是一个“世界”模型,能够逐帧预测屏幕上发生的事情。与以往只能生成静态 3D 场景的技术不同,这种方法可以让环境实时对玩家的动作做出反应,根据 DeepMind 的内部实验,其分辨率约为 720p,视觉连贯性可达数分钟。

它是在此基础上整合的。 Nano Banana Pro 负责生成舞台的初始图像。 从描述性文字或参考图像开始,这第一幅图可以作为草图,用于确定图形风格、世界构成以及探索过程中将控制的角色的外观。

最后, Gemini 充当编曲层和助手。它能以自然语言解释指令,帮助即时调整世界,并能完成诸如改变视角(第一人称或第三人称)、重新混合已创建的环境或将几个想法组合成一个可玩场景等任务。

如何创建和探索虚拟世界

由人工智能生成的交互式世界

Project Genie 的运作结构围绕着一个核心展开: 逐步过程分为三个阶段 谷歌将其概括为勾勒、探索和融合不同的世界。其目标是让任何人都能无需额外工具,就能将想法转化为小型互动体验。

在第一阶段,用户编写他们想要创建的世界的描述,或者上传一张参考图片。基于这些输入, Nano Banana Pro 生成静态预览 场景可以是低多边形风格的森林、未来都市环境、历史景观,或者文本中描述的任何其他场景。角色类型、摄像机模式和一些基本移动参数也在此阶段定义。

一旦草图被接受,Genie 3 就会发挥作用,让玩家能够…… 使用 W、A、S 和 D 键等典型的 PC 控制键,自由探索游戏环境。该模型能够实时生成角色面前出现的内容,根据前一帧预测每一帧,并在摄像机旋转或返回到已访问过的区域时保持一定的连贯性。

第三项关键能力是 世界的组合与重组该系统允许用户重新访问之前生成的场景,使用新的参数对其进行修改,将它们合并在一起,甚至可以使用谷歌预先生成的世界作为基础来构建各种变体。此外,用户还可以分享会话视频,供其他用户观看或从中汲取灵感。

所有这些都通过一个类似于其他谷歌人工智能服务的Web应用程序运行,因此 无需安装其他程序,也不需要高深的技术知识。只需打开该工具,输入指令,然后开始测试各种组合,直到找到满意的结果。

技术限制:时间、性能和真实性

人工智能原型在虚拟世界中的局限性

谷歌坚持将Project Genie定义为 具有显著实验特征的研究原型这个标签并非只是形式上的:目前的经验表明,除了最初的好奇心之外,该工具存在一些明显的局限性,限制了其实际应用。

最明显的例子是…… 每次生成和探索会话限时 60 秒一分钟后,游戏世界仿佛静止,玩家必须重新开始游戏。该公司解释说,这种限制可以更好地分配计算资源,因为每次游戏都会为玩家预留一个专用芯片。

就性能而言,公开测试描述了 分辨率接近 720p,帧频率在每秒 20 到 24 帧之间这些功能也伴随着明显的输入延迟,例如在移动角色或切换视角时。一些早期测试者表示,这种体验更像是互动视频,而不是流畅的传统电子游戏。

还应该注意的是,Genie 3 它不是传统的图形引擎,而是一个预测下一帧的模型。 基于以上所述,这会导致一些奇怪的现象:路径纹理无故改变、元素消失、物理效果不合理,或者动画随机变形。

谷歌自身也发出警告,生成的世界 “它们可能看起来并不完全真实,也并非总是符合物理规律或物理定律。”而且角色操控也不够精准。换句话说,这项技术展现出了潜力,但在游戏性和画面稳定性方面,距离提供完善的游戏体验还有很长的路要走。

受限访问和国际路线图

人工智能原型机的使用权限有限

在第一阶段,Project Genie 仅适用于 美国谷歌AI Ultra客户该公司最先进的订阅计划面向需要高性能人工智能功能的企业和创作者。这是一项高级服务,因此限制了可参与实验的用户数量。

限制检测的决定可以用以下两方面来解释: 每次会话的计算成本 这是因为谷歌希望在更大规模推广之前收集详细的用户反馈。DeepMind 研究总监 Shlomi Frutcher 强调,能够向更多人开放这些工具以收集真实使用体验意见“令人兴奋”,但目前尚无这些工具在欧洲或其他市场推出的具体日期。

从西班牙和欧洲用户及研究的角度来看,这意味着,至少在短期内, 最现实的角色将是观察者。密切关注测试结果,分析已经在社交媒体上流传的视频,并评估这项技术在多大程度上可以融入关卡设计、快速原型制作或创意可视化的工作流程中。

谷歌已表明其意图 逐步扩大准入 前提是性能、成本和法律问题允许。然而,这种扩张的速度也将取决于社区的反应,以及围绕版权和负责任地使用第三方内容的争论将如何发展。

模仿知名游戏的能力以及版权争议

Project Genie最棘手的问题之一就是它的 能够以不同程度的成功,重现明显受到现有电子游戏启发的世界一些专业记者设法创造出了与《超级马里奥 64》、《银河战士 Prime》或《塞尔达传说:旷野之息》等游戏明显相似的场景。

就塞尔达传说而言,甚至有人见过它们。 跳跃时展开滑翔伞的角色这一动作与任天堂游戏密切相关。这些巧合表明,该模型可能使用了大量公开的游戏视频进行训练,这引发了人们对人工智能训练中知识产权处理方式的质疑。

经过多次测试,重现了受知名IP启发而创建的世界之后,谷歌已经开始…… 阻止生成某些场景和角色尤其是在提及特定名称或商标时。在某些情况下,该工具会直接阻止基于某些故事背景创建世界,理由是“涉及第三方内容提供商的利益”。

该公司解释说,Project Genie是 “主要使用公开的网络数据进行训练”但请记住,这些内容仍然受版权法保护。因此,目前尚在完善审核系统,该系统会明确阻止一些复制受版权保护作品的行为,而只要避免过于直接的引用,其他一些行为则可以绕过审核。

这种不寻常的行为加剧了关于……的争论。 人工智能在多大程度上可以或应该从现有游戏中汲取灵感? 那么,我们该如何界定致敬、模仿和抄袭之间的界限呢?这场辩论预计在欧盟等地区尤为重要,因为这些地区仍在制定人工智能训练数据和版权方面的监管框架。

对电子游戏行业的潜在影响

除了媒体对观看的吸引力之外 几秒钟内即可生成“类似马里奥”或“类似塞尔达”的世界Project Genie是各大科技公司竞相将生成式人工智能应用于游戏开发这一更广泛竞赛的一部分。例如,微软已经推出了Muse等项目,旨在自动化部分设计和制作流程;其他公司也在探索类似的解决方案,以降低成本并加快开发速度。

在此背景下,谷歌的提案旨在成为 一种快速原型制作和实验工具 这对于独立工作室和大型发行商来说都可能很有吸引力。能够根据草图或一段文字构建可玩场景,有助于早期验证创意、创建内部演示或测试游戏机制,而无需投入数月的时间。

然而,这类解决方案的兴起引起了业内一些人士的担忧。一方面, 人们担心这可能会对某些职业领域产生影响。 如果部分内容是自动生成的。另一方面,许多开发者对那种人工智能利用已发表的作品进行训练,却没有向作者支付明确报酬的商业模式持谨慎态度。

在欧洲和西班牙市场,关于文化创作保护的争论尤为激烈,因此,像Project Genie这样的工具如何融入未来的监管体系至关重要。诸如训练数据的透明度、版权所有者的退出机制以及生成内容的归属等问题,都可能决定着这些工具能否被谨慎采用,还是会与开发者和出版商持续产生冲突。

目前,Project Genie仍处于早期阶段。 它更像是一个公共实验室,而不是一个成品。它的发展演变,以及谷歌如何处理相关的法律和道德问题,将决定它最终是融入工作室的工作流程,还是仅仅停留在华丽但有限的实验阶段。

然而,这款原型机的出现清楚地表明,大型科技公司看到了…… 自动生成交互式世界 这是一个至关重要的战略领域。尽管它目前的实际应用受到限制,并且存在诸多技术缺陷,但发展方向是明确的:模型越来越能够将文本和图像转化为可玩的体验,而整个行业将不得不决定如何与这些新工具共存。

相关文章:
虚拟现实的定义 你应该知道的!

添加为首选来源