
A | IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。

B | IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。 在今天的科隆游戏展开幕夜上,《TARAE: The Unbound》正式公布。本作是一款以东方暗黑奇幻世界为背景的俯视角动作RPG,玩家将踏上神秘岛屿,在六大领域破碎的边界之间展开冒险。

C | 游戏预告:游戏中,玩家将扮演六名各自背负不同因果与使命的“求道者”(暂译),他们拥有截然不同的战斗风格和成长路线。 但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。 谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。

D | 玩家可以从六大独特职业中选择角色,并通过职业技能、特性、辅助技能以及装备自由组合BD,打造属于自己的战斗方式。战斗是《TARAE: The Unbound》的核心内容。 GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。 GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。玩家可以使用大量技能与连锁攻击,在敌群中展开高速战斗,同时需要观察强大敌人的攻击模式,通过闪避、反击等方式寻找突破口。游戏还特别强调打击反馈,希望让每一次攻击都具有足够的力量感。

E | 模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。 训练数据以合成为主。

F | 论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。

G | 除了大量普通敌人外,本作还准备了强调学习和掌握机制的Boss战。 泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。面对强大的Boss,玩家需要熟悉其攻击规律,在关键时刻完成闪避与反击,并利用自身构筑寻找击败对手的方法。预告截图: 剧情方面,六名求道者将踏上彼此交织的旅程,在一次次试炼中逐渐理解彼此,并最终成为真正的伙伴。游戏世界则融合了东方神话、民间传说与传统美学,打造出一个美丽却又充满黑暗与残酷气息的幻想世界。玩家所探索的岛屿诞生于六大领域破碎的边界之上,随着冒险深入,不同的选择与战斗都将影响恢复六界秩序的道路。 性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

H | 本文由游民星空制作发布,未经允许禁止转载。

I | 更多相关资讯请关注:TARAE:The Unbound专区。 参考。

J |
Current article:http://ozv1r.liawucunsainantaonao.sbs/list_77ema6g/ualzrje.html
Published on:00:00:00