空间计算 & 3D-AIGC - 三维场景的“图灵测试”(2024 过年版)
假期末尾引爆的 Sora 所代表的 AIGC,与假期前引爆的 Apple Vision Pro 所代表的空间计算相互呼应,宣告着真正的“元宇宙(数字孪生)”时代的到来,同时也是到了需要定义三维场景的“图灵测试”的时候。
0)作为熟悉 HoloLens 2 的开发者,我一直倾向于实景增强的模式,但也惊叹于 AVP 这次实质 VR 的技术选型,虽有延时与失真,但统一了 VR 与 AR(可以增加虚物,也可以减少实物);
1)从生物学的角度,人类对物理世界的感知是受限且主观的,所以之前有“第0层元宇宙”这种说法,而如果 AVP 后续版本能使 XR 真正锚定人类的视听,再有 AIGC 的加持,那么之前所有 Posthumanism - Cyborg 多少有点科幻的议题都需要当下给出务实的确认。如同装备了基于 HoloLens 的 IVAS 的士兵对未装备者的降维打击,空间计算、眼动追踪 & 手势理解、Agent & Assistants 的民用化,极大的缩短了虚实世界间的融合路径(不仅仅是 UX 层面),这将是较智能手机对生活模式的影响更为剧烈的变革。如同我们已经习惯了“万物皆可触屏”,“火眼金睛”也会成为标配。
2)亚隆在《直视骄阳》里提到,除了日常生活中的孤独外,存在的孤独更加深刻,它来自于每个人与他人之间不可逾越的鸿沟。存在孤独意味着死亡不仅是指生物学意义上的生命丧失,而且包括你个人丰富、神奇、详尽、独一无二的心理世界的丧失,这个世界在其他任何人的头脑中都无法复制。之前数字永生多强调文本叙事,局限性非常明显,而现在 AVP 带来了的这种“体验”(而不是简单的“娱乐”),记录了融合主观(眼动与手势)的全 3D 场景,让依然无解的存在的孤独有了一丝裂缝。我们可以故地重游,在新旧地景间无缝切换,让年少与垂暮相视而笑。如果无法全量的体验某人的视听,可以借助于多模态大模型,某种意义上就是体验了某人的“世界”,而这是不是“心理世界”,其实类似“大语言模型有没有世界图景”一样,更像是一个技术哲学问题。想象一下,你体验你爱人在求婚那一刻的视听,看到充满激情的自己,同时也注意到视焦的一丝闪烁。
3)春晚是我们这一代人的集体记忆,于我的符号则是最后合唱《难忘今宵》以及伴奏音乐下的字幕,我也一直自省自己为何特别喜欢看影视片尾的字幕以及歌曲专辑的文案,后来想到了“Human-in-the-loop”,应该就是关注这些视听内容的生产者(分工)以及生成的背景。以下的论述,算是我对 “从 UGC 到 AIGC,Human-in-the-loop 下愈加复杂的世界表征” 的一些前置思考:
3.0)为何我们说音乐是“时间胶囊”?相较照片影像文字语音等其他文本,更低的信息熵?更为抽象与宽泛的指代?更易与场景融合?与情感更多的关联性?……我认为还有一个重要的原因是更完备的细节,这里的“完备”是指做到了该类型符号能力范围内的全部记录。也就是说,你听到的《难忘今宵》除了因播放设备产生的差异,所有音乐细节与儿时听到的是完全一致的,而看旧时照片与视频、看日记是“不尽兴”的,因为照片与视频是三维世界的一个二维切片,此外就是分辨率与光影,由双眼感知的影像记录符号目前是无法完整沉浸的。因此如 2)所述,空间计算+AIGC,是较全息摄影更为可行的一条场景虚实孪生路线。而超分辨率、动画视频生成、少视角图像的三维重建、二三维内容增删这类“无中生有”的 AIGC 技术,其所依赖的大模型或基础模型 LM/FM,需要如 LLM 在 ChatGPT 中通过图灵测试一样,能骗过(或融入)人类视觉的“第0层元宇宙”。跨越人脸生成、人体姿态的“恐怖谷”指日可待,而三维场景的“图灵测试” 又如何定义?设想一下,也许是带着 AVP,在端详(通过视焦变化与身体移动)之下,完全分辨不出增加的虚物 & 删除的实物,也就是说,能完美的实现影视剧中表现的两类场景:增加虚物对应的是主角变成鬼魂后抓取实物,删除实物对应的是惊悚片中的一道透明的墙或透明人。 进一步,我相信这就是 XR 的终极目标“捕捉地方的精神”的一条存在主义的技术路线。另,文字语音符号暂不展开,可以参考这两天昼温:你一生的言语 - 2024 科幻春晚(让人想到德特姜《你一生的故事》),其中用了“语痕”这个词,我认为是蕴含在场景视听中的。
3.1)关注 AIGC 井喷后的这个春节:作为国内视听技术标杆的春晚,前些年有过 AR 的噱头,而这两年更强调 8K & VR,可以认为,这是在目前的技术范式中务实去追求更多的二维真实细节,而不是尚华而不实的虚拟生成内容。两个有趣的细节:1)春晚团队一再强调“吉祥物龙辰辰”非 AI 生成,而合作方建行则以“首款 AI 设计吉祥物”进行宣传。此外,龙年是十二生肖中唯一真实世界不存在的生肖;2) @海辛Hyacinth 发文 “和 @Simon阿文 一起做了《枕着她的光》所有的 AI 舞蹈,据说是春晚历史上第一个 AI 视频。”而 @沈燕迟 则说 “……当然最丑春晚舞台出现了……实在不行的话能不能 AI”。此外,@新媒沈阳 从新媒研究角度的大量 AIGC 开始让我感到不适(类似年轻时听凤凰传奇),而从技术迭代角度,我认为“粗制滥造”的 AIGC 内容不正是目前大众能用到的主流效果吗(只是一个时间问题)?然后就是假期末尾引爆的 OpenAI - Sora - Creating video from text,所谓 World Simulators(3.3 另行展开,本文初稿完成时 Sora 还没发布),与假期前引爆的 AVP 所代表的空间计算相互呼应,宣告着真正的“元宇宙(数字孪生)”时代的到来。
3.2)AIGC 影像与“人工”影像之间的差异及其区分,也许比文本生成要容易讨论一些,但也是在“写实”与“印象”两端间广袤的谱系(后续可尝试从面向计算建模的“表达 Representation”与面向理解传播的“描述 Description”的经典地图符号学框架去分析)。在写实端的评测就是是否符合 “物理世界图景”,除了测量不确定性以外,还有一个经典的华为手机拍摄月亮的梗,也算是基于“月球图景”的 AIGC 奇技淫巧;而在印象端,就是艺术了,评测就是是否激发审美与情绪。此外,我一直关注 AI-Porn,这个与生理激素最相关的技术落地前沿,也是与各类亚文化的极致融合。
3.3)Sora 对应 GPT-3 时刻,又激发了一轮物理世界引擎/图景的讨论(参考 X 上针对 Sora 是否具有物理世界引擎(OpenAI's Sora is a data driven physics engine)的讨论)。如上从模态的信息量以及内容生成的效果来看,影像生成(无论从 Schema 还是从文本)总是比影像多模态理解(如 GPT-4V)更吸引眼球,“物理世界图景”(即元宇宙)也需要“百闻不如一见”,Chat 里粒子效果的定理聊得再好,也不如让人看到波涛汹涌的咖啡海。但这次的讨论更为严苛,感觉去年这时候被批评的 @Ted Chiang: ChatGPT Is a Blurry JPEG of the Web 的观点放今年正好,毕竟语言是最抽象低熵从而也是最便于交流脑补的模态(图灵测试也限定为语言),而影像里人参与的抽象太少了,“光看苹果落地就学习到重力,人类也只有到牛顿才做到”。而对写了很长时间 GPTs 的我而言,感觉这种议题更像是前 AIGC 时代的技术哲学范式,“当下所有不能与具体前沿技术场景关联的理论概念都只是文字游戏,先验自洽而深陷隐喻陷阱”。此外,面向 GeoAIGC 的生成视频三维重建,参考 OpenAI Launches Sora and the World,使用 ColMap 与 NeRFStudio 对 Sora 生成视频进行了三维重建,考虑到 NeRF 与 Gaussian Splatting 本身的能力迭代,效果非常好……Sora 应该懂三角测量。
参考 @图形学与混合现实研讨会:"三维 AIGC 与视觉大模型" 十五问 启动 AIGC & 3D-AIGC/Video-AIGC + XR & 空间计算 - Metaverse(2024-2025)