编者按:除了现实生活中的亲朋好友,手机上的虚拟人似乎更符合当代人的社交需求。本文将从多个维度,为大家详细解析手机虚拟人产品,包括手机虚拟人的行业背景、实现技术、外观特点、交互方式、使用场景等,为大家入门虚拟人产品提供参考。一起来看看吧。
他们可能是你的温暖朋友、贴心助手、亦或是平行宇宙中的另一个你……
如果说元宇宙是一个充满神秘与奇幻的地方,让用户更加接近沉浸在数字技术所创造的平行时空,那么虚拟人无疑是每一位用户进入元宇宙的门票。毫无疑问,数字时代的未来是元宇宙,但元宇宙本身的走向却充满不确定性,人们无法对定义达成共识,有些事情总会有发生,但具体会如何发生,谁也无法给出肯定的答案。
相比于一些厂商希望构建的宏大的元宇宙场景,手机端的发展似乎更加踏实务实,产品类型也更加丰富新颖。随着手机虚拟人产品的推出,连接两个平行时空的大门正在慢慢打开。
1. 行业背景:移动厂商纷纷进军虚拟人市场
数据显示,Z世代平均每月智能手机使用时长为174.9小时。作为数字原生代,Z世代消费者拥有与前辈截然不同的消费特征。对于大多数Z世代来说,虚拟体验成为开拓新社交圈、与志同道合的人互动的工具。体验感好、趣味性的虚拟场景成为Z世代青睐的产品。
随着先进技术的不断突破,元宇宙概念不断涌现,Z世代消费群体的崛起也为虚拟人带来了良好的市场。得益于深度学习算法的突破,虚拟偶像主播、虚拟助手等虚拟人物近年来进入大众视野,智能化驱动的虚拟人产业逐渐走向良好状态。
基于目前移动互联网时代的发展趋势,国内外手机厂商不仅需要随时抓住市场热点,还要不断夯实品牌文化个性与产品核心实力,不仅瞄准Z世代年轻人,更不忽视上一代和下一代年轻人的感受,进军虚拟人领域是必然选择。
2.虚拟人技术概述
作为移动终端虚拟人产品,移动虚拟人技术架构与常规虚拟人类似,其总体系统框架可分为图像生成、图像驱动、图像渲染、识别理解分析决策等模块。
1.图像生成
图像生成的过程就是构建数字资产的过程。通常由原画师负责虚拟人的外观设计,绘制平面图像,然后由3D建模师将原画转化为三维模型。在建模过程中,建模设计师的经验尤为重要,通过合理的叠加贴图方式和精度权衡,让虚拟人在系统可承载的范围内达到最佳效果。再通过骨骼绑定和PC渲染,让虚拟人像真人一样“活”起来,创造出有血有肉的饱满视觉效果。
2. 图像驱动
图像驱动的种类很多,主要是为了让虚拟人按照人的指令做出不同的动作和反应,完成与用户的交互过程。常见的驱动形式有:语音驱动、面部驱动、姿势驱动和手语驱动。
语音驱动:根据音频特征控制面部(嘴唇同步)驱动的动画;该过程主要包括音频特征提取、音素嘴唇同步和情绪表情对齐。
人脸驱动:基于摄像头捕捉人脸特征,实时驱动模型;
通过定义脸部关键点,利用摄像头捕捉关键点,最终根据实时跟踪数据生成映射动画;
姿态驱动:基于摄像头捕捉姿态关键点信息,驱动模型实现姿态控制;
在进行姿势驾驶时,通常需要在关键位置(如手指、关节)佩戴专业的追踪设备,进行骨骼绑定,最后通过实时同步运动映射完成逼真的运动记录。
手语驱动:基于国家通用手语词典,通过手语翻译引擎和自然运动引擎,赋予虚拟人手语翻译和表达能力,突破信息障碍,更好地服务听障人士。
根据是否需要实时动作捕捉,虚拟人的驱动方式也可以分为AI驱动和真人驱动两大类。
AI驱动:自动读取、分析、识别外部输入信息,智能驱动虚拟人产生相应语音和动作;
真人驱动:通过动作捕捉设备或者摄像机实时捕捉面部表情和动作。
3. 图像渲染
计算机图形学中的渲染是指利用软件将模型生成图像的过程。模型是使用严格定义的语言或数据结构对三维物体的描述,其中包含几何、视点、纹理和光照信息。核心功能包括:物理系统、光影计算和图形渲染。手机端渲染的难点在于性能、功耗、内存之间的平衡和优化,以及尽可能还原设计模型的真实感。
物理渲染创建的角色和场景效果:
下面左图是使用重光照技术的效果图,右图是实际拍摄的情况,两者的效果几乎看不出什么区别:
4. 交互模块
交互模块是识别、理解、分析、决策模块的统称,是一种扩展,只存在于交互虚拟人中,其核心功能为:
自然语言理解与生成
对话管理
语音技术
首先通过语音识别模块将自然语言转化为文本,再将文本处理成词或者句向量,进入对话管理系统后进行模型匹配与生成,将问题转化为答案句子,最后通过语音合成将文本转化后输出给用户。
3. 固定IP对抗千面
需要指出的是,由于移动设备的限制,高多边形虚拟人造型设计在手机端实现难度较大,尤其在需要AI或真人驾驶的情况下,高多边形精致造型容易造成流量消耗过大、页面卡顿等问题。因此虚拟人的造型选择和实现方式主要可以分为两种,一是“多多边形固定IP+视频流推送”,二是“低多边形千人千面+AI或真人驾驶”。
固定IP是指虚拟人的形象是固定的,通常长相精致,可以作为公司品牌代言的一部分,也可以出现在互动比较简单甚至没有互动的短视频或手机应用中。固定IP的调用方式通常是根据关键词推送特定的短视频流,或者随机播放短视频流;
千人千面通常是用户在数字世界中的替身,用户可以根据自己的喜好自定义虚拟人的外观,捏脸、搭配衣服等。千人千面通常需要记录虚拟人的动作库,并设计相应的数字资产。数字资产通常是指虚拟人可以替换的外观特征,例如发型、发色、眼睛、脸型、服饰、配饰等。千人千面主要由真人驱动,即虚拟人根据用户的表情和动作做出相应的映射,与用户保持一致。
数千个不同面孔的虚拟人物的服装道具库:
千张面孔的虚拟人动作库:
4.虚拟人外观分类
按照虚拟人的外观特征可以分为2D二维、3D卡通、3D美女、超现实、仿真六大类。
以上六种虚拟人外观的区别主要由精度和面数决定,面数越高精度越高,越能贴近真人外观,面数越多需要占用的数据和空间也越多,不同类型的虚拟人外观适用于不同的平台或终端。
面数:指3D建模中的三维造型是由最基本的三角平面构成的,一个单位为一个面。面数越高,建模精度越高,图形效果越精致。
5. 手机使用场景
移动终端的使用场景通常是交互方式和驱动方式综合影响的结果。按照有无交互、真人驱动还是AI驱动,移动终端的使用场景可以分为:语音助手、桌面互动壁纸、电商直播、新闻播报、视频通话、视频会议、短视频、相机、相册等。
接下来本文将根据主要的使用场景,介绍一下最具代表性的移动虚拟人产品:
1.语音助手
(1)OPPO小布虚拟人(布美美)
发布时间:2020.09.29
交互类型:关键字视频流推送、语音交互
外观:固定IP+3D动画
小布虚拟人是基于虚拟人多模态交互的手机智能助手,涵盖视觉、语音、自然语言处理等多模态融合算法,依托小布助手全面的AI能力,实现多场景生态的内容服务以及与用户的实时互动。目前功能有AI新闻播报、天气播报等。未来小布虚拟人定制平台将同步开放,未来将根据各开发者的需求进化出不同的个性化虚拟形象,如智能客服、虚拟助手、主播等,可搭载于多种智能终端设备上,进一步推动OPPO在个人物联网行业的发展。
(2)小米小爱定制
发布时间:2021.09.27 与civi手机同期发布
交互类型:关键字视频流推送、语音交互
外观:千面百态、3D卡通
小爱同学升级版,用户可以自定义一个自己喜欢的小爱同学形象,再利用小爱同学已有的自定义语音、唤醒词功能,轻松打造自己心中的智能助手。支持语音自定义,与他人分享自定义语音包。专属AI。未来有望个性也能自定义,成为网络世界最懂你的人。
(3)百度度晓晓
发布时间:2021.01.17
交互类型:具备视觉识别和语音识别能力,包括AI驱动和视频流推送
![]()
外观:固定IP,3D精美卡通
一款语音虚拟助手,可以通过语音或文字输入搜索人物或天气新闻,或进行换装、装饰房间等游戏。度晓晓拥有二次元虚拟人物形象,独有的情感交互系统,面对不同用户的性格、爱好,度晓晓的理解和反馈也会有所不同,每个用户的“度晓晓”自然会进化出不同的模样,你将拥有一个专属于你的“度晓晓”。
(4)百度龚俊数字人类
发布时间:2021.11.29
交互类型:关键字视频流推送、语音识别
外观:固定IP,模拟器
它是国内首款可互动的超写实明星数字虚拟人,注重实用功能,可满足用户多场景搜索需求。例如,当用户说“今天天气怎么样”,虚拟人可以快速识别并自动语音播报第一条搜索结果。除了播报搜索结果,还能控制终端功能,实现夜间模式、书架、游戏等功能的直达。在外观方面,百度引入4D扫描技术,捕捉真人说话、日常表情等细微面部变化,对龚俊实现超写实的还原。
2. 桌面互动壁纸
(1)黑鲨酱
发售时间:2021.03.23 与黑鲨游戏手机4同期发售
交互方式:语音识别、触觉感知等。
外观:固定IP,3D动漫人物
平时可以作为动态桌面背景,玩游戏时可以帮助用户了解各种游戏功能的使用方法,玩游戏时还可以充当战斗播音员。造型优美,拥有一批忠实的游戏粉丝。你可以根据皮肤改变的外观,定义的动作和声音。充电时,也会充电并显示精美的动画。此外,还拥有闹钟功能,以拟人化的方式唤醒用户。
(2)仿真桌面(yoyo)
上线时间:2020.12.01.
交互方式:触觉感知
外观:固定IP,3D精美动画
悠悠是米哈游开发的虚拟桌面中的固定IP角色,画风细腻,是一款可以以动态桌面的形式寄宿在用户手机中,并根据用户的触觉感知做出相应反应的桌面养成类游戏。虚拟人的着装、居住空间也可根据不同的主题皮肤而变化,扮演情感陪伴、心灵疗愈的角色,感受专属陪伴与沉浸式体验的乐趣。
3. 视频通话
(1)OPPO
发布时间:2021.9. 发布内容:12个新功能
交互方式:真人驾驶、实时建图
外观:千面3D卡通
用户可以根据自己的形象和喜好,包括肤色、发型、帽子、眼镜、五官等,打造属于自己的虚拟形象,设计出来的形象可以用于视频会议、趣味拍照等活动,面对突发状况的会面,再也不用化妆,完美解决社交恐惧症问题。从技术上看,通过引入业界先进的Face算法,基于50个核心表情库,打造高精度3D模型,让虚拟形象栩栩如生,目前只支持头部形象,暂不支持下半身形象。
(2)苹果
发布时间:2018.09.18 适配iOS 12正式版
交互方式:真人实时映射
外观:3D卡通上身,千面百态
该功能利用Face ID相机系统将热门表情映射到你的脸上,使其看起来像是在实时录制模仿你的面部表情。其核心技术是实时捕捉用户面部表情的变化,并通过结构光3D建模技术进行实时映射,甚至吐舌头等细微变化都可以被检测到并同步。国际多样的素材可供用户DIY自己的头像和下半身(腰部以上)。该功能与视频通话和短信相连,将为视频通话和短信增加更多互动和乐趣。
4. 相机胶卷
(1)三星AR可爱镜头
发布时间:2018.02.25 与三星S9同期发布
交互方式:全身动作捕捉、面部驱动、实时映射
外观:千面百态,全身定制3D卡通
该功能位于三星手机内置相机的AR体验区,简单的一站式模式让用户可以在一个地方使用其全系列基于现实的功能。用户可以通过“动态表情相机”功能创建一个与自己长得一模一样的数字形象;然后通过动态表情工作室制作带有自定义图案的服装;最后在动态表情贴纸功能中创建动态贴纸,可以通过微信、彩信等方式发送,还支持舞蹈录制等有趣的创作方式。
(2)小米梦拍
发布时间:2019.07.02
交互方式:真人面部捕捉、表情映射
外观:千面3D卡通
通过梦拍,用户可以对自己的脸部进行建模,一键生成与自己相似的3D形象。如果对自动生成的造型不满意,还可以进行修改编辑,包括发型、脸型、眼睛、眉毛、鼻子和嘴唇、胡须、雀斑、眼镜、配饰等。相册模块加入后,拍照和录像有了更多新玩法,用户可以用虚拟角色头像录制短视频,制作成表情包分享到社交平台或发到微信朋友圈。
5.虚拟社交平台
(1)Zizi中文版
上映时间:2018年12月下旬
交互方式:按钮控制、基于控件的短视频流推送
外观:千面百态,全身定制3D卡通
这是韩国SNOW公司出品的一款社交软件,主要面向Z世代用户。用户进入软件后,第一步是捏脸。系统会先帮用户拍照,生成一张大致相似的脸,然后用户可以在这张“基础脸”上进行任意修改。捏脸后,本着“我的美要让全世界看到”的理念,用户可以与其他用户在线合影。在仔仔的用户中,既有脸型和衣品高级的时尚达人,也有根据场景捏出最合适造型的技术达人,甚至有人用仔仔在小红书上试口红颜色、搭配衣服。
(2)腾讯超级QQ秀
发布日期:2022.02.10。
交互方式:多模态交互
外观:千面百态,全身定制3D卡通
此次升级版QQ秀完成了传统QQ秀虚拟形象从2D静态到3D动态的蜕变。超级QQ秀不仅拥有服装,还增加了虚拟形象的发型、脸型、五官等细节的自定义,此外还有更加精致的服饰,用户可以打造更加完整的形象。产品新增了可由用户自定义的小窝系统和可以走动聊天的户外场景,为QQ带来了传统线上社交模式所欠缺的临场感,超级QQ秀的场景化社交有了更多的想象空间。
6. 电商直播
(1)阿里云淘宝智能直播间
上映时间:2020年夏季
交互方式:文本识别、多模态智能交互
外观:每个人可定制面孔
阿里云推出了一款智能产品,利用智能技术驱动虚拟形象在前台自动播报并进行个性化推荐。商家在支付服务后,可以通过捏脸功能24小时使用品牌智能直播间挑选不同的服饰,添加品牌logo服饰,选择合适的声音和腔调,一键生成脚本,实现无人播报。虚拟人会自动选择识别买家留言做出正确回答,并插入买一送一、最低折扣等关键词效果,吸引买家关注。
以上就是小编对于移动虚拟人产品的探讨和总结,从技术面到应用面,希望能给对虚拟人产品感兴趣的朋友提供帮助和指导。
参考:
Z 世代洞察报告
搜狐:中国Z世代虚拟数字人的感受:开拓新社交圈的方式与可能
百度推出虚拟助手“度晓晓”:开辟创新搜索方式
搜狐:百度APP推出“龚俊数字人”:语音交互及搜索服务
搜狐:12功能体验:定制属于你的虚拟形象
IT之家:苹果升级推出:可模仿舌头
三星官网:Z Flip的AR区域提供哪些功能?
新浪网:小米CC9拥有亚洲人专属的发型和风格
界面新闻:仔仔,你还在玩吗?
APP:Zizi中文版介绍
21世纪经济报道:腾讯推出超级QQ秀,引领网络虚拟社交新时代
新浪创世:超级QQ秀背后:腾讯对网络虚拟社交新时代的思考
阿里云:品牌智能直播间