火山语音首个数字人产品经理小灿原来是这样炼成的!

近日,火山语音发布了首位超写实数字员工小灿,在同步推出的首秀TVC中,小灿凭借高效的工作能力以及温暖可人的性格引起多方关注,她的到来将会引领怎样的改变?

善听会说能想:提升工作效率的好帮手

小灿作为火山语音团队联合朝夕光年江南团队共同打造的S级超写实数字人形象,名字源于“火山”两字的结合,拼音“can”在英文中表示“可以、能够”的意思,这也意味着小灿从“出生”就是工作的最佳辅助。虽然加入数字人产品矩阵不久,但小灿同样依托团队长期积累的成熟语音交互技术,具有语音识别、自然语言处理、情感识别等多种功能,传承“善听”、“会说”、“能想”的多重能力,能够做到与用户面对面实时交互来提供更加高效服务。

图片2.jpg

亲和友好真实: 工作场景下的‘副驾驶’

尽管小灿是虚拟数字人,但火山语音团队仍然通过强大的技术能力,帮助TA构筑了从外形、动作到语言、情感交互的超写实形态。外形上,凭借团队3D超写实数字人整套形象设计、资产制作、高成本影视级cg管线视频内容的制作能力,让小灿无论在外形动作,还是面部微表情抑或是皮肤肌理、发丝材质等各方面高度逼真,深度还原了真人影像,改变了大众对数字人的一贯认知。

图片3.jpg

除却精致的外在,小灿通过火山语音团队丰富且领先的对数字人AI的驱动能力,实现了更加近似真人的口型动作表现。例如AI驱动口型方面,团队通过使用行业领先的非自回归模型的唇形生成网络,合成与输入文本或语音完全匹配的唇形,准确率高达98.55%。

“在AI驱动动作上,我们基于创新的Motion Blening技术,在动作切换时可生成过度帧,使数字人在切换各类动作时不仅可以做到毫秒级切换,还可以做到平滑效果自然无感知。”除此之外还在AI表情口型联合建模,基于语音语义的动作生成即co speech技术上,都有极具前瞻性的预研工作,并已取得阶段性成果,后续将全部应用于数字人视频创作、交互以及直播等场景。

值得提及的是,小灿还具备“一条音频秒级别音色复刻”(zero shot TTS)的能力,可以做到高保真还原真人音色、说话风格以及声学环境等特点,在核心技术架构全自研的基础上,关键指标均保持业界前沿。此外韵律模块基于自回归GPT类大模型,目前训练数据超过20万个小时,架构可扩展性很强,未来预计可支持100万小时以上数据训练;模块支持code-switch,即无论prompt为中文或者英文,都可支持直接输出中文、英文及混合内容。整体来说,小灿无疑是目前数字人研发领域艺术与技术高度融合的产物,但她不仅仅是一个超写实数字人形象,更是高效且有温度解决问题的好帮手。

(免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。
任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,应及时向本网站提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明。本网站在收到上述法律文件后,将会依法尽快联系相关文章源头核实,沟通删除相关内容或断开相关链接。 )