Soul App实时人像视频生成研究成果获国际学术顶会CVPR2025录用

近期,IEEE国际计算机视觉与模式识别会议( Conference on Computer Vision and Pattern Recognition)CVPR 2025公布论文录用结果,社交平台Soul App技术论文《Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation》(《基于自回归动作生成的实时流式音频驱动人像动画系统》)被接收。

 Soul App实时人像视频生成研究成果获国际学术顶会CVPR2025录用

Soul App团队在论文中提出了一个新的面向实时音频驱动人像动画(即Talking Head)的自回归框架,解决了视频画面生成耗时长的行业挑战外,还实现了说话时头部生成以及人体各部位运动的自然性和逼真性。此次论文的入选,也证明了Soul App在推动多模态能力构建特别是视觉层面能力突破上取得了阶段性成果。

CVPR是人工智能领域最具学术影响力的顶级会议之一,是中国计算机学会(CCF)推荐的A类国际学术会议。在谷歌学术指标2024年列出的全球最有影响力的科学期刊/会议中,CVPR位列总榜第2,仅次于Nature。

根据会议官方统计,本次CVPR 2025会议总投稿13008篇,录用2878篇,录用率仅为22.1%。相较2023年(25.8%)、2024年(23.6%),录用率的持续下降也凸显了CVPR不断严格的审核标准,以及论文入选竞争的逐年激烈。

对Soul而言,研究成果再次入选国际顶级会议,证明了团队在AI领域,特别是多模态方向的自研能力受到行业和学术界认可。2024年,Soul多模态情感识别研究论文《Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout》(《基于视觉语言提示与模态暂退的多模态情感识别》),入选ACM国际多媒体会议(ACM International Conference on Multimedia,ACM MM 2024)上组织的多模态与可靠性情感计算研讨会MRAC 24。而在人工智能领域顶级的国际学术会议之一——国际人工智能联合会议组织的第二届多模态情感识别挑战赛(MER24)上,Soul技术团队还在SEMI(半监督学习)赛道获得第一名。

作为较早思考将AI应用于社交领域的平台,2016年Soul在上线后快速推出了基于AI算法的灵犀引擎,重构关系网络发现的新模式,受到了广大用户的热烈反馈,也坚定了平台对AI持续投入的发展路线。2020年Soul开始启动AIGC技术研发工作,在智能对话、语音、3D虚拟人等方面拥有前沿积累,并较早将重点聚焦在多模态方向。

自2023年推出自研语言大模型Soul X后,Soul已陆续上线了语音生成大模型、语音通话大模型、音乐生成大模型等语音大模型能力。目前,Soul AI大模型能力已整体升级为了多模态端到端大模型,支持文字对话、语音通话、多语种、多模态理解、真实拟人等特性,能够实现更接近生活日常的交互对话和“类真人”的情感陪伴体验。

在Soul看来,AI融入社交场景,除了需要AI介入内容表达以及关系的发现、建立、沉淀等环节,提高社交效率和社交体验,同时也需要AI作为交互对象向个体提供情绪价值。而这要求团队必须加快提升AI的感知能力和交互能力,即需要在语音、视觉、NLP的融合上下功夫,让用户能实时与具备形象、表情、记忆的 AI 多模态交互,而这也是更接近真实社交互动的方式。

在近期接受媒体采访中,Soul App CTO陶明这样解释团队关注视觉交互的逻辑,“从交互的信息复杂度来讲,人和人面对面的沟通是信息传播方式最快的,也是最有效的一种。所以我们认为在线上人机交互的过程当中,需要有这样的表达方式。”

此次论文的研究成果正是Soul在融合视觉的多模态交互方向的积极探索。在论文中核心介绍了Soul团队为提高视频生成效率以及生成效果的拟人性、自然度所提出的创新方法。

该论文的动机是解构diffusion-base的模型关键步骤,用LLM和1step-diffusion进行重构,融合视频模态,使SoulX大模型成为同时生成文字、语音、视频的Unified Model。

具体而言,将talking head任务分成FMLG(面部Motion生成)、ETM(高效身体Movement生成)模块。FMLG基于自回归语言模型,利用大模型的强大学习能力和高效的多样性采样能力,生成准确且多样的面部Motion。ETM则利用一步扩散,生成逼真的身体肌肉、饰品的运动效果。

实验结果表明,相比扩散模型,该方案的视频生成效率大幅提升,且从生成质量上来看,细微动作、面部身体动作协调度、自然度方面均有优异表现。

在Soul多模态大模型能力方向基础上,该方案的提出将有助于AI构建实时生成的“数字世界”,并且能够以生动的数字形象与用户进行自然的交互。

此前,Soul基于自身的多模态大模型能力上线了语音交互功能,受到了用户的热烈讨论和积极反馈。如今,从语音到视觉的模态升级,也意味着交互方式的颠覆式改变。

后续,Soul将把最新的AI能力尽快落地到站内多元场景中,如即将上线的实时视频通话能力将融入平台的AI虚拟人情感化陪伴体系“虚拟伴侣”、多对多互动场景“群聊派对”等功能中,进一步提升平台AI虚拟人的交互能力,以及人机交互的在场感和情感温度,为用户带来有趣、温暖的社交体验。

文章来源于网络。发布者:火星财经,转载请注明出处:https://www.sengcheng.com/article/41559.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
火星财经的头像火星财经
央视特别报道千尺学堂“银发模式”:学游康养多元体 塑造老龄服务新生态
上一篇 2025年3月22日 下午3:27
“星”程启航,共筑高峰:中国石油车辅业务迈入新纪元
下一篇 2025年3月22日 下午3:28

相关推荐

  • “投机之王”蔡文胜:高点套现,拖累美图?

    2月25日,港股美图公司(01357.HK)披露,公司主要股东、创始人、前董事长蔡文胜,于2025年2月17日至2月21日期间通过Longlink Capital Ltd出售了公司1.28亿股股份,占公司已发行股份总数约2.81%,本次减持后,蔡文胜持股比例由23.02%降至20.62%。 照均价计算,蔡文胜此次套现超过了7.8亿港元,约合人民币7.28亿元…

    2025年3月6日
    33600
  • 百年老公寓,为何抢着买?

    近期,拥有120多年历史的纽约华尔道夫公寓首批成功出售,根据官方记录,销售额超过700万美元。此次纽约华尔道夫公寓的回归,或将会再次刷新纽约最奢华公寓的标准。事实上,近年来不少“百年”公寓焕新回归,在住房及租房交易市场十分火热,其投资价值和使用价值不断被刷新,购买者的年纪也趋向年轻化……这些“老”公寓资产正在发生哪些变化? 华尔道夫公寓高价开售 近期,纽约华…

    2025年2月19日
    31800
  • 超薄手机将至,但后摄的“抉择”可能会成为大问题

    众所周知,在今年的手机市场里,“超薄设计”注定会成为一个非常重要的新方向。而造成这个方向重新受到重视的原因,除了消费者审美的变迁之外,自然也有各方面技术进步的推动。 比如最近这两三年,旗舰SoC的能效比和性能一次比一次进步明显,尤其是到了去年秋季,骁龙8至尊版和天玑9400在高负载游戏下的功耗水平,甚至只有过去旗舰平台的一半左右。显然,这就给更薄的机身设计赋…

    2025年2月19日
    35300
  • 视觉中国再陷争议:“碰瓷维权” 引众怒,赔钱道歉后乱象该终结了

    视觉中国(000681.SZ)再度成为舆论焦点。 11月22日,视觉中国及其两家关联公司就侵权摄影师戴建峰一案发布致歉声明,这场历时两年的诉讼以其被判赔偿1.5万元、公开道歉落幕。 法院认定其非法销售戴建峰照片并反向索赔的行为不当,而这已是视觉中国继2019年“黑洞照片版权”“国旗国徽图库收录”争议后,再陷版权风波。 版权争议未平,业绩压力又至。2025年前…

    2025年11月25日
    36500
  • 一年狂卖150亿,运动相机从社交货币到“吃灰神器”

    随着影石创新科创板IPO获批,运动相机市场热度再获印证。 据招股书披露,在2021年至2024年6月的报告期,影石创新的收入分别达到约13.28亿元、20.41亿元、36.36亿元和24.28亿元。其在报告期内的净利润分别约为2.66亿元、4.07亿元、8.3亿元和5.18亿元。 行业扩张态势为这一增长提供了注脚。 据华经产业研究院发布数据显示,全球手持智能…

    2025年3月10日
    26400

发表回复

登录后才能评论
关注微信