Synthesia为记者打造AI数字分身

Synthesia为记者打造AI数字分身。这家估值40亿美元的初创公司,基于记者报道训练出可回答常见问询的交互式化身,标志着AI在公共关系领域的应用迈出关键一步。

今年夏天,视频创业公司 Synthesia 的企业事务负责人 Alexandru Voica 向媒体展示了一个互动式虚拟化身。该化身经过专门训练,能够回答关于 Synthesia 的常见媒体问询。此前,在一次小组讨论中,公关人员曾询问是否介意使用人工智能生成的文本,而 Voica 展示的这一形象被视为人工智能在公共关系领域应用的一个标杆案例。

估值40亿美元的AI化身

九月份,Synthesia 邀请记者前往其位于纽约的新办公室进行参观。作为一家热门的数字化身初创企业,Synthesia 与 D-ID、HeyGen 和 Colossyan 等公司处于同一赛道。该公司在今年早些时候的估值达到 40 亿美元,去年其年度经常性收入(ARR)已超过 1 亿美元。

Synthesia 致力于帮助企业利用人工智能化身创建交互式培训视频,并近期推出了一款名为“角色扮演会议”的产品。在新办公室开幕期间,公司提议为来访记者制作一个专属的人工智能化身。

在此之前,对于化身的兴趣主要局限于社交媒体内容创作,例如有人在 Instagram 上利用个人形象生成数字内容以辅助发帖。此次是 Synthesia 首次为一名记者(也是除 Voica 以外的第一人)制作数字化化身。该化身基于记者关于“风险投资支持的初创企业比非风投支持企业犯下更多欺诈”的报道内容进行训练。

用户可通过点击“在新窗口中开始”与该化身互动,提问诸如“你在做什么?”等问题。示例问题包括:

  • 为什么要写这个故事?
  • 这篇论文是关于什么?
  • 研究人员发现了什么?

为了录制素材,记者进入了 Synthesia 办公室内的小型电影工作室。在同意相关条款后,“数字 Dom”正式诞生。团队为其创建了两种版本的个人化身:佩戴眼镜和不佩戴眼镜。由于该化身仅能阅读预先编写的脚本,因此属于非交互式版本。

随后,团队选定一篇文章用于训练交互式化身。虽然 Synthesia 允许客户选择其他实验室提供的替代方案(如 Cartesia、ElevenLabs、Google 或 OpenAI),但企业也可以选择将化身托管在任何指定的云端,或支付费用交由 Synthesia 托管。

技术流程方面,语音转文字模型负责将用户输入转化为文本,代理语言模型理解文本并执行相应操作,文字转语音模型将响应转化为音频,最后由 Synthesia 构建的视频模型对说话的化身进行动画渲染。

总体而言,Synthesia 构建了三种类型的产品:一是名为 Sessions 的代理平台,允许用户在调查或角色扮演中与化身互动;二是将 Synthesia 的视频和语音模型与其他技术服务结合的平台;三是上述提到的交互式化身解决方案。

制作过程耗时数天。首先测试的是个人语音版本,通过朗读通用脚本来检验人工智能声音的合成效果。当要求化身谈论纽约秋天时,生成的声音准确度较高,且未暴露录音样本中的瑕疵。

将该结果展示给部分非技术背景的朋友后,他们表示既感到有趣又觉得可怕。接着展示了决定性的交互式化身,即该化身仅回应被训练过的特定内容(在此例中为风险欺诈故事)。当朋友尝试询问记者之前的工作经历等未被训练的问题时,模型未予回答。

朋友们认为交互式化身的声音相似度不如个人化身高,但也给予了高度评价。有朋友开玩笑称:“我不记得生了你们两个。”这引发了关于新闻业未来的思考:人们是否愿意通过化身获取新闻报道?尽管已有投资者对此持拒绝态度,认为人工智能已渗透至社交媒体和新闻分享平台,但其他人则不确定这些工具能否增强甚至取代记者角色,以及首席执行官们是否更愿意与人工智能化身而非人类记者交流。

新闻工作的核心在于信任,这似乎难以外包给人工智能。然而,在新闻界之外,克隆自我想法可能具有吸引力,例如在假期后无需追赶工作进度,因为某个版本的自己可以随时回答问题。

目前尚不清楚美国企业将如何具体使用此类化身。但在克服最初的新奇感后,观察者注意到这种决定性的数字双胞胎永远不会眨眼、说新话或微笑。相比之下,如果人工智能是非决定性的,用户很容易陷入一种类似“AI 精神病”的状态。

一位投资者预测,Z 世代可能会将数字双胞胎视为科幻照进现实,因为电影中的一切似乎都已实现。但也有观点认为,数字化身仍不及真人自然,至少在《阿凡达》式的体验中,用户还可以选择退出。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读