← 返回 2026-09-27 简报

我创建了一个互动的数字分身——你可以与它对话

I created an interactive digital avatar of myself — and you can talk to it

语音播报
摘要
事件:TechCrunch记者Alexandru Voica利用Synthesia平台创建了可交互的数字分身,该分身基于其关于风投初创公司欺诈行为的报道进行训练。 要点:Synthesia估值达40亿美元,ARR超1亿美元。技术栈整合语音转文本、代理语言模型及视频生成,仅回答预设问题。 影响:展示AI在公关和新闻领域的深度应用潜力,引发对数字克隆技术伦理及未来新闻业信任机制的广泛讨论与反思。

今年夏天,当视频生成初创公司Synthesia的企业事务负责人Alexandru Voica给我发来链接,介绍其公关团队的新成员时,我感到十分惊讶。那是他的一个交互式虚拟化身,经过训练可以回答关于Synthesia的常见媒体问题,比如它是做什么的、如何运作等。就在前一天,我还在一个小组讨论中,有公关人员问我是否介意使用AI生成文本的推介材料。但Alexandru的化身超越了这一点——在我看来,这似乎是AI在公关领域应用的“最终Boss”。

9月,Synthesia邀请我前往其在纽约的新办公空间。Synthesia最初总部位于英国,与D-ID、HeyGen和Colossyan等其他公司一起,成为炙手可热的数字虚拟化身初创企业之一。该公司今年早些时候估值达到40亿美元,并曾宣布去年其年度经常性收入(ARR)已突破1亿美元。

Synthesia让企业能够利用AI虚拟化身构建交互式培训视频,最近还推出了一款名为“Roleplay Sessions”的产品,允许员工与交互式AI虚拟化身进行练习,例如模拟销售推介,该化身会对员工的回答做出回应并评分。

当我参加新办公室开业活动时,他们问我是否想要一个属于自己的AI虚拟化身,我甚至没有犹豫就答应了。当然,我想要一个自己的数字分身。那天我的穿搭很可爱,发型也很完美。

在见到我的数字分身之前,我对虚拟化身一直持 indifferent(无感)态度,但我认为它们不可避免地会成为日常网络生活的一部分。我听说有人在Instagram上创建以他们为原型的化身,以帮助制作社交媒体内容。我觉得这一切都非常有趣,这也可能是我现在毫无顾虑地向大家展示我的数字分身的原因。这是Synthesia首次为记者(或除Voica以外的任何人)制作数字虚拟化身。它基于我关于“为何获得风险投资支持的初创公司比未获风投支持的初创公司更容易实施欺诈”的报道进行训练,且仅能回答与该报道相关的问题。

下方只需点击“在新窗口中开始”即可启动。

你可以向它提问,例如:

我为何决定撰写这篇报道?

那篇研究论文是关于什么的?

研究人员发现了什么?

为了制作这个化身,我进入了Synthesia办公室内一个迷你摄影棚,他们拍摄了我的大量照片,并录制了我两分钟的声音。我必须同意制作这些虚拟化身,于是,“数字Dom”就此诞生。他们为我创建了一个个人虚拟化身(仅朗读我提供的脚本)——有戴眼镜和不戴眼镜两个版本;还为我制作了两个交互式虚拟化身(可以对话并聆听我的声音),同样也提供了戴眼镜和不戴眼镜的版本。

我们选择了一篇文章作为训练交互式化身的基础,随后其中一个团队构建了我的交互式化身,其技术核心结合了语音转文本、视频、语言以及文本转语音模型。我的化身的技术栈包括Synthesia自有的视频和语音模型,尽管该公司也允许客户从Cartesia、ElevenLabs、Google或OpenAI等其他实验室选择替代方案。企业还可以选择将他们的虚拟化身托管在任意云平台上,或者付费让Synthesia代为托管。

语音转文本模型将人们说的话转化为文字,代理式语言模型理解文字内容并可根据其采取行动,文本转语音模型将回应转化为音频,最后由Synthesia构建的视频模型在化身说话时驱动其动画表现。

总体而言,Synthesia构建了三种类型的产品:一是带有经典虚拟化身的视频创建和分发平台,用户输入脚本后,虚拟化身会复述;二是名为Sessions的代理式平台,用户可以在调查或角色扮演中与虚拟化身互动;三是API平台,用户可以将Synthesia的视频和语音模型与其他技术服务结合,构建交互式虚拟化身或其他类型的产品。

Synthesia团队花了我几天时间才制作好我的虚拟形象。我先试用了个人版,输入了一段相当通用的脚本,以测试我的AI声音效果。我让它讲述纽约秋天到来的故事,那是我最喜欢的季节。声音相当逼真,我很高兴它没有录进我在录制音频样本时带有的沙哑声。

我把视频展示给一些非技术背景的朋友看,他们觉得既有趣又令人毛骨悚然。

接着,我向他们展示了我的互动版,它是确定性的,意味着它只会说出经过训练以回应的内容。在这种情况下,那就是我讲述的风投欺诈故事。我问了它诸如我在加入TechCrunch之前在哪里、住在纽约的哪个区域等问题,但每次它都将话题引回那个故事。

我的朋友觉得声音不太像我的,认为相似度不如个人版,但尽管如此,其逼真程度仍足以让人感到些许不安。我妈称之为“太神奇了”,这在她看来是极高的评价。她和爸爸一直试图问它一些“只有他们才知道的”关于我的问题——但模型并未作答,每次都把话题转回风投欺诈故事。

在测试完这个模型后,她开玩笑说:“我不记得给你们俩接生过。”

这次经历让我思考新闻业的未来会是什么样子。人们能接受打开电视看新闻时,由虚拟形象来播报吗?一位投资者立刻表示不行。当然,如今充斥着大量侵入社交媒体和其他新闻分享平台的AI生成垃圾内容,引发了强烈的抵触情绪。但我问过的其他人则不那么确定。虚拟形象能否增强——甚至取代——记者?首席执行官们是否更愿意与AI虚拟形象的记者交谈,而不是真人记者?

我喜欢我职业生涯中与人联系、撰写故事以及研究新话题的部分。但新闻业最核心的部分是信任。这似乎永远无法外包给AI。

除了新闻业之外,我确信“克隆自己”这一概念可能颇具吸引力。再也不用在假期或度假后补做工作,因为你的一个分身可以随时随地待命,回答问题。

我们还得看看虚拟形象在美国企业界的使用将如何演变。但现在我自己拥有了一个,心情颇为复杂。在度过最初的猎奇阶段后,我在它停止说话后仔细端详着它,并等待着——等什么呢,我也不确定。也许我在等它眨眼。或者等它说些新话,或者微笑,或者只是让我知道它“存在”。

因为我的数字分身是确定性的,它们永远不会那样做。但我能想象,如果有人面对一个非确定性(即由可以自由发表高论的聊天机器人驱动)的分身,很容易陷入轻微的AI精神错乱状态。

我曾对一位投资者说过,无论数字分身的未来如何,我预测我们这一代Z世代可能很难适应它们。它们感觉太像科幻了:电影里看到的一切如今都成了现实。但我得说,我发现虚拟形象比人形机器人没那么让人不适。至少对于虚拟形象来说,如果情况变得诡异,我总是可以下线。

不过在那之前,这是我的个人虚拟形象,为您梳理本周我们网站上的所有头条新闻!

本条评分 12.6 score-v1
  • 来源权威 10
    注册表 priority=10(TechCrunch AI)
  • 时效 2.547
    发布 8.5 小时前,衰减到 2.55/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-27 · 12.55 分

原文链接:https://techcrunch.com/2026/09/26/i-created-an-interactive-digital-avatar-of-myself-and-you-can-talk-to-it/
来源:TechCrunch AI
以上内容由 AI 自动翻译,仅供参考。
← 返回简报