5 分•作者: code_brian•大约 1 个月前
大家好,我是Brian。在过去的两年里,我一直在Tavus公司致力于对话模型的开发。今天,我想向大家介绍我们全新的音频理解模型:Sparrow-2!它开创了一个新的模型类别,并为对话音频提供了一种独特的全新方法。 今年早些时候,我们推出了Sparrow-1,当时它是我们领先的轮流发言模型。自Sparrow-1发布以来,我花了很多时间倾听人们的交谈,并努力真正理解人们是如何知道何时说话、何时倾听以及何时等待的。我还一直在寻找当前领先模型的失败模式。虽然Sparrow-1很棒,但我看到了一些失败的模式。我们尝试用现有的方法解决这些问题,但解决一个问题只会带来另一个问题。 Sparrow-1以及许多现有的轮流发言模型需要降噪来将说话者的音频与背景噪音隔离开来。在去除“噪音”后,这些模型依赖于简单的韵律和语音线索来决定何时一个发言回合结束。它们丢弃了信息,然后只关注一小部分口头和韵律线索。这种方法忽略了大量重要信息。 非语言线索、声音和环境噪音都会影响轮流发言。降噪模型假设所有无法转录的内容都是噪音,但这是错误的。人类使用呼吸、叹息和其他声音来保持对话的发言权或争取发言机会。存在持续的微小打断、肯定、安静的人声和环境声音,这些都增加了对话的复杂性。这些声音是我们用来理解对话空间细微差别的一部分!消除“噪音”会带来破坏性的副作用,即消除了对话的流畅性。 现在,有了Sparrow-2,我们不再仅仅对主要说话者的可转录音频进行建模,而是对所有声音进行训练,让模型自行决定在对话流程中什么重要,什么不重要。我们的新模型持续流式传输音频,能够理解语义、韵律、时机、说话者身份、叹息、呼吸、附和声、打断、背景语音和无法辨认的音频,目标是根据音频状态理解代理应该做什么。 Sparrow-2融入了我们更大的模型家族,并解锁了前所未有的、可投入生产的对话流程中的新对话行为。它可以向对话的不同部分传递信号。例如,如果用户身处一个嘈杂的环境,机器人会要求用户移到一个更安静的地方。此外,Sparrow-2是半双工的:它会考虑音频时机与AI语音以及用户语音的关系。 我们使用Sparrow-2的主要目标是最终解决“鸡尾酒会问题”:如何在嘈杂的环境中与用户进行一对一的、像人一样的对话。 我在这里写了一些关于模型架构的技术细节:<a href="https:&#x2F;&#x2F;www.tavus.io&#x2F;blog&#x2F;sparrow-2">https:&#x2F;&#x2F;www.tavus.io&#x2F;blog&#x2F;sparrow-2</a> 我非常希望大家能尝试一下,并告诉我你们的想法和感受。