返回首页
最新
我们注意到公司内部生成的代理产物正在大量涌现,但由于没有合适的地方来存放或评论这些产物,它们的实用性受到限制。我们正在开发Valet,以便为代理提供与人类协作的工具。
这是我对现代音乐可视化工具的理解。它由五个引擎、一个HDR管道和12个后期处理链组成。(包括LUT、光晕、辉光)<p>支持图像、视频、.milk、glsl、webgpu、three.js等多种格式。<p>功能包括:跨度、镜像、壁纸、标志、OBS、Spout(输入/输出)、Ableton、NDI、捕捉、游戏、工作坊等。<p>它既美观又独特,由一个人和他的狗共同打造。<p>它是免费的,并提供可下载内容(DLC),欢迎你成为首批体验者。音频路径是最具创新性的部分,你甚至不会察觉到它的存在。
我之前发过一次帖子,但想再分享一下,因为很多事情已经改变。现在有一个相当强大的机器人可以对战(由社区成员贡献),还有通信对局。这些因素的结合在寻找对手方面有所帮助。
你好,我是布莱恩。在Tavus工作了两年,我一直在开发对话模型。今天我想告诉你们我们的新音频理解模型:Sparrow-2!这是一个全新的模型类别,也是对话音频的独特新方法。
今年早些时候,我们推出了Sparrow-1,当时这是我们最先进的轮流对话模型。自从Sparrow-1发布以来,我花了很多时间去倾听人们的对话,努力理解人们何时该说话、何时该倾听以及何时该等待。我还在寻找当前最先进模型的失败模式。虽然Sparrow-1表现出色,但我发现了一些失败的模式。我们尝试用现有的方法解决这些问题,但解决一个问题往往会产生另一个问题。
Sparrow-1和许多现有的轮流对话模型需要噪声消除技术,以便将说话者的音频与背景噪声隔离。在去除“噪声”后,这些模型依赖于简单的韵律和语音线索来判断轮流结束的时机。它们会忽略掉大量重要信息。
非语言线索、声音和环境噪声都会影响轮流对话。噪声消除模型假设所有无法转录的内容都是噪声,但这并不正确。人类使用呼吸、叹息和其他声音来保持对话的主导权或争取发言机会。在对话中,存在不断的微小打断、肯定声、安静的人声和环境声音,这些都为对话场景增添了色彩。这些声音是我们理解对话空间微妙之处的重要组成部分!消除“噪声”会产生破坏性的副作用,导致对话流失。
现在,借助Sparrow-2,我们不仅仅建模主要说话者的可转录音频,而是训练一个模型来处理所有声音,让它决定在对话流中什么是重要的,什么不是。我们的新模型能够持续接收音频,并理解语义、韵律、时机、说话者身份、叹息、呼吸、反馈、打断、背景语音和难以理解的音频,目标是根据音频的状态理解代理应该做什么。
Sparrow-2融入了我们更大的模型家族,并解锁了在生产环境中前所未见的新对话行为。它可以向对话的不同部分传递信号。例如,如果用户所在的房间太吵,机器人会建议用户移到一个更安静的地方。此外,Sparrow-2是半双工的:它考虑声音与AI语音以及用户语音之间的时机关系。
我们在Sparrow-2上的主要目标是最终破解鸡尾酒会问题:如何在嘈杂环境中与用户进行类人对话。
我在这里写了一些关于模型架构的技术细节:<a href="https://www.tavus.io/blog/sparrow-2">https://www.tavus.io/blog/sparrow-2</a>
我希望你们能试一试,并告诉我你们的想法和感受。