3作者: nnww6 天前原帖
我正在构建 Rebuno,这是一个开源的执行运行时,用于在生产环境中操作 AI 代理。它管理不同框架构建的代理之间的执行状态和安全边界。 代理作为 HTTP 服务运行。Rebuno 通过签名的 Webhook 分配工作,并在 Postgres 中保持执行状态。代理在执行之前将工具和模型调用提交给 Rebuno,作为步骤。 对于每个新步骤,Rebuno 会根据每个代理的 YAML 策略进行评估,这与模型的提示无关。它可以允许调用、拒绝调用或等待人工批准。代理执行被允许的调用并报告其结果。策略决策和步骤结果都记录在一个仅追加的事件日志中。 在中断后,代理从顶部开始其处理程序。具有记录结果的步骤将返回这些结果,而不是重新执行。崩溃也可能导致某个工具没有记录结果。标记为 safe_to_retry 的工具会重新运行,而标记为 at_most_once 的工具则会失败,结果不确定。代理如何处理不确定的步骤取决于其实现。 目前提供 Python 和 TypeScript SDK,代码库中包括使用 LangChain、CrewAI、Pydantic AI、Vercel AI SDK 和 Mastra 的示例。 Rebuno 可以免费自托管,并在 MIT 许可证下发布。 我很想听听其他人如何在生产环境中运行或操作代理。 博客文章及图示: [https://rebuno.io/blog/introducing-rebuno](https://rebuno.io/blog/introducing-rebuno) 入门指南: [https://docs.rebuno.io/getting-started](https://docs.rebuno.io/getting-started)
7作者: toebee6 天前原帖
大家好,我是Nari Labs的Toby。 我们一直在努力让开源语音模型变得超级快速。去年,我们开发了Dia,这是第一个能够进行自然对话的开源文本转语音模型。从那时起,许多优秀的语音模型也相继向公众发布。 但市场仍然被闭源模型主导。我们认为这是一个推理问题。现有的系统如vLLM/SGLang并不适合多模态推理。为了证明这一点,我们构建了一个专门针对Qwen3-TTS的推理引擎,并将其开源([https://github.com/nari-labs/nari-qwen3-tts](https://github.com/nari-labs/nari-qwen3-tts))。该引擎在10 RPS下的延迟低于50毫秒,显示出开源模型可以运行得更快且成本更低。 从那时起,我们一直在努力为所有人提供便宜、快速和高质量的服务。我们甚至在某些方面超越了闭源模型! 在备受引用的Coval(YC S24)语音AI基准测试中,我们的Qwen3-TTS端点不仅在延迟上排名第二,而且在准确性(WER)上排名第一,超越了11Labs、Cartesia等,同时也是最便宜的端点。我们的Qwen3-ASR端点具有最低的延迟和第二高的准确性,仅比第一名低0.1%。它是名单上第二便宜的模型。 为了让这些模型快速、高效且保持低成本,我们进行了大量巧妙的推理工程。有趣的是,阿里巴巴的官方端点在准确性和延迟方面似乎表现不如我们的。不过,还是要对Qwen团队表示感谢,感谢他们开源了这些出色的语音模型。 我们希望继续降低价格,让语音技术成为一种商品——这样每个应用都能拥有出色的文本转语音和语音转文本功能,而不必担心单位成本。我们还在研究音频的其他部分,如说话者分离,以及视频和世界模型推理。敬请期待更多更新!
2作者: Aditya_03156 天前原帖
创建一个AI辅导员,它不会让你在没有学习任何东西的情况下继续进步——不仅仅是完成测试。你会接受训练,诊断理解上的任何问题,并且现在有一个实时语音挑战,你需要用口头方式向AI解释你的回答,然后它会通过额外的问题深入探讨。 这个语音功能是我在怀疑与人交谈时假装理解某件事要比选择一个合适的多项选择答案困难得多的情况下创建的。但说实话,我不知道这是否是一个有价值的想法,还是我对自己创造的最复杂事物的依恋的又一个表现。 所以,我想认真问的问题是:什么能帮助你信任AI对你理解能力的诊断?这是否值得,还是我应该坚持使用间隔重复的方法并信任自己?
4作者: dani42996 天前原帖
最近我意识到,人们希望对自己的数字数据有更多的控制权。这一点在我看到索尼最近的公告遭到反对时变得更加明显。人们甚至考虑再次盗版音乐,仅仅是因为他们想要对自己的数据有更多的控制。 因此,我一直在思考,几乎每个家庭现在都有一定量的数字数据需要管理,有些家庭的数据量甚至更多。 考虑到当前自托管和网络附加存储(NAS)产品的情况,您认为需要改变什么,以使普通消费者考虑自托管或NAS产品呢?