返回首页
最新
我正在构建Echo(<a href="https://echo.tracerml.ai" rel="nofollow">https://echo.tracerml.ai</a>),这是一个尝试将多个开放权重模型整合成一个AI系统的实验,而不是选择单一模型来处理所有任务。
这个项目始于一个简单的实验。我选择了一组模型,包括GLM-5.2、Kimi K2.7等,并对它们进行了相同的评估。然后,我测量了如果对于每个问题,事先知道哪些模型会有用以及如何组合它们的输出,会发生什么。
这个假设的系统在性能上显著优于池中任何单个模型。当然,这并不是一个可以实际部署的系统,因为它依赖于在看到结果后才能知道哪些决策是好的。Echo是我试图在没有事先信息的情况下恢复这种优势的尝试。
对于每个请求,Echo会决定分配多少计算资源,哪些模型应该参与,以及如何组合它们的工作。有些提示可能只需要相对少量的推理,而其他提示则可以从多个模型在问题的不同部分上协作中获益。
在构建过程中让我感到惊讶的一点是,这些模型之间的互补性。一些整体表现明显较弱的模型,在特定问题上仍然可以非常有用,或者作为组合的一部分。
在我的第一次评估中,Echo的表现始终优于其池中最好的单个模型。它的总体结果也大致与Fable相当,而Fable是我用作比较系统之一的较强模型,且推理成本约为其三分之一。
当然,Echo仍然存在一些错误的分配或组合决策的情况。我目前花费大量时间来理解这些失败,并测试这种方法在编码和代理任务中的表现,因为在这些任务中,评估每个决策的质量变得更加困难。
我构建了一个聊天界面(echo.tracerml.ai)和一个兼容OpenAI的API(<a href="https://echo.tracerml.ai/docs/api" rel="nofollow">https://echo.tracerml.ai/docs/api</a>),以便在评估设置之外测试该系统。
这里有一个简短的高层次视频,介绍它是如何工作的:<a href="https://www.youtube.com/watch?v=lJFJSvOdXhg" rel="nofollow">https://www.youtube.com/watch?v=lJFJSvOdXhg</a>
我在这里写下了评估方法、各个模型的结果、成本和当前的局限性:<a href="https://echo.tracerml.ai/eval" rel="nofollow">https://echo.tracerml.ai/eval</a>
我非常希望你能试试它!特别是如果你遇到任何奇怪的失败案例或分配看起来不直观的地方。
嗨,HN。这是我在开源的 Open Notebook 平台上构建的一个个人侧项目,已经进行了大约六个月的开发(链接:<a href="https://github.com/lfnovo/open-notebook" rel="nofollow">https://github.com/lfnovo/open-notebook</a>)。
Notebooker 可以保存你在标签页和书签中可能会丢失的内容——链接、PDF、音频、视频——并在后续使用中变得有用:你可以与笔记本聊天,获取引用确切来源的答案,将阅读列表转换为播客集(私有 RSS 源,适用于任何播放器),或者从你自己的资料中生成学习材料。
我最享受的部分是创建类型的插件引擎——闪卡、图表、信息图、思维导图、教科书、论文、幻灯片、时间线、维基等都是各自的插件,可以在不触碰核心代码的情况下添加新的插件。我在 open-notebook 上构建的所有内容都已作为 PR 提交到上游,或者在这里开源:<a href="https://github.com/Notebooker-ai" rel="nofollow">https://github.com/Notebooker-ai</a>。
这个群体可能关心的决策:
- 自带 AI 密钥(OpenAI、Anthropic、本地/OpenAI 兼容端点)或使用内置的默认设置。我喜欢测试 Cloudflare Worker 的 AI 模型。你保存的任何内容都不会用于训练。你可以在这里部署自己的 OpenAI 兼容端点进行实验:<a href="https://open.notebooker.ai" rel="nofollow">https://open.notebooker.ai</a>。
- 如果你希望将文件存储在自己控制的桶中,可以自带 S3 兼容存储(R2、Spaces、AWS)。
- 支持进出 Webhook——任何可以 POST JSON 的内容都可以触发工作流,而工作流可以 POST 到任何地方。Notebook 还处理传入的 RSS 源并生成自己的内容。
- 一键导出所有内容或删除你的账户。这里有一个仅供查看的演示笔记本:<a href="https://app.notebooker.ai/demo" rel="nofollow">https://app.notebooker.ai/demo</a>。
欢迎随时提问。我预计在发布时会遇到一些小问题,欢迎反馈或报告错误。
我为我和我的合作伙伴创建了一个Telegram代理,我们可以向它发送我们吃过的食物的照片或描述,它会记录我们的宏观营养素。我想建立一个“食物记忆”功能,比如我可以说“喝了我常喝的奶昔”,它就能记住这个奶昔的宏观营养素分解情况。<p>我想了解目前针对这种类型的代理记忆的最佳方法是什么?非常感谢相关的论文、文章、推文或GitHub链接!