1作者: khurdula4 个月前原帖
大多数人工智能产品都是围绕同一个理念构建的。<p>采用一个大型模型,添加一个提示,然后希望它能完成整个工作。这就像是人工智能版的“喷洒式祈祷”。<p>这种方法在聊天机器人、代码生成、网站设计和电子邮件撰写等创造性输出方面效果很好。但是,对于那些需要高度确定性输出的开发工作,这种方法很快就会失效。比如,银行的KYC(了解你的客户)中的光学字符识别(OCR)或医生与患者之间的音频识别。<p>我们已经对特定任务训练了结构化语言模型(SLMs)一段时间。在这个过程中,我们不断看到同样的模式。尽管有着优秀基准的最先进语言模型(SOTA),但在实际重要的部分却失败了:例如,读取像1040表格这样密集的PDF,从高度保护的网站提取干净的数据,快速转录长时间通话中的发言,或以代码可以信任的格式返回输出。<p>因此,我们花了一年时间研究如何解决确定性问题。正如我们许多人所想的,更多的数据是解决方案。但实际上并非如此……虽然数据是问题的一部分,但重新思考架构才是解决上下文漂移等问题的关键。<p>请查看我们的论文:<a href="https:&#x2F;&#x2F;arxiv.org&#x2F;abs&#x2F;2602.04101" rel="nofollow">https:&#x2F;&#x2F;arxiv.org&#x2F;abs&#x2F;2602.04101</a>(已被IEEE CAI 2026接收)<p>过去的传统人工智能/机器学习模型,如YOLO、EasyOCR、PaddleOCR,通常在单一任务上表现出色,能够提供一致的输出,如置信度评分,但在规模扩大时很快就会过时,受限于用于训练的数据,同时需要一支机器学习工程师团队来维护模型,从而提高了成本。大型语言模型(LLMs)提供了更高的灵活性和与自然语言互动的能力,使其具有可推广性,但在对敏感任务的处理上却容易产生幻觉,无法容忍错误。<p>我们将深度神经网络(DNNs)/卷积神经网络(CNNs)与变换器(Transformers)结合,构建了一个状态模型,兼具传统机器学习模型的优势:确定性和可靠性,以及大型语言模型的可推广性。<p>Yoeven和我拥有超过14年的综合研究和开发经验,我们组建了一支出色的研究人员、软件和基础设施工程师团队,专注于人工智能模型在开发任务中可以做更多工作的事实。这使我们能够在您技术栈的每个部分提供可控的人工智能。
3作者: Desafinado4 个月前原帖
我目前的情况是,我理解单元测试的重要性以及测试驱动开发(TDD)的工作原理,但在实际操作中,我并没有太多机会去实践。我的工作技术并不太适合这种测试方式。 尽管如此,我还是希望找到一些关于这些主题的阅读材料,这些材料不仅仅涵盖基础知识,还能深入探讨,以便我能尽量获取一些如果我定期进行这些实践所能获得的高级经验。
11作者: simple104 个月前原帖
这个项目(Agents Observe)最初是为了探索围绕 Claude 代码构建自动化工具。我需要一种方法来实时查看代理团队的具体操作,并对它们的输出进行过滤和搜索。 从构建和使用这个工具中,我获得了一些有趣的经验: - Claude 代码的钩子是阻塞的——如果有很多使用钩子的插件,性能会迅速下降。 - 钩子提供的信息比 OTEL 数据要有用得多。 - Claude 的 jsonl 文件提供了完整的视图。 - 插件启动的 MCP 进程的生命周期管理在最佳情况下也有些笨拙。 最大的收获是,当我切换到后台(火并忘记)钩子并移除所有其他插件时,Claude 的性能提升了很多。很容易忘记我安装了多少 Claude 插件,以及它们对性能的影响。 Agents Observe 插件使用 Docker 启动 API 和仪表板服务。这是一个我希望在安全(想想 Axios 黑客事件)方面能更常用的模式。棘手的部分是处理多个 Claude 实例之间的进程管理——解决方案是让服务器跟踪活动连接,然后在不使用时自动关闭自己。当新会话启动时,插件再将其重新启动。 这个工具对我日常工作流程非常有帮助。希望你喜欢!