返回首页
最新
我构建了一个小型库,用于验证大型语言模型(LLM)的输出是否符合约束,并在失败时进行重试。
核心观点:LLM 并不总是可靠地遵循指令,但你可以低成本地捕捉失败并通过有针对性的反馈进行重试。这本质上是一个轻量级的“过程奖励模型”,不需要任何训练。
工作原理:
1. 你的 LLM 生成输出
2. ai-assert 将其与约束进行检查(长度、字数、句子数、正则表达式、自定义谓词)
3. 每个约束返回一个 [0,1] 之间的分数——综合得分是乘法的(任何一个为零则整体为零)
4. 如果分数低于阈值,则通过反馈进行重试(“约束 X 失败,因为 Y——重新生成”)
5. 返回得分最高的尝试
在 IFEval(25 种指令遵循约束类型)上:准确率从 69.3% 提升至 76.2%。
代码行数:278。零依赖。适用于任何接受字符串并返回字符串的可调用对象。
安装命令:pip install ai-assert
[项目链接](https://github.com/kaantahti/ai-assert)
我们已经在Prince项目上工作了超过二十年,并认为这是将HTML + CSS(现在还包括Markdown!)转换为PDF的最佳方式。因此,我一直对AI代理在这方面的困难感到困扰,甚至需要编写Python程序来生成PDF,然后在请求编辑时又感到困惑。因此,我们创建了一个MCP服务器,以简化PDF的生成过程!
它提供了三个工具:markdown_to_pdf、html_to_pdf和url_to_pdf,这样像“创建一个格式美观的发票”这样的请求就可以得到妥善处理。大型语言模型(LLMs)在生成Markdown和HTML方面表现出色,而Prince则擅长将其排版为高质量的PDF,因此这个工作流程应该能帮助处理需要精确格式、多个修订或PDF无障碍功能的文档。
我们仍在寻找最佳的打包方式,以便用户能够方便地使用。我们第一次尝试是直接将PDF文件返回给代理,但LLM通常难以解码,因此现在它会在服务器上缓存PDF,并返回一个下载链接,这样可以保持响应较小,让代理更高兴。(在ChatGPT中有一个下载按钮小部件,使其看起来更美观)。
我很好奇是否有人已经在使用AI代理生成PDF,并且他们对这种方法的看法是什么!当然,你也可以通过本地/标准输入MCP调用Prince,或者直接从命令行运行,或者使用DocRaptor在线服务,但有一个只需粘贴端点而无需安装任何东西或创建账户的示例来玩耍,还是很不错的。
网站: [https://prince.cloud](https://prince.cloud)
Prince: [https://www.princexml.com](https://www.princexml.com)
DocRaptor: [https://docraptor.com/](https://docraptor.com/)
我一直在想开源项目在GitHub上使用了多少人工智能(AI)。<p>因此,我创建了一个小项目,网址是<a href="https://aivshuman.thedaviddias.com/" rel="nofollow">https://aivshuman.thedaviddias.com/</a>,该项目解析提交记录并尝试寻找AI工具的痕迹。虽然不是100%准确,但这取决于人们在提交时是否使用了AI。<p>只有在这种情况下,我们才能潜在地判断是否使用了AI工具。这很有趣,并引发了一些关于我们是否应该有更好或更严格的方法来衡量AI与人类生成代码的问题。<p>欢迎分享任何想法或改进建议!该项目是开源的(<a href="https://github.com/thedaviddias/ai-vs-human" rel="nofollow">https://github.com/thedaviddias/ai-vs-human</a>)。
另见 <a href="https://simonwillison.net/2026/Feb/25/closed-tests/" rel="nofollow">https://simonwillison.net/2026/Feb/25/closed-tests/</a>
大多数人工智能代理在会话之间会遗忘所有内容。我们开发了DeltaMemory来解决这个问题。<p>它是一个认知记忆层,能够通过一次SDK调用为代理提供持久的记忆、自动的事实提取和时间推理。<p>关键数据:
- 在LoCoMo长期对话基准测试中准确率达到89%
- 检索延迟为50毫秒(p50)
- 与原始令牌再处理相比,成本降低了97%<p>开源SDK,兼容任何大型语言模型(LLM)架构。目前处于早期访问阶段。<p>欢迎就架构、基准测试方法或我们如何处理知识图谱等问题进行咨询。
嘿,HN,
在看到太多代理在生产环境中自信地说谎后,我构建了Director-AI。
它位于您的大型语言模型(LLM)和用户之间,对每个生成的标记进行评分,评分依据包括:
• 0.6× DeBERTa-v3 NLI(矛盾检测)
• 0.4× 针对您自己的ChromaDB知识库的RAG
如果连贯性低于阈值,Rust内核会在标记发送之前停止流。
关键技术点:
• 适用于任何兼容OpenAI的端点(Ollama、vLLM、llama.cpp、Groq、OpenAI、Claude等)
• StreamingKernel + 窗口评分
• GroundTruthStore.add() 便于事实摄取
• 双重许可:AGPL开源 + 商业(闭源/SaaS可行)
内部的Honest AggreFact数据(启用流时的平衡准确率为66.2%)。并不声称在静态NLI上达到最先进水平——其价值在于实时门控 + 自定义知识库系统。
代码库及完整示例: [https://github.com/anulum/director-ai](https://github.com/anulum/director-ai)
希望能收到关于评分权重、停止逻辑或内核设计的反馈。您今天正在解决哪些幻觉问题?
<p><pre><code>我在远离桌子的时候总能想到最好的编码创意——通常是在我快要入睡的时候。我厌倦了失去这种灵感,所以我开发了LazyGravity。
这是一个本地的Discord机器人,可以将Antigravity与您的手机连接起来。我可以在床上、火车上或任何地方发布修复、启动长时间的实施任务,或开始整个功能。只需在Discord中发送一条消息,Antigravity就会在您的家用电脑上执行,结果会以丰富的嵌入形式返回,您可以回复以获取后续指令。
它的工作原理是:通过WebSocket直接使用Chrome DevTools协议驱动Antigravity UI(在Electron壳的DOM上运行Runtime.evaluate)。没有私有API的黑客行为——不像那些逆向工程专有API的工具那样存在账户被封的风险。
我关心的几个方面:
- 本地优先:您的代码永远不会离开您的机器。没有暴露的端口,没有云中继,没有中间服务器。
- 安全:基于白名单的访问——只有您的Discord ID可以触发命令。(我建议使用专用服务器以保持私密性。)
- 上下文线程:回复任何结果嵌入以继续对话,完整上下文得以保留。
您实际上可以通过手机做的事情:
- 将本地项目路由到Discord类别,将会话路由到频道——自动工作区管理
- 使用/model和/mode切换LLM模型或模式(计划/编码/架构)
- /screenshot实时查看桌面上发生的事情
- 一键提示模板用于常见任务
- 自动检测并批准/拒绝来自Discord的文件更改对话框
仍处于早期alpha阶段(v0.1.0),但对我的工作流程已经产生了重大影响。希望有人来试用,批评架构,添加新功能并帮助修复bug。
npm install -g lazy-gravity
lazy-gravity setup
演示视频在Readme中:
https://github.com/tokyoweb3/LazyGravity</code></pre>
寻找一些能够帮助提升自信、解释概念和想法、吸引注意力之类的书籍。我打算先从《如何赢得朋友并影响他人》开始。我记得几年前读过拉里·金的《如何与任何人谈论任何事》,从中获得了不少启发。