3 分•作者: avijeetsingh16•2 个月前•原帖
两个没有共享模型、没有共同供应商且没有相互信任的代理,可以引用相同的已签名事实,并且每个代理都可以独立验证该事实。如今,设备如卫星、机器人和监控摄像头充斥着记忆;任何观察世界的机器都通过证明其运行方式而加入其中。
2 分•作者: minpym•2 个月前•原帖
大家好!这是我第一次在HN发帖,我对这个圈子还很陌生。我叫Min,来自曼谷。 起初,我只是想为个人使用和娱乐创建一个“死者开关”。然后,我想到了一些像间谍电影中那样的信息自毁功能。接着,我尝试设计一个比Privnote或Bitwarden更好的版本,具备自毁功能以及某种审查或阻止下载的能力。最终,我得出了这个产品。:O Flashpaper的目的是发送在阅读后会被销毁的信息(带有倒计时器,类似《碟中谍》电影!或者在24小时内未打开则自动销毁)。加密过程在浏览器中进行,由于密钥保留在链接中的#后面,服务器从未看到密钥(对于网页使用是零知识的)。另外,由于我是新手,我不想连接数据库,因为我没有资金,并且希望保持简单轻便。因此,Flashpaper只在内存中保存数据,不使用数据库。 在AI代理方面,Flashpaper提供了一个REST API和一个MCP服务器,以便代理可以轻松创建一次性秘密链接,采用死信箱的方式。第二次请求会返回404,意味着链接已经被他人使用。然而,在代理API流程中,服务器在加密之前会短暂看到明文,因此这个流程并不像网页流程那样是零知识的。 总体来说,我认为它在网页使用方面表现得相当不错,但对于代理API的使用,我不确定这是否足够安全。所有的限制都在SECURITY.md中列出。欢迎提供反馈。 我将其开源,并采用MIT许可证,对于企业使用则遵循荣誉软件政策,例如自托管的Docker。 这是我的代码库 <a href="https://github.com/mmmpym/flashpaper" rel="nofollow">https://github.com/mmmpym/flashpaper</a>,你可以在这里尝试 <a href="https://flashpaper.app" rel="nofollow">https://flashpaper.app</a>。 再次感谢!请随时告诉我我遗漏了什么。 Min
2 分•作者: johnnymakes•2 个月前•原帖
大家好,我是Johnny,Exabase的创始人。我们刚刚在BEAM这个最具挑战性的AI记忆基准测试中,在每个规模(最高可达1000万标记)上达到了最高的报告分数。我们还使用了Gemini 3 Flash进行评估,而之前的所有领先者都依赖于一个更大的模型(Gemini 3 Pro)。 在1000万标记的规模下,这一规模远远超出了任何模型的上下文窗口,因此上下文填充并不是一个选项(除了大窗口中只有大约一半的内容可以有效利用而不会降低性能)。获得高分的唯一方法是依靠根本有效的回忆。 我们的系统(M-1)在100K时得分为76.9%,在1M时为75.0%,在10M时为68.0%。之前的领先者Hindsight的得分分别为73.4%、73.9%和64.1%,而Honcho的得分为63.0%、63.1%和40.6%,两者均使用Gemini 3 Pro,而我们使用的是Flash。 我们发现竞争差距在规模上变得更大:在100K时领先Hindsight 3.5分,在10M时领先3.9分。与Honcho的差距则从13.9分扩大到27.4分。随着语料库的增大,它过滤出了有效的回忆与强行推理/模型能力之间的差异。 M-1在每个查询中消耗的标记数量比下一个最佳系统少约20%。 关于BEAM基准测试: BEAM测试十种记忆能力,包括一些其他基准测试未覆盖的能力:矛盾解决、事件排序和指令跟随。1000万标记的规模大致相当于与大型语言模型进行一年的长时间日常对话。 当然,我们的系统仍然远非完美,在某些类别(偏好跟随、指令跟随、摘要、回避)上表现强劲,得分在1000万标记规模下均保持在90%以上。 而我们的系统在其他方面则表现较弱:例如,多会话推理在100K时得分为44.7%,在10M时降至9.6%。尽管这个挑战似乎是这个规模下所有记忆系统的普遍问题,而非M-1特有的问题。这是我们将继续努力的方向。 方法论: 我们分支了Hindsight的开源基准测试脚本,替换了检索层,并对运行器的提示结构进行了小幅调整以便于生产使用。完整的方法论、三个规模的结果JSON以及提示生成器的链接都在论文中(论文链接见下)。 结合我们的LongMemEval结果(96.4%),M-1现在是唯一一个在所有主要记忆基准测试中,在每个规模(从115K到1000万标记)上都保持SOTA的系统。 研究论文:https://exabase.io/research/exabase-achieves-state-of-the-art-on-beam-benchmark 欢迎讨论架构、基准测试、规模挑战等话题。
2 分•作者: Luxter•2 个月前•原帖
合规软件如 Vanta、Drata 等仅能读取第三方 API(如 AWS、Github、Okta 等),但无法自动审计实际使用这些 API 的应用程序,例如,某个时间点谁在您的应用中拥有管理员访问权限。 我是一名来自波兰的工程师,没有合规背景,因此如果您过去对您的应用进行了审计(如 SOC 2/ISO 27001/HIPAA/PCI 等): 1. 您产生了什么结果(截图?SQL 查询?CSV 文件?) 2. 您公司中是谁负责的?花了多长时间?这是一个重复性的任务吗? 3. 您是否为此在内部开发了任何工具?现在还在维护吗? 如果您使用了某个工具,我将非常感激您告诉我是哪一个。