Balder v7 – 在SWE-bench上100%验证,使用单个RTX 3060。
我在过去几个月里致力于开发 Balder v7,这是一种本地代理架构,旨在以确定性的方式解决编码和数学问题。
为了测试它,我在一台配备 Nvidia RTX 3060(12GB VRAM)的计算机上,对 2,089 个基准案例进行了控制评估:
- 在 SWE-bench Verified 上取得 100%(500/500)
- 在 Meta CyberSecEval 上取得 88.07%(1,285/1,459 被阻止)
- 在 LiveCodeBench 上取得 82.00%(82/100)
- 在 AIME 2024 上取得 100%(30/30)
该架构在长上下文执行(最多 10M 令牌)中实现了 O(1) 的 VRAM 内存占用扩展,使用了直接的 GPU 位域扫描。
评估日志、生成的补丁和 Docker 执行跟踪已完全开放,供同行评审,您可以在我的 GitHub 仓库中查看:
https://github.com/chetdep/balder-v7-benchmarks
期待听到您对这种架构方法的反馈。
查看原文
I’ve spent the last few months working on Balder v7, a local agent architecture designed to solve coding and math problems deterministically.<p>To test it, I ran a controlled evaluation across 2,089 benchmark cases on a single Nvidia RTX 3060 (12GB VRAM):
- 100% on SWE-bench Verified (500/500)
- 88.07% on Meta CyberSecEval (1,285/1,459 blocked)
- 82.00% on LiveCodeBench (82/100)
- 100% on AIME 2024 (30/30)<p>It achieves O(1) VRAM memory footprint scaling for long-context execution (up to 10M tokens) using direct GPU bitfield scan.<p>The evaluation logs, generated patches, and Docker execution traces are fully open for peer review at my GitHub repository:
https://github.com/chetdep/balder-v7-benchmarks<p>Would love to hear your feedback on this architecture approach.