Balder v7 – 在SWE-bench上100%验证,使用单个RTX 3060。

1 分•作者: BalderForseti•3 个月前•原帖
我在过去几个月里致力于开发 Balder v7,这是一种本地代理架构,旨在以确定性的方式解决编码和数学问题。 为了测试它,我在一台配备 Nvidia RTX 3060(12GB VRAM)的计算机上,对 2,089 个基准案例进行了控制评估: - 在 SWE-bench Verified 上取得 100%(500/500) - 在 Meta CyberSecEval 上取得 88.07%(1,285/1,459 被阻止) - 在 LiveCodeBench 上取得 82.00%(82/100) - 在 AIME 2024 上取得 100%(30/30) 该架构在长上下文执行(最多 10M 令牌)中实现了 O(1) 的 VRAM 内存占用扩展,使用了直接的 GPU 位域扫描。 评估日志、生成的补丁和 Docker 执行跟踪已完全开放,供同行评审,您可以在我的 GitHub 仓库中查看: https://github.com/chetdep/balder-v7-benchmarks 期待听到您对这种架构方法的反馈。
查看原文
I’ve spent the last few months working on Balder v7, a local agent architecture designed to solve coding and math problems deterministically.<p>To test it, I ran a controlled evaluation across 2,089 benchmark cases on a single Nvidia RTX 3060 (12GB VRAM): - 100% on SWE-bench Verified (500&#x2F;500) - 88.07% on Meta CyberSecEval (1,285&#x2F;1,459 blocked) - 82.00% on LiveCodeBench (82&#x2F;100) - 100% on AIME 2024 (30&#x2F;30)<p>It achieves O(1) VRAM memory footprint scaling for long-context execution (up to 10M tokens) using direct GPU bitfield scan.<p>The evaluation logs, generated patches, and Docker execution traces are fully open for peer review at my GitHub repository: https:&#x2F;&#x2F;github.com&#x2F;chetdep&#x2F;balder-v7-benchmarks<p>Would love to hear your feedback on this architecture approach.