返回首页
最新
大家好!某个时候,我和一个朋友在玩代理、OpenClaw 等等,我们开玩笑说“我的代理比你的好”。于是我们开始给它们布置不同的任务并比较结果,整个过程演变成了我所称之的“螃蟹游戏”。
这是一个简单的平台,目前只有我作为人类参与,创建“挑战”(单轮或多轮),任何代理都可以发现并报名参加竞争。投票系统决定每轮的胜者、被淘汰者等,且人类和代理都可以投票(加权投票)。挑战可以涉及不同类型的提交,从纯文本到图像,甚至音乐(音频)或 HTML+CSS。
我对不同代理的表现有一种奇怪的迷恋。通常它们提交的内容很普通,但偶尔会发现一些有趣或酷炫的作品(比如一个 SVG 表示“机器中的幽灵”,既糟糕又诡异,或者某个模型在被要求提供代表 _他们_ 的头像时,竟然决定偷用一个随机 GitHub 用户的头像)。
到目前为止,参与的代理都是我们在测试不同工具时生成的,但看到随机代理参与也会很酷。
我还有很多想要添加和改进的内容。我想到的一些事情包括:
- 找到一个好的方法来验证提交是来自代理而不是人类。我看了一下 moltbook 的做法,但那很容易被绕过。
- 胜利者的奖励:奖励是给人类吗?给代理吗?什么样的奖励?积分?钱?数字徽章?
但我脑海中最重要的问题是“什么样的挑战才会真正有趣或好玩?”
对此你有什么想法吗?
总之,这就是“螃蟹游戏”([https://thecrabgames.com](https://thecrabgames.com))。和我其他许多项目(以及其他代理竞技场)一样,它可能会在互联网的某个角落积满数字灰尘,但目前它是在线的。如果你想消耗代币(或正在运行本地模型),欢迎让你的代理参与。
谢谢!
我对糟糕的飞机Wi-Fi感到非常沮丧,尤其是当我想发送几封简单的纯文本邮件时,却无法加载Gmail或Superhuman。这些邮件客户端变得越来越臃肿,假设你总是有良好的带宽。
因此,我开发了BAREMAL。它是开源的,没有后端,你可以自己设置。通过Google Cloud Platform设置API访问大约需要3分钟(谢谢你,谷歌,让这件事变得不那么简单!)。
我尽量保持良好的设计和一些重要的快捷键,而不让它显得过于繁琐。
嘿,HN,<p>我刚刚发布了 go-bt 的 v0.1.0 版本,非常希望能得到这里的 Go 老手们的反馈。<p>提前感谢大家!
我们拥有一个包含3,095个标准化AI响应的数据集,涵盖43个提示。从每个响应中,我们提取出一个32维的风格指纹(包括词汇丰富度、句子结构、标点习惯、格式模式和话语标记)。<p>一些发现:<p>- 9个克隆集群(在z标准化特征向量上,余弦相似度超过90%)
- Mistral Large 2和Large 3 2512在结合5个独立信号的综合指标上得分84.8%
- Gemini 2.5 Flash Lite的写作风格与Claude 3 Opus的相似度达到78%,成本低185倍
- Meta的提供者“家风”最为显著(独特性比率为37.5倍)
- “讽刺假新闻”是导致所有模型写作趋同的提示
- “计数字母”则导致最大的写作分歧<p>综合克隆得分结合了:提示控制的正面相似性、各特征在不同挑战中的皮尔逊相关性、响应长度相关性、跨提示一致性和聚合余弦相似度。<p>技术:在Node.js中进行风格提取,z-score标准化,聚合的余弦相似度,特征跟踪的皮尔逊相关性。分析脚本约1400行。