2作者: anshulsahni16 天前原帖
我目前在全职工作中使用的软件需要处理非常长的JSON和大量的CSV文件。对于编辑或查看JSON,我的首选和显而易见的选择是jsonher.io,这是我见过的最棒的JSON查看器。但我希望能找到同样优秀的CSV工具,然而当我在谷歌上搜索时,却没有找到什么好的选项。 大多数工具都要求我注册,有些工具允许我打开CSV,但随后会弹出一个大窗口要求我提供信用卡信息,以便我可以编辑或使用一些过滤器,很多工具在处理大型CSV时还会将文件发送到服务器。老实说,确实有一些工具无需注册或不需要服务器,但它们的用户体验很差——Sublime的显示效果比那些工具要好得多。 于是我开始为自己开发一个工具,结果发现构建一个无需注册、仅在浏览器中使用的CSV工具实际上是可行的,即使是处理大型CSV文件。我在几天内就将其搭建完成,效果非常不错——抱歉,可能有些自夸。 后来我添加了支持以JSON格式下载内容以及其他CSV替代格式,如PSV、TSV、SSV等。它具备处理CSV的所有基本功能——过滤、排序、编辑、删除以及以您所需格式下载。 在不久的将来,我计划将其打造成一个适用于各种平台的一体化CSV编辑器——浏览器扩展、桌面应用程序,以及希望能有移动应用(我在开发移动应用方面不太擅长,但我会尽力而为)。欢迎您试用,并在评论中告诉我您的感受。
1作者: Tommkruix12316 天前原帖
这个工具最初是我为了回答“人工智能代理是否会偏离你的架构规范,还是需要强制执行?”这个问题而进行的研究。因此,我开始构建一个基准来测试这个假设。在我测试的范围内,代理并没有偏离,因此我不得不停止这一研究方向。为了重用我从这项研究中学到的知识,我开始尝试通过代码审查和持续集成(CI)来捕捉工程师的回归,并创建那些代码库已经遵循的规范,以证据的形式呈现,而不是仅仅留在某个人的脑海中。 在我开始构建这个工具之前,我主要是手动编写规则和每个我想使用的代码检查工具(linter)的文档。但在我的研究之后,这个工具自动化了这个过程,我很高兴看到它也能帮助其他工程师。我在 GitHub 上对 92,861 个真实的公共 TypeScript 仓库运行了完整的工作流程(扫描、推荐),并且在每一个仓库上都顺利完成,没有出现一次崩溃,且可逆的安装/卸载过程也顺利进行。我非常欢迎您对它为您的仓库推断出的规则以及它如何帮助您执行这些规则的反馈。 这项研究的公开链接在这里:<a href="https://github.com/Tommkruix/agentrulebench" rel="nofollow">https://github.com/Tommkruix/agentrulebench</a>,而 Archprint 的公开链接在这里:<a href="https://github.com/Tommkruix/archprint" rel="nofollow">https://github.com/Tommkruix/archprint</a>。
2作者: coolArnav16 天前原帖
人们在进行检索/语义检索时经常使用嵌入模型。然而,当出现一个更新、更理想的模型时,重新嵌入数据库中每个文档的成本(无论是时间还是计算资源)都是非常昂贵的。 不过,我找到了一种有趣的方法,可以避免这种前期的嵌入成本。 算法如下: 旧模型/索引 -> 检索前K个文档 -> 使用新模型对这些文档进行评分 -> 缓存/生成新的嵌入 因此,不需要在前期重建整个向量存储,旧索引可以继续被检索,而新模型则对这些候选项进行重新排序。 对于某些模型对,这种方法效果出乎意料地好(我在H100上测试了63个源到目标的迁移,涉及多达100万份文档)。 例如,在一个包含100万文档的自然问题数据集中: - 原生 Qwen3-Embedding-8B: 0.6812 nDCG@10 - Qwen3-4B -> Qwen3-8B, K=50: 0.6816 - Qwen3-0.6B -> Qwen3-8B, K=50: 0.6638 - MiniLM -> Qwen3-8B, K=50: 0.6486 (困难的部分是确定K,我在上面保持K不变,以便给出一些迁移的感觉。) 你可以使用pip安装它: ``` pip install embedflow ``` 代码在GitHub上可以找到: [https://github.com/arnsri33/embedflow](https://github.com/arnsri33/embedflow)
1作者: scosman16 天前原帖
傻但有趣的项目:一个单一HTML文件的搜索引擎门户。它旨在重现2005年的复古搜索体验:快速的链接列表,仅此而已。<p>该项目由<a href="https:&#x2F;&#x2F;keenable.ai" rel="nofollow">https:&#x2F;&#x2F;keenable.ai</a>提供支持,这是一个新的搜索API。您有两种隐私选项。1)通过<a href="https:&#x2F;&#x2F;froogle.fyi" rel="nofollow">https:&#x2F;&#x2F;froogle.fyi</a>进行代理。Keenable可以看到您的查询,但无法看到您的IP或任何用户ID。您的流量与其他用户的流量混合。这可能会受到速率限制,但无需任何设置。2)直接访问:自带Keenable API密钥(每月免费100,000次搜索),浏览器直接调用API。Froogle无法看到您的查询,但Keenable会获得一个唯一ID。<p>试试吧:<a href="https:&#x2F;&#x2F;froogle.fyi&#x2F;" rel="nofollow">https:&#x2F;&#x2F;froogle.fyi&#x2F;</a><p>Github: <a href="https:&#x2F;&#x2F;github.com&#x2F;scosman&#x2F;froogle" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;scosman&#x2F;froogle</a>