你好,HN,
我从事结构检查的视觉系统工作。一个常见的问题是,虽然我们有很多“健康”的图像,但通常缺乏一个可靠的“黄金集”,其中包含稀有故障(如破碎的瓷器),以便在部署之前验证我们的模型。
例如,如果你的测试集仅包含5个故障模式的样本,你就无法信任模型的召回率。
为了解决这个问题,我建立了一个生成数据集的管道。在这个例子中,我使用了7个真实的缺陷样本,提取了它们的拓扑/纹理,并程序性地生成了200个在不同光照和背景下难以检测的变体。
我发布这一批破损绝缘子(CC0),特别是为了帮助团队基准测试他们模型在稀有类别上的召回率:
- 输入:7个真实样本。
- 输出:200个完全标注的评估图像(COCO/YOLO)。
- 用例:验证/测试集(不是完整的训练集)。
你们目前是如何验证“1万分之一”边缘案例的召回率的?
Jérôme
返回首页
最新
我创建了Snapsell,以自动化电子商务商品管理中的手动瓶颈。<p>技术栈:<p>AI引擎:Google Gemini 2.0(用于多模态产品分析)。<p>基础设施:Base44(无代码后端,以实现可扩展性)。<p>我们的目标是利用算法的精确性将原始产品数据转化为高转化率的资产,而不是依赖手动输入。我是一名独立开发者,欢迎您对用户体验和扩展AI内容的技术方法提供反馈。
想要更新UPnP客户端的HyperUPnP应用,以便更好地与我的Firestick配合使用。
嗨,HN,
我开发了 Ethos,这是一个开源工具,用于可视化 Hacker News 上的讨论。它提取实体,跟踪情感,并按概念对讨论进行分组。
请查看: [https://ethos.devrupt.io](https://ethos.devrupt.io)
这是一次“预算构建”的实验。我成功将基础设施成本控制在 1 美元以下。最初我使用的是 `qwen3-8b` 作为大语言模型(LLM),并使用 `qwen3-embedding-8b` 进行嵌入,但我遇到了一些容量问题,因此决定使用 `llama-3.1-8b-instruct`,以在保持相似预算的同时提高吞吐量。
在同一价格范围内,你会选择使用哪个 LLM 或嵌入?它需要是一个支持结构化输出的模型。
你认为使用 `llama-3.1` 然后再使用更高维度的嵌入有多糟糕?我最初想将 LLM 和嵌入保持在同一家族中,但我不确定这样做是否有太大意义。
代码库:[https://github.com/devrupt-io/ethos](https://github.com/devrupt-io/ethos)
我希望得到关于你觉得哪些指标(情感与概念)最有趣的反馈!欢迎提交 PR!
大家好,我是Fabien,首席工程师,拥有25年的生产系统开发经验(Ruby、Swift,现在是Rust)。我创建Moltis是因为我想要一个可以自己运行的AI助手,能够全程信任,并且可以通过Rust的特性和类型系统进行扩展。它与OpenClaw有一些相似之处(相同的内存处理方式,受Pi启发的自我扩展),但从底层上是Rust原生的。该代理可以在运行时创建自己的技能。
Moltis是一个Rust二进制文件,包含15万行代码,约60MB,包含网页用户界面。没有Node,没有Python,也没有运行时依赖。支持多提供商的LLM路由(OpenAI、本地GGUF/MLX、Hugging Face),沙箱执行(Docker/Podman/Apple Containers),混合向量和全文记忆,带自动重启的MCP工具服务器,以及多渠道(网页、Telegram、API)共享上下文。采用MIT许可证。没有遥测数据回传,但内置了完整的可观察性(OpenTelemetry、Prometheus)。
我提供了在DigitalOcean和Fly.io的一键部署,但由于提供了Docker镜像,您也可以轻松在自己的服务器上运行。我之前写过关于拥有自己内容的文章([链接](https://pen.so/2020/11/07/own-your-content))和拥有自己电子邮件的文章([链接](https://pen.so/2020/12/10/own-your-email))。这里的逻辑是一样的:如果某个东西涉及到您的文件、凭证和日常工作流程,您应该能够检查它、审计它,并在项目方向改变时进行分叉。
目前处于alpha阶段。我每天都在使用它,并且发布它是因为它有用,而不是因为它已经完成。
更详细的架构深入分析:[链接](https://pen.so/2026/02/12/moltis-a-personal-ai-assistant-built-in-rust)
欢迎讨论Rust架构、安全模型或本地LLM设置。期待反馈。
在最近接受《务实工程师》采访时,史蒂夫·耶格表示,他对那些仅仅“使用Cursor,有时问它问题,仔细审查其代码,然后提交代码”的人感到“遗憾”。
相反,他建议工程师们越来越多地将大型语言模型(LLMs)整合到他们的工作流程中,直到能够同时管理多个代理。他的人工智能编码图表的最终级别写道:“第8级:你构建自己的协调器来协调更多的代理。”
在我的工作中,这种做法是行不通的——我们仍在以一种遗憾的方式进行工作。你在工作中是否使用协调器来管理多个代理?特别对非新建项目的应用及其如何改变你的软件开发生命周期(SDLC)感兴趣。