返回首页
24小时热榜
大家好,我是来自Feyn的Shreyash。我们帮助公司从他们的数据中构建定制模型。
今天,我们发布了FeyNoBg,这是一个自动背景去除模型。同时,我们还开源了NoBg,这是我们为训练和运行该模型而构建的Python库。
在这里尝试该模型: [FeyNoBg模型链接](https://huggingface.co/spaces/feyninc/feynobg)。查看库的详细信息: [NoBg库链接](https://github.com/feyninc/nobg)
一些示例输出:
(1) 足球任意球: [示例链接](https://drive.google.com/file/d/1MZkAGLwbhNVOZ0Oi7XvpCfSEu9QPCbwj/view?usp=sharing)
(2) 风中的头发: [示例链接](https://drive.google.com/file/d/1Odc2m0XMVH9uZtvI_KjaRbXzhLLdGK8Z/view?usp=sharing)
(3) 可见辐条的自行车: [示例链接](https://drive.google.com/file/d/1h99ahjfrtS1MFQJJgiKE2fuM3HZyQ-QJ/view?usp=sharing)
(4) 现场演示视频: [视频链接](https://youtu.be/b1heHPvY8BM)
背景去除的过程是将图像的主题与其周围环境分离。我们都曾尝试过这个过程,通常是为了在不同的作品中重用主题。如今,制作聊天贴纸是其中一种常见的用途。这是人工智能最常见但却被低估的应用之一,同时它也是相当复杂的。模型很容易被伪装、运动模糊或细微结构(如头发)所混淆。
这个任务需要两项技能。首先,模型必须识别前景。其次,它必须描绘前景的边界,并为每个像素估计一个不透明度值。通常,这些技能是通过不同的数据集进行训练的。这就造成了一个失败点。糟糕的训练组合可能会在提高一种技能的同时牺牲另一种技能。我们在控制评估中看到了这一点。仅使用MaskFactory数据集的训练运行在CAMO基准上有所提升,但在DIS5K上却出现了退步。
对于FeyNoBg,我们采取了以可解释性为先的训练方法。我们首先研究了BiRefNet的各个阶段如何帮助找到前景并重建其边界。我们发现其特征提取器的第三阶段包含了大量信息。定位和边界重建在很大程度上依赖于此处生成的特征图。
这促使我们将这一阶段从18个模块扩展到24个模块,同时保留预训练权重。然后,我们在从10个数据集中汇总的26.1K多样化示例上训练了FeyNoBg。我们的目标是在不牺牲任何一项技能的前提下,提高前景识别和边界精度。
在八个基准测试中,FeyNoBg在四个基准上取得了最佳已发布成绩,其余基准也在领先者的2%以内。
构建FeyNoBg的过程还暴露了一个工具问题。图像抠图模型通常作为孤立的代码库发布,且预处理、训练和评估代码不兼容。我们构建了NoBg来解决这个问题。NoBg将这些工作流程整合到一个Python接口后面。它目前支持BiRefNet,未来还会支持更多架构。我们希望你能用它构建一些令人兴奋的东西!
欢迎随时提问!