19 分•作者: snyy•2 个月前
大家好,我是 Feyn 的 Shreyash。我们帮助公司利用他们的数据构建定制模型。 今天,我们发布 FeyNoBg,一个自动背景移除模型。同时,我们还将开源 NoBg,这是我们为训练和运行该模型而构建的 Python 库。 您可以在此处试用该模型:[https://huggingface.co/spaces/feyninc/feynobg](https://huggingface.co/spaces/feyninc/feynobg)。您可以在此处查看该库:[https://github.com/feyninc/nobg](https://github.com/feyninc/nobg) 一些示例输出: (1) 足球任意球:[https://drive.google.com/file/d/1MZkAGLwbhNVOZ0Oi7XvpCfSEu9QPCbwj/view?usp=sharing](https://drive.google.com/file/d/1MZkAGLwbhNVOZ0Oi7XvpCfSEu9QPCbwj/view?usp=sharing) (2) 迎风飘动的头发:[https://drive.google.com/file/d/1Odc2m0XMVH9uZtvI_KjaRbXzhLLdGK8Z/view?usp=sharing](https://drive.google.com/file/d/1Odc2m0XMVH9uZtvI_KjaRbXzhLLdGK8Z/view?usp=sharing) (3) 带可见辐条的自行车:[https://drive.google.com/file/d/1h99ahjfrtS1MFQJJgiKE2fuM3HZyQ-QJ/view?usp=sharing](https://drive.google.com/file/d/1h99ahjfrtS1MFQJJgiKE2fuM3HZyQ-QJ/view?usp=sharing) (4) 实时演示视频:[https://youtu.be/b1heHPvY8BM](https://youtu.be/b1heHPvY8BM) 背景移除是将图像中的主体与其周围环境分离。我们都曾尝试过。通常是为了在不同的素材中重用主体。如今,用它制作聊天贴纸很常见。这是人工智能最常见但又被低估的用途之一。它也出奇地复杂。模型很容易被伪装、运动模糊或头发等精细结构所迷惑。 这项任务需要两种技能。首先,模型必须识别前景。其次,它必须追踪前景的边界并估算每个像素的不透明度值。通常,这些技能是通过不同的数据集来教授的。这会产生一个失败点。糟糕的训练组合可能会以牺牲一项技能为代价来提高另一项技能。我们在受控评估中看到了这一点。仅使用 MaskFactory 数据集进行的训练在 CAMO 基准测试上有所改进,但在 DIS5K 上有所退步。 对于 FeyNoBg,我们采用了可解释性优先的训练方法。我们首先研究了 BiRefNet 的各个阶段如何有助于识别前景及其边界的重建。我们发现其特征提取器的第三个阶段包含大量信息。定位和边界重建都严重依赖于此处生成的特征图。 这促使我们将该阶段的模块从 18 个扩展到 24 个,同时保留了预训练权重。然后,我们在 26.1K 个多样化的示例上训练了 FeyNoBg,这些示例是从 10 个数据集中汇编而成的。目标是在不牺牲任何一项技能的情况下,提高前景识别和边界精度。 在八个基准测试中,FeyNoBg 在其中四个上取得了最佳的已发布分数,在其余测试中也接近领先者 2%。 构建 FeyNoBg 也暴露了一个工具问题。图像抠图模型通常作为独立的存储库发布,其预处理、训练和评估代码不兼容。我们构建了 NoBg 来解决这个问题。NoBg 将这些工作流程整合到一个 Python 接口中。它目前支持 BiRefNet,未来还将支持更多架构。我们希望您能用它构建出令人兴奋的东西! 很乐意回答任何问题!
2 分•作者: roman-volkov•2 个月前
各位 HN 用户: 我正在开发 Darkslide([https://darkslide.app](https://darkslide.app)),一款以键盘为中心的照片编辑器。这是一款早期、粗糙且完全免费的 macOS 应用,我希望征求任何拍摄照片且讨厌 Adobe 的用户的反馈。 该项目源于两个主要想法: 1. **探索以键盘为中心的 UX:** 我喜欢 vim 的操作方式,并想看看纯粹以键盘为中心的照片编辑方法是否真的有价值。我基本上可以将其概括为“照片版的 vim”——这是开发者为解决创意问题而采取的最刻板的过度工程化解决方案,所以请随意批评我。 2. **告别目录管理:** 我讨厌 Lightroom 或 Capture One 强制你管理一个 .library 文件,或者其他依赖 sidecar 文件的方式。Darkslide 会在后台自动管理编辑。你只需在操作系统中移动或复制原始照片文件,应用就能正确处理编辑,而不会损坏目录。 工作原理(90 秒演示):编辑一张照片,“复制”编辑,选择 200 张,粘贴,然后导出。[https://youtu.be/4R9l4fgsvT4](https://youtu.be/4R9l4fgsvT4) 立即试用:你可以在此处直接下载当前的 macOS DMG 文件:[https://darkslide.app/download/Darkslide.dmg](https://darkslide.app/download/Darkslide.dmg) 我目前不销售任何东西——这是一个验证测试。无论你是专业摄影师还是业余爱好者,我都非常希望得到你的反馈。你是否会真正使用这种键盘驱动的方法? 感谢你的关注。如果你想分享反馈,请随时通过 [https://x.com/rmn_vlkv](https://x.com/rmn_vlkv) 与我联系。 附注:请注意,macOS 目前会阻止该应用打开,因为 Darkslide 尚未经过公证。你可以在终端中使用此命令来运行它: `xattr -r -d com.apple.quarantine /Applications/Darkslide.app`
2 分•作者: two-sandwich•2 个月前
使用聊天界面常常会产生许多不同的想法,虽然人工智能及其代理在跟踪这些想法方面做得不错,但我并非总是能跟上。我需要能够看到我的想法从何处发散,并追溯到源头。 在构思一个更好的界面,并尝试将记忆导入 OpenRouter CLI 的过程中,我决定将这一切整合在一起。 BixRouter 是一个用于可视化你的想法和对话的工具。 - 每个回复都是一个节点。从任何节点提出后续问题,对话就会分叉。 - 记忆和上下文会沿着每个分支追溯到根节点,这样你的对话可以完全发散,并保持一个基础的根源。 - 长分支可以被压缩,上下文窗口将从图中的最新压缩节点重新开始。 - 高亮提示会生成带有上下文相关定义的线程,这样你就可以保持方向,而不会纠结于一个被误解的术语。 - 默认情况下,请求使用共享的 OpenRouter 密钥,该密钥仅限于廉价、不耗费大量计算的模型。你可以在本地添加自己的密钥,这将把请求路由到你的账户,并让你访问所有模型(此密钥附加到你的请求中,我永远不会看到它)。 - 没有账户、存储或注册。聊天记录存储在你的本地存储中,并可以导出为文本(被戏称为 .bixgraph 文件!)。 我很想听听你对我这个小项目的反馈。目前它只适用于大屏幕,我稍后会适配小屏幕!