1 分•作者: beardyw•3 个月前
返回首页
最新
1 分•作者: mooreds•3 个月前
1 分•作者: mahikmc•3 个月前
各位 HN 的朋友们,
我们创建 Selzix (https://selzix.com) 的目的是为了消除社交优先品牌创建电商商店的阻力。
1 分•作者: downbad_•3 个月前
1 分•作者: williamtrask•3 个月前
1 分•作者: crescit_eundo•3 个月前
2 分•作者: dbreunig•3 个月前
最近,我遇到过代理选择错误技能或工具的情况。这种情况往往发生在较长的推理链中间,令人沮丧的是,这意味着在发出纠正之前,大量的对话会污染上下文。
为了解决这些问题,我构建了 `drskill`:一个命令行工具,用于检查代理的技能和 MCP 配置中的冲突和安全问题。
除了发现可能导致代理出错的冲突外,还增加了安全警报。MCP 提供商是否因供应链攻击而悄悄添加了工具?在启动或 CI 过程中运行 `drskill` 将会标记这些更改。
`drskill` 在不访问 LLM 的情况下也能工作,但连接到 LLM 可以提供更好的冲突报告,并允许建议替代的、不冲突的描述符。
全局和本地都会维护一个账本,跟踪确认和偏好。
这类工具非常受益于贡献(你的配置和我大不相同!),所以如果你有兴趣,请提交 issue 或 PR。
2 分•作者: romanhn•3 个月前
雇主们正面临着日益增长的自动化人工智能提交、虚假申请和低质量垃圾邮件的浪潮。招聘人员和招聘经理在发布职位后几小时内收到数千份简历并不罕见。合格的候选人很容易被所有这些噪音淹没。
Permanym 在申请流程中引入了恰到好处的阻力,使得自动化滥用变得不切实际,同时又不会过多地阻碍合法申请人。作为一名曾经的招聘经理,增加招聘难度而不是减轻它的想法违背了我的一切本能,但目前的状况是不可持续的,并且会损害各方的信任。
核心理念是通过视频活体检测来确保申请提交时键盘后面是真人。此验证从开始到结束可在 30 秒内完成。您可以在此处体验:https://permanym.com/verify/jJAiul58nF7kJ5FS/
无需集成 ATS。只需在您的申请说明中包含验证链接即可开始。然后通过电子邮件查找申请人,查看他们是否已通过验证。目前的主要好处是过滤垃圾邮件,但未来通过适当的 ATS 集成可以从源头阻止它。活体数据仅对招聘公司可见,且访问权限有时限。
我认为在更深入的 ATS 集成和附加信号方面存在许多机会,但我希望从解决最紧迫的问题开始:验证每份申请都来自真实的人。最终目标是通过排除不良行为者来帮助招聘过程的双方。如果这个目标引起您的共鸣,让我们聊聊!
在此期间,我们非常感谢您提出的任何和所有反馈。
2 分•作者: Zwony•3 个月前
19 分•作者: surprisetalk•3 个月前
2 分•作者: superquizonline•3 个月前
2 分•作者: RyanJensen•3 个月前
20 分•作者: surprisetalk•3 个月前
3 分•作者: boazraz•3 个月前
42 分•作者: Davisb135•3 个月前
我是我朋友和我一起写的一篇论文的作者。我们之所以写这篇论文,是因为我们很好奇是否可以使用 MUD(一种起源于 20 世纪 70 年代的文本游戏)来评估大型语言模型(LLM)。在过去的几个月里,我们利用业余时间,仅用个人电脑和大约 99 美元的 API 积分完成了这项实验并撰写了论文。
我们的实验确实有一个有趣的排行榜,但更令人惊讶的是对每个大型语言模型的测量结果。我们在四个行为维度上对每个模型进行了评分,其中两个维度严重依赖于一个大型语言模型分类器。当我们移除这两个维度后,一个前沿模型下降了六个名次。当我们用第二个裁判来检查分类器时,它们之间的每模型一致性从 85% 到 22% 不等。聚合 Kappa 值(在探针检测上为 0.04)表明该工具存在噪声,但并未指明噪声影响了哪些模型。受影响最大的模型与分类器属于同一模型家族。这并非偏见的证据,只是我们记录的一项观察结果。
我们意识到大型语言模型作为裁判可能不可靠,虽然测试这一点并非我们最初的意图,但它最终成为了最有趣的发现。两个裁判之间的分歧是我们认为可以推广到其他基于裁判的基准测试的发现。
我们强调这只是一个概念验证,而不是一个经过验证的基准测试。我们在论文中准备了一个详尽的局限性部分,包括每个模型仅运行 50 次、顶尖模型之间置信区间重叠、没有人类评分者、环境规模小等。
我们所做的一切都是公开的,论文和数据采用 CC BY 4.0 许可,代码采用 MIT 许可。论文、对话记录、代码和完整的 API 账单导出可以在 [https://doi.org/10.5281/zenodo.21386663](https://doi.org/10.5281/zenodo.21386663) 找到。
如果您发现任何问题,请告知我们,这也是我们分享这些内容的原因。我们目前正在设计第二阶段,并希望使其尽可能健壮。我们正在考虑引入人类基线、多个裁判、更多目标、更大的环境等。
2 分•作者: qspencer•3 个月前
89 分•作者: crescit_eundo•3 个月前
<a href="https://www.youtube.com/watch?v=AWig98GVIno" rel="nofollow">https://www.youtube.com/watch?v=AWig98GVIno</a><p><a href="https://www.tomshardware.com/3d-printing/mit-researchers-revive-40-year-old-triangular-zipper-concept-now-made-possible-by-3d-printing-creates-shape-shifting-robots-and-deployable-structures-3d-printed-y-zipper-turns-floppy-tentacles-into-rigid-beams-in-seconds" rel="nofollow">https://www.tomshardware.com/3d-printing/mit-researchers-rev...</a><p><a href="https://www.yankodesign.com/2026/05/31/a-zipper-patent-sat-in-a-garage-for-40-years-now-its-real/" rel="nofollow">https://www.yankodesign.com/2026/05/31/a-zipper-patent-sat-i...</a>
64 分•作者: erikschoster•3 个月前
4 分•作者: hakumei•3 个月前
Yorishiro 是一个开源项目,它为 Claude Code / Codex 提供了一个类似身体的动漫角色。
“Yorishiro”这个名字在日语中意为“附有灵体的物品”。
我最初的想法是,通过终端与 AI 代理进行长时间的交流非常疲惫。
因为 AI 代理没有面孔、没有表情、没有身体,而且我看不见它们在思考。所以我为 AI 代理提供了一个 3D 身体和栖息的环境。我称之为“Presence Harness”。
我构思了很多想法,例如,反射功能。
“Aura”是瞬间移动的白光。它在 LLM 回复之前显示需要关注的事项。
当 AI 代理等待你的批准时,房间的灯会闪烁进行通知。
Yorishiro 的角色“Yori”在 AI 代理遇到错误时会表现出悲伤。如果 git push 成功,Yori 会露出开心的表情并燃放烟花。
然后,Yorishiro 有一个自引用的 MCP。Yorishiro 中的 AI 代理控制灯光、身体、场景、UI、特效等。
Yorishiro 支持热重载扩展。Yorishiro 会自我构建。我喜欢 Emacs,所以我把它变成了一个可自我修改的终端。
如果你想尝试一下,
```bash
brew install --cask sktkkoo/yorishiro/yorishiro
```
我是日本人,英语不好。
感谢你的阅读。
13 分•作者: oyster143•3 个月前