Show HN:Pulsys – 使用 io_uring 构建的 Hugging Face 拉取式缓存2 分•作者: poshmosh•3 个月前Pulsys 是一个开源、自托管、经过身份验证的 Hugging Face 拉取式缓存。它可以作为现有 HF 客户端的即插即用替代品,直接从磁盘提供热缓存命中,通过使用 io_uring(Linux)和 sendfile(macOS)绕过标准系统调用,实现高达 90 GB/s 的吞吐量(基准测试在 ec2 的回环接口上运行)。
展示 HN:Sol – 一个经过验证的、用于人机协作的计算产物2 分•作者: jamweba•3 个月前本项目是对 Thariq Shihipar 在 Anthropic 博客上发表的文章的回应。我同意 Thariq 的观点,即 Markdown 对于 AI Agent 目前所进行的任务来说已经不够用了,但我不同意输出 HTML 是解决方案。HTML 是一种展示格式,虽然它看起来不错且易于人类阅读,但对于需要展示最终输出是如何得出的记录的工作来说,它是不够的。 该存储库包含一个 RFC(请求评论),用于一个持久化工件的规范,该工件可以保存任何人或任何事物所进行的工作。该存储库还包含一个 Python 验证器(最小实现)、一个黄金案例和病理语料库,以及确定性的 JSON 诊断。 验证器会检查引用和对象的完整性,确保任何代码的执行顺序始终清晰可见,记录可能进行的任何提案和审查,以及记录授权。 您可以通过以下方式运行验证器: python -m solval.make_corpus corpus python -m solval.validate_corpus corpus 如前所述,这是初稿,旨在征求评论和社区开发。非常欢迎您的反馈。
Show HN:Cascade Chat – 一个可 Hack 的 IRCv3 客户端,支持 macOS、Windows 和 Linux6 分•作者: oooyay•3 个月前大家好!我是 Matt,今天想向大家介绍 Cascade Chat。 我最早的互联网体验之一是使用 mIRC。我一直很欣赏它简洁、友好的用户界面,以及它将
如果(Facebook == PornBook) 删除 Facebook;1 分•作者: theoutfield•3 个月前我认为马克·马克·扎克伯格正在着手创建一个软色情网站。每次你访问这个网站,如果你观看任何视频,似乎都夹杂着某种软色情内容。我尝试使用一个“敏感内容”选项来阻止它,该选项显示默认设置为“PornBook”,或者更少设置为“PornBook essential”,但你无法关闭它。他们甚至明确表示,你只能选择“很多”或“很少”,但不能完全关闭。PornBook 到底是什么样的怪异应用?它根本不像 Facebook 这个名字所暗示的那样。如果他们不提供关闭的选项,那就直接叫它 PornBook 好了。
Show HN:我构建了一个智能代理,让你的编码代理可以自由运行1 分•作者: dandriscoll•3 个月前要实现快速开发,你的编码代理必须采用“ YOLO”(你只活一次)模式。我已经搞定了本地沙箱(小贴士:Incus 虚拟机效果很好),但我希望我的代理不要做出诸如意外摧毁我的云服务或根据提示向某个随机网站发送 POST 请求之类的行为。我在个人项目上在这方面遇到的困难最多,因为我的权限模型不如办公室里那么完善。 起初,我在 Incus 容器上设置了防火墙,但每次代理需要访问新东西时,我都要在防火墙上打更多的“洞”——而且它无法区分 HTTP 动词。 我也一直在使用 Claude Code 的自动模式,但我希望能够指导 LLM,而不仅仅是完全交出控制权。我还想要一些固定的允许和拒绝规则。 因此,我构建了 Trollbridge:一个运行在你的编码代理前面的 HTTP/S 代理,它允许你设置允许或拒绝列表,在 TUI 中实时批准或拒绝,或者连接一个基于你先前决策进行调用的 LLM。 我很想听听你的想法——不妨试试,留下评论,或者提交一个 bug。谢谢! 网站:https://trollbridge.dev Github:https://github.com/dandriscoll/trollbridge
Show HN:通过 OpenJDK Panama FFM (Java 22) 实现低延迟本地 LLM 运行器3 分•作者: KingJoker•3 个月前我希望在 JVM 内部运行 AI。最初,我使用了标准的 REST sidecar,后来将其替换为新 JDK 版本中的 Project Panama(Foreign Function & Memory API),以便直接与 llama.cpp 进行交互。但我对这种方式仍不满意,于是我构建了 libargus.cc,以提供一个清晰的 ABI,在 JVM 环境中暴露一个结构化 API。它仍然使用 Project Panama 直接与 llama.cpp、whisper.cpp 和 ggml 计算图进行交互。 在
展示 HN:Oodle.ai – 每百万次代理追踪仅需 10 美元9 分•作者: kirankgollu•3 个月前各位 HN 的朋友们,我们是 Kiran 和 Vijay! 在过去的两年里,我们为可观测性(日志、指标和追踪)构建了一个列式存储引擎。今天,我们很高兴能在此基础上展示我们构建的内容:LLM Agent 可观测性。 鉴于 Agent 的非确定性,对所有追踪进行无采样存储对我们至关重要。但这些追踪通常以 MB 计,有时甚至达到 GB 级别,我们需要以低成本存储它们。同时,我们也需要快速的查询和分析。为了实现这两个目标,我们将数据存储在 S3 中,使用我们自己的类 Parquet 文件格式,并通过 AWS Lambda 进行查询。 由于我们处理的是每个追踪的每个跨度,而不是对每个追踪运行基于 LLM 的评估,我们首先使用确定性技术对其进行分析。我们检测工具故障、重试、循环、异常的 token 使用、延迟回归、模式违规、情感以及其他生产信号。我们在这里写了更多关于此方法的内容:https://blog.oodle.ai/you-cant-sample-your-way-to-reliable-agents/ 我们自己的引擎、无采样以及在 LLM 进行评估之前的确定性处理相结合,使我们能够以每百万追踪 10 美元的价格进行定价,提供亚秒级的 p99 查询延迟,并保持健康的利润率。在构建此产品之前,我们曾使用 Langfuse 来进行我们自己的 Agent 可观测性,其