2 分•作者: caveman23•3 个月前
对我来说,这是一种矛盾的心情: 它在对话能力上比前代有了**惊人**的飞跃:它能够进行的确认和整体展现出的自然流畅性都非常棒。 今天我开始问它一些关于 Docker 的问题,它回答说:“我对 Docker 不是很精通,但请继续说”,这让我觉得有点奇怪:它对 Docker 的“了解”肯定比那里几乎所有的老前辈都多,那为什么它会表现出这种虚假的谦虚呢? 另一个让我困惑的时刻是,我开玩笑说“你被解雇了!”,它却用一种漫不经心的语气说“不好笑”。我当时就想“什么意思?”,它回答说“我说那不好笑。”这似乎与它一贯的阿谀奉承和取悦人类操作员的意愿大相径庭,不是吗? 所以这让我很好奇,你们在使用它时有什么样的经历?有什么值得注意的吗?
5 分•作者: yakshaving_jgt•3 个月前
各位 HN 的朋友们! 我们发现,随着产品不断迭代更新,维护 Zendesk 帮助中心的内容与时俱进是一项非常繁重的工作。因此,我开发了 DocCharm——它可以通过监控 GitHub 仓库中合并的 PR(拉取请求)来自动更新帮助中心。它会(利用 AI)为现有文章建议更新内容,或者在没有合适内容时草拟全新的文章。 所有内容都会先进入审核队列,确保在发布前有人工审核(并可选择编辑)。实践证明,这是一种非常高效的工作流程(至少在我看来是这样,但并非只有我这么认为!)。 我们已经在我的主业中使用了它一段时间,它极大地节省了时间。它也在同一投资组合中的其他公司中获得了一些关注。到目前为止,我的销售流程一直是高接触度的外展。这可能无法长期扩展,但我希望通过培养所有初步建立的关系来尽可能多地学习。如果您经营着一个帮助中心并且内容正在过时,请给我发邮件,我将为您免去最初几个月的费用。我的 HN 个人资料中包含我的邮箱。 Zendesk 和 Mintlify 的帮助中心已经可以自动导入到 DocCharm 中。如果您使用其他帮助中心,请告诉我,我会想办法将其自动导入。我还实现了一些主题支持,以便您可以保持自己的品牌形象。 技术栈基本上与我日常工作使用的相同(这并非差异化优势,但我们都是技术爱好者): * Haskell/Yesod * NixOS * SQLite with Litestream(每个租户一个数据库;在 Hetzner 和 Cloudflare 上都有备份;已加密) * Sentry 用于错误报告 * Stripe 用于计费 * Healthchecks.io 作为“死亡开关” * Prometheus 和 Grafana 用于遥测 * Resend 用于事务性邮件 路线图上还有很多工作要做,但它目前已经运行良好并提供了价值。我没有公开开发,但我优先考虑的事项自然会很大程度上受到早期用户需求的影响。 您怎么看?
3 分•作者: theRealestAEP•3 个月前
Word in web 是一个纯 JavaScript 的 docx 编辑器/渲染器,直接与 Microsoft Word 进行基准测试。这很大程度上受到了 Eigenpal 闭源的启发,以及我在处理复杂的 Word 模板、诉状等文件时遇到的一些个人挫折,因为没有一个干净的方法可以在不拥有 Microsoft Word 的情况下查看/编辑它们(我最终还是买了,但体验很糟糕)。 这同时也是一个展示良好评估(evals)对 Agent 进行基准测试价值的练习。我没有
6 分•作者: divitsheth•3 个月前
各位 HN 的朋友们!我是 Divit,来自 Almanac(YC S26)。我们开发了 CodeAlmanac,一个用于编码助手的维基,它会随着你与助手的交流而更新。它是开源的、本地的,并且免费。 演示地址:<a href="https:&#x2F;&#x2F;www.youtube.com&#x2F;watch?v=XNQWV3TFBWM" rel="nofollow">https:&#x2F;&#x2F;www.youtube.com&#x2F;watch?v=XNQWV3TFBWM</a> 你的 CC/Codex 对话包含了大量未被记录而遗忘的知识。人们有自己记录对话的方法。我们过去会创建 Markdown 文件,如 MANUAL.md 和 DESIGN.md,并提示 Claude 保持更新。但问题是,这些文件很快就会过时且混乱,而且单个文件能容纳的内容有限。 因此,我们着手构建 CodeAlmanac。我们希望它能做到:1) 自动维护,2) 位于我们的代码仓库内,3) 利用我们现有的 Codex/Claude Code 订阅。 CodeAlmanac 会在你的代码仓库内维护一个 `almanac/` 文件夹。它包含相互关联的 Markdown 页面,涵盖代码库中未记录的内容,包括你做出的决策以及代码库为何是这样形成的。 这些页面被索引在 SQLite 中,可以通过 CLI 进行查询。我们将指令添加到 AGENTS.md 或 CLAUDE.md 中,以便未来的会话在开始编码前自动搜索维基。 每隔五小时,CodeAlmanac 会使用 Codex/CC SDK 启动一个助手,读取你的新对话并更新相关页面。我们选择基于时间的触发器而不是提交,因为我们注意到人们提交非常频繁,这会导致高昂的 token 费用。 最初,我们为个人开发者构建了 CodeAlmanac,但在我们自己使用过程中,团队用例变得更加明显。我们是一个三人团队,每个人都与自己的编码助手一起工作。在此之前,我会经过深思熟虑做出一些改动,然后不得不打电话给我的联合创始人,解释为什么它看起来是这样。现在,知道我做出的决定被记录在他们助手会实际阅读的地方,几乎是一种解脱。 它今天已经上线供大家试用。请随时提供您的反馈,我将在这里回答任何问题。也非常想听听大家今天是如何在对话中保持上下文的!
1 分•作者: alexsouthmayd•3 个月前
关于 Bloomy Bloomy 是一个面向 K-12 学生的人工智能导师和课程。在早期试点中,我们的学生用户学习速度大约是原来的两倍,学生和老师都非常喜欢我们的产品。 工作原理:我们诊断学生的技能差距,为他们规划个性化的学习路径,然后由人工智能导师进行教学。AI 会学习他们的学习方式,从而提高教学效率,进而提高学习效率。 您如何提供帮助:您将作为创始工程师加入。目前,工程团队只有一位创始人(我),他通过协调大量的编码代理来根据规范、验证工具和质量保证门来生成大部分代码和课程。我是一位拥有前教师和销售领导者领域专业知识的独立创始人,但我并非科班出身的工程师,我需要一位真正具备技术专长的人来实现改善数百万学生教育的愿景。 我们为何与众不同:Bloomy 是原生 AI。我从今年 2 月到 4 月构建了整个产品,从 4 月到 6 月将其提供给 6 所学校的 500 名学生使用,6 月份开始参加 YC,此后 ARR 大约每两周翻一番。今年秋季,将有数千名学生使用我们的产品。Bloomy 也是过去五个批次中第一家通过 YC 的 EdTech 公司,因此这是一个机会,可以成为少数几家试图用 AI 改变教育的初创公司之一。 您最初的 90 天 第一周 将一个功能或修复程序发布到生产环境,并在第二天观察真实学生在真实课堂中使用它。我们从“合并”到“一名六年级学生使用它”的周期尽可能短。 第一个月 熟悉 React/TypeScript 应用、Supabase 后端、内容管道以及为其提供支持的代理集群。负责您的第一个集群——编写规范、构建工具、设置质量保证门——并通过它开始发布。 三个月后 与我一起设计路线图:约 50% 的时间用于跨堆栈发布产品,约 25% 的时间用于构建和运行代理基础设施,约 25% 的时间用于与教师、学生和学区交流——并将您听到的内容转化为路线图。 我们非常想构建的东西 - 数据飞轮。教育领域几乎没有人能够将遥测数据与教学本身联系起来。我们可以在几天内完成——针对每一次回答、重试、AI 导师对话以及任何其他互动——而不是经过教科书修订周期。设计这个循环。 - 将代理编排作为一项一流的工程问题。更好的工具、更好的评估、更好的验证——这样,十几个并发代理就能生成您信任的、可以在课堂上使用的工作。 - 学校接下来需要的东西。今天我们为学生和教师提供工具。学区的表面积巨大,您将帮助决定我们的发展方向。 我们正在寻找这样的人: - 拥有 5 年以上交付真实用户日常使用的产品经验,并对如何使产品优秀有自己的见解。 - 主动性强:能够接受模糊的反馈并将其转化为已发布的产品,而无需等待规范。 - 精通 AI 编码工具,并利用它们来显著提高效率——而不是将判断外包给它们。 - 对管理十几个并发代理的想法感到兴奋,而不是精疲力尽。 - 希望与真实用户(其中一些是十一岁的孩子)建立紧密的反馈循环。 - 具有很强的抗压能力——花名册 CSV 导入、学校设备性能怪癖以及学校特定的定制都是工作的一部分,也是我们获胜的原因。 - 关心可衡量的学习成果,而不仅仅是参与度指标。 优先经验 - TypeScript、React、Postgres(我们使用的是 React 18、Vite、Tailwind、shadcn/ui、Supabase、TanStack Query,部署在 Vercel 上)。 - 生产环境中的 LLM:代理、评估、工具使用、上下文管理。 - 构建供代理使用的代码库和管道。 - 事件遥测、分析或实验系统。 - Edtech 背景并非必需。 背景故事 我的职业生涯始于一名七年级英语老师,我亲眼目睹了教授 30 个不同理解水平的 30 个孩子的艰辛。在 Lyft 构建了司机获取引擎,在斯坦福攻读 MBA 期间进行了各种创业尝试,并在麦肯锡从 AI 代理和工作流程的兴起之初就开始构建它们,我现在相信教育是 AI 可以对社会产生最大积极影响的领域。 薪酬 - 175,000 美元 - 200,000 美元 - 1.5% - 2.0% 的股权 创始工程师套餐——从第一天起就拥有有意义的所有权。 听起来像你吗? 发送电子邮件至 alex@bloomylearning.com。请附上您构建过的、真实用户使用过的东西。
1 分•作者: abhisek•3 个月前
您好 HN, 我是 SafeDep 的创始人。我们一直在检测恶意软件包。从 DevSecOps 的背景出发,我一直认为恶意软件包的检测和防护是构建阶段的问题。但从 S1ngularity 和早期的 Shai-Hulud 时代开始,我就错了。 在 2026 年,我们开始更多地担心自己的开发机器,而不是 CI/CD 环境。仅仅依赖威胁情报数据(OSV / SafeDep / Socket / 任何其他来源)来保护自己的开发机器感觉不对。我们希望构建一个多层防护,能够 100% 可视化传入的 OSS 软件包,并能防护已知和“希望”未知的威胁。Package Manager Guard (PMG) 就是这样诞生的。核心思想很简单: * 启动一个本地代理(localhost) * 确保支持的包管理器如 npm、pnpm、pip 等通过它 * 使用威胁情报数据快速拒绝已知的恶意软件包 * 应用依赖项冷却等策略作为额外的安全措施 * 采用 CEL 等策略语言支持自定义策略(路线图) * 所有内容都保留在本地,支持堆叠策略和审计日志 * 威胁模型 - 保护“愿意”的开发者免受恶意开源软件包的侵害 注意:PMG 不将恶意开发者视为其威胁模型的一部分。因此,没有真正投入精力去“强制执行”,而是以减少摩擦并保持有效性为目标。 然后,我们遇到了 Anthropic 的 SRT,突然意识到进程内 OS 原生沙箱是限制未知威胁影响范围的好方法,特别是考虑到包管理器具有可预测的运行时行为,可以通过沙箱进行允许,同时拒绝更大的用户权限。我们在 MacOS 上采用了 seatbelt,在 Linux 上采用了 Landlock + Seccomp BPF。Seccomp BPF 与 Go 的结合本身就是一场战斗,因为对 OS 线程缺乏控制,但最终在没有重大性能损失的情况下成功实现了。 总而言之,PMG 不仅仅依赖 SafeDep 检测恶意软件包的能力。它强制执行依赖项冷却(如果您使用旧版 npm/pnpm,这将非常有用),并提供沙箱来防护恶意软件包。我们近期的目标是支持 CEL 作为策略语言,并改进沙箱规则相关的工具,以便更容易采用。 欢迎任何反馈。