3 分•作者: avijeetsingh16•2 个月前
两个不共享模型、不依赖同一供应商且互不信任的代理,可以引用同一条已签名的事实,并各自独立验证。例如,卫星、机器人、闭路电视等设备正在填充今天的内存;任何观察世界的机器,都可以通过证明其运行方式来加入。
2 分•作者: minpym•2 个月前
大家好!这是我第一次在 HN 上发帖,我刚接触这个领域不久。我叫 Min,来自曼谷。 起初,我只是想为自己制作一个“死亡开关”,纯属个人用途和娱乐。然后,我想到像间谍电影里那样信息自毁的功能。之后,我尝试想出一个比 Privnote 或 Bitwarden 更好的版本,具备自毁功能,以及某种程度的审查或阻止下载的能力。不知怎么的,就有了这个产品。:O Flashpaper 用于发送任何“阅后即焚”的信息(带有像《碟中谍》电影一样的倒计时器!或者在 24 小时内未打开则失效)。加密在浏览器中进行,由于密钥保留在链接的 # 之后,服务器永远不会看到密钥(适用于 Web 端的零知识证明)。而且,因为我是新手,我不想连接数据库,因为我没钱,而且我希望事情保持轻量和简单。所以,Flashpaper 将信息保存在内存中,没有数据库。 对于 AI Agent 端,Flashpaper 提供了一个 REST API 和一个 MCP 服务器,以便 Agent 可以轻松地以“一次性领取”的风格创建秘密链接。第二次领取将返回 404,这意味着已经被别人领取了。然而,对于 Agent API 流程,服务器在加密之前会短暂看到明文,所以这个流程不像 Web 流程那样是零知识的。 总的来说,我认为它在 Web 端表现相当不错,但对于 Agent API 的使用,我不确定安全性是否足够。所有限制都在 SECURITY.md 文件中列出。欢迎大家提出反馈。 我将其开源,采用 MIT 许可证,并对企业用户实行“荣誉许可”政策,例如自托管 Docker。 这是我的仓库:[https://github.com/mmmpym/flashpaper](https://github.com/mmmpym/flashpaper) 你也可以在这里试用:[https://flashpaper.app](https://flashpaper.app) 再次强调!请随时告诉我我遗漏了什么。 Min
2 分•作者: johnnymakes•2 个月前
大家好,我是 Exabase 的创始人 Johnny。我们刚刚在 BEAM 上取得了迄今为止最高的报告分数,BEAM 是最难的人工智能记忆基准测试,覆盖了高达 1000 万 token 的所有规模。我们还使用 Gemini 3 Flash 进行了评估,而之前所有领先者都依赖于更大规模的模型(Gemini 3 Pro)。 在 1000 万 token 的规模下,其大小远远超过了任何模型的上下文窗口,因此上下文填充不是一个选项(而且即使是这样,在不降级的情况下,也只能有效利用大约一半的大窗口)。要获得好成绩的唯一方法是拥有真正起作用的检索能力。 我们的系统 (M-1) 在 100K 规模下得分 76.9%,在 1M 规模下得分 75.0%,在 10M 规模下得分 68.0%。之前的领先者是 Hindsight(分别为 73.4%、73.9%、64.1%)和 Honcho(分别为 63.0%、63.1%、40.6%),它们都使用了 Gemini 3 Pro,而我们使用的是 Flash。 我们发现,随着规模的增大,竞争差距也在扩大:在 100K 规模下领先 Hindsight 3.5 个百分点,在 10M 规模下领先 3.9 个百分点。与 Honcho 的差距从 13.9 个百分点扩大到 27.4 个百分点。随着语料库的增大,它更能区分有效的检索能力与蛮力/模型能力。 M-1 在每次查询时消耗的 token 量也比次优系统少约 20%。 关于 BEAM 基准测试: BEAM 测试了十种记忆能力,包括其他基准测试未涵盖的一些能力:矛盾解决、事件排序和指令遵循。1000 万 token 的规模大致相当于一年内与 LLM 进行的长时间日常对话。 当然,我们的系统离完美还有很长的路要走,在某些类别(偏好遵循、指令遵循、摘要、弃权)方面表现出色,即使在 1000 万 token 的规模下,这些类别也一直保持在 90% 以上。 在其他类别中,我们的系统也显示出弱点:例如,多会话推理:在 100K 规模下为 44.7%,在 10M 规模下下降到 9.6%。尽管这一挑战似乎是这个规模下所有记忆系统的普遍问题,而非 M-1 特有。我们将继续努力解决这个问题。 方法论: 我们分叉了 Hindsight 的开源基准测试脚本,替换了检索层,并使用了 runner 的提示结构,并进行了少量调整以用于生产环境。完整的 metodology、所有三个规模的结果 JSON 以及提示生成器都链接在论文中(论文链接如下)。 结合我们的 LongMemEval 结果(96.4%),M-1 现在是唯一一个在从 11.5 万到 1000 万 token 的所有规模下,在两个主要记忆基准测试中都保持 SOTA 的系统。 研究论文:https://exabase.io/research/exabase-achieves-state-of-the-art-on-beam-benchmark 很乐意讨论架构、基准测试、规模挑战等。
2 分•作者: Luxter•2 个月前
像Vanta、Drata等合规性软件只能读取第三方API(如AWS、Github、Okta等),但无法自动审计实际使用这些API的应用程序,例如在特定时间点谁拥有应用程序的管理员访问权限。 我是一名在波兰的工程师,没有合规背景。因此,如果您过去曾为您的应用程序进行过审计(SOC 2 / ISO 27001 / HIPAA / PCI 等): 1. 您生成了什么(截图?SQL查询?CSV?) 2. 您公司里是谁做的?花了多长时间?这是一个经常性的任务吗? 3. 您是否在内部构建了任何工具来完成这项工作?您还在维护它吗? 如果您使用了某个工具来完成这项工作,我将非常感谢您告诉我具体是哪个工具。