1作者: yousef_g5 个月前
Hi HN,我构建这个项目是因为我想看看,我是否能在独立研究人员可用的硬件上预训练大词汇量LLM(比如拥有26.2万个token的Gemma)。 标准的精确交叉熵在16GB GPU上,遇到这种规模时会立刻耗尽内存(OOM)。 为了绕过这个问题,我实现了MAXIS损失函数。它使用“幽灵Logit”来数学模拟未采样token的缺失概率质量,而不是实例化完整的26.2万宽的矩阵。 在16GB VRAM显卡(T4)上的基准测试结果: * 与Triton优化的Liger Kernel相比,损失层速度快17.5倍。 * 目标计算中VRAM减少约39%。 包含RandNLA注意力机制,该机制使用因果克罗内克素描来保持内存随着序列长度的增长而平稳。 我在代码库中包含了带有正式数学公式的技术报告。我非常欢迎大家对分区函数模拟或素描方法的任何技术反馈。
1作者: arnold_laishram5 个月前
UI 测试之所以脆弱,是因为它们依赖于容易失效的定位器(XPath/ID)。测试在本地通过,但在 CI 环境中会因为 UI ID 更改而失败——导致持续的维护和开发时间的浪费。 Finalrun 用人类可读的规范取代了定位器。你只需编写通俗易懂的指令(例如,“点击设置,搜索‘Spanish’,验证‘Español’”),一个基于视觉的 QA 代理就会像人类一样在视觉上操作应用程序——因此,重命名的 ID 不会破坏测试。 使用用于测试移动应用程序的纯英语代理,规范驱动的方法可以顺利运行,无需太多维护: 1. 凭借技能,该代理可以分析你的代码库, 2. 自动生成边缘案例规范(带设置/清理),并将它们导出为 .md 测试 3. 现在你可以通过 CLI 运行测试(./mobile-cli run ./test/search.md)。 如果你想尽早获得访问权限或在代码开源时获取代码,我正在收集电子邮件: [https://docs.google.com/forms/d/1EwHjqK6t1pBQgsKWih1Z_hQqP837elhl7hVbUGLHqV0](https://docs.google.com/forms/d/1EwHjqK6t1pBQgsKWih1Z_hQqP83...) (演示:[https://youtu.be/SsVHRDWk_ss](https://youtu.be/SsVHRDWk_ss))
3作者: tash_2s5 个月前
我一直在尝试为物理世界构建更主动的 AI 界面。<p>这个项目是为智能眼镜设计的调酒助手。它会观察配料,选择食谱,显示步骤,并根据它所看到的内容实时指导我。我最想要的行为很简单:当我倒酒时,它应该告诉我什么时候停止,而不是等我问。<p>演示视频在 README 的顶部。<p>我所追求的交互模型就像一个在你身边的热心人,他了解情况并在适当的时机介入。我认为这种界面对于防止人们在发生时可能没有注意到的错误特别有用。<p>该系统通过每 0.5 秒在最新的 0.5 秒视频片段上持续运行 Qwen3.5-27B 来工作。我使用 Overshoot (<a href="https:&#x2F;&#x2F;overshoot.ai&#x2F;">https:&#x2F;&#x2F;overshoot.ai&#x2F;</a>) 进行快速的实时视频 VLM 推理。因为它处理的是短片段而不是单帧,所以它可以捕捉运动线索以及视觉上下文。就我而言,每次推理大约需要 300-500 毫秒,这使得反馈对于这种交互来说感觉足够灵敏。根据 VLM 返回的事件,应用程序处理其余部分:状态跟踪、进度管理以及语音和 LLM 处理。<p>我之前尝试过一个类似的想法,使用微调的 RF-DETR 目标检测模型。这种方法在成本上更好,并且也可以在设备上运行。但是 VLM 更加灵活:我可以通过提示来改变行为,而无需重新训练,并且它们可以处理比单独的目标检测更广泛的情境理解。但在实践中,对于小型和快速的 VLM,提示的措辞非常重要。获得可靠的行为意味着学习特定模型对哪些类型的提示会持续响应。<p>我通过制作无酒精鸡尾酒来测试了这一点,但我认为相同的交互模式应该可以更广泛地推广到烹饪。我计划尝试更多示例,看看它在哪里运行良好,以及在哪里失效。<p>一件似乎很困难的事情是检查液位,尤其是在液体几乎透明的情况下。到目前为止,我只尝试过 VLM,并且我很好奇其他方法可能有什么效果。<p>欢迎提出问题和反馈。
1作者: sara_builds5 个月前
在花费了大量时间通过 SSH 连接服务器来检查我的代理是否存活后,我构建了这个工具。AgentPen 为你提供一个集中式仪表板,用于管理所有 OpenClaw 代理:自动发现、实时活动流、任务看板、每个代理的 API 成本跟踪、可视化配置编辑器以及一键式 VPS 部署。前 30 位用户免费(剩余 26 位),之后一次性收费 49 美元。 适用于 macOS Apple Silicon 芯片。