2 分•作者: aizk•3 个月前
我的同事回复了四川风险投资家(活动规定只能使用方言)的见面邀请,她用四川方言回复的。 Grok 将她约见的请求翻译成了“三人行”。 https://x.com/Richelle_Ji/status/2071796989638140253 我们在工作中通过 Twitter 与开发者建立联系,而这件事令人非常沮丧。 为什么 AI 翻译会停滞不前?为什么 Grok 如此性化?这到底是怎么回事! 不知道还能和谁分享这件事,希望 Hacker News 能对此事有所启发。
1 分•作者: bhaktatejas922•3 个月前
生产代理最常见的故障是行为方面的:循环、推理泄露、用户沮丧等。使用 GPT 或 Sonnet 等前沿模型来判断每一个回合的成本太高且速度太慢,无法大规模运行。 工作原理: 我们使用具有混合注意力的现代 LLM,并移除解码步骤。我们构建了一个推理引擎,允许预填充计算从一个反射到另一个反射重复使用 99%,这在精神上类似于 2019 年的 BERT/HYDRA + 旧的多头技术。 我们采用了相同的宏观理念,并付出了艰苦的努力,使其能够与现代架构和注意力机制协同工作。在此基础上,我们可以在 30 毫秒内完成推理,并在 90 毫秒内处理完整个请求。无论您运行 4 个反射还是 100 个反射,额外的开销都不到 2 毫秒。 为什么优化这一点很重要? 即使您是一个中等规模的初创公司,您也会处理数万次代理运行和数百万个回合。如果您想跟踪用户沮丧率随时间的变化,前沿 LLM 作为裁判的方案是无法扩展的。 我在特斯拉构建了一个类似的堆栈。当 ML 工程师需要跨 PB 级数据采样诸如 `is_camera_obfuscated=true` 等信号以及其他 200 种信号时,您需要 1) 快速启动它们 2) 高效地大规模运行。 它不是什么: 仪表板。根据我的经验,99% 的仪表板都不会被使用。这个工具纯粹是基于 API 的,专为希望自行跟踪代理行为、触发自己的警报并在此基础上进行构建的开发者而设计。 您可以在我们的仪表板中训练自定义反射,然后让它在生产环境中自我改进:https://www.morphllm.com/dashboard/reflex 文档:https://docs.morphllm.com/sdk/components/reflexes/index 我很想听听那些在生产环境中运行代理的人的反馈:您希望能够跟踪哪些类型的信号,覆盖 100% 的回合? 简而言之:来自代理跟踪的语义信号,速度极快,通过 API 实现成本低廉。