1 分•作者: hundredwatt•3 个月前
返回首页
最新
1 分•作者: rpgbr•3 个月前
2 分•作者: theanonymousone•3 个月前
1 分•作者: yresnob•3 个月前
2 分•作者: wslh•3 个月前
1 分•作者: rbanffy•3 个月前
2 分•作者: aizk•3 个月前
我的同事回复了四川风险投资家(活动规定只能使用方言)的见面邀请,她用四川方言回复的。
Grok 将她约见的请求翻译成了“三人行”。
https://x.com/Richelle_Ji/status/2071796989638140253
我们在工作中通过 Twitter 与开发者建立联系,而这件事令人非常沮丧。
为什么 AI 翻译会停滞不前?为什么 Grok 如此性化?这到底是怎么回事!
不知道还能和谁分享这件事,希望 Hacker News 能对此事有所启发。
1 分•作者: tejohnso•3 个月前
24 分•作者: alok-g•3 个月前
14 分•作者: yyyk•3 个月前
1 分•作者: cactusplant7374•3 个月前
1 分•作者: PJHkorea•3 个月前
2 分•作者: mayosmith•3 个月前
1 分•作者: obilgic•3 个月前
1 分•作者: logicallee•3 个月前
1 分•作者: nikolay•3 个月前
1 分•作者: standardUser•3 个月前
1 分•作者: akyuu•3 个月前
2 分•作者: erico964-blip•3 个月前
1 分•作者: bhaktatejas922•3 个月前
生产代理最常见的故障是行为方面的:循环、推理泄露、用户沮丧等。使用 GPT 或 Sonnet 等前沿模型来判断每一个回合的成本太高且速度太慢,无法大规模运行。
工作原理:
我们使用具有混合注意力的现代 LLM,并移除解码步骤。我们构建了一个推理引擎,允许预填充计算从一个反射到另一个反射重复使用 99%,这在精神上类似于 2019 年的 BERT/HYDRA + 旧的多头技术。
我们采用了相同的宏观理念,并付出了艰苦的努力,使其能够与现代架构和注意力机制协同工作。在此基础上,我们可以在 30 毫秒内完成推理,并在 90 毫秒内处理完整个请求。无论您运行 4 个反射还是 100 个反射,额外的开销都不到 2 毫秒。
为什么优化这一点很重要?
即使您是一个中等规模的初创公司,您也会处理数万次代理运行和数百万个回合。如果您想跟踪用户沮丧率随时间的变化,前沿 LLM 作为裁判的方案是无法扩展的。
我在特斯拉构建了一个类似的堆栈。当 ML 工程师需要跨 PB 级数据采样诸如 `is_camera_obfuscated=true` 等信号以及其他 200 种信号时,您需要 1) 快速启动它们 2) 高效地大规模运行。
它不是什么:
仪表板。根据我的经验,99% 的仪表板都不会被使用。这个工具纯粹是基于 API 的,专为希望自行跟踪代理行为、触发自己的警报并在此基础上进行构建的开发者而设计。
您可以在我们的仪表板中训练自定义反射,然后让它在生产环境中自我改进:https://www.morphllm.com/dashboard/reflex
文档:https://docs.morphllm.com/sdk/components/reflexes/index
我很想听听那些在生产环境中运行代理的人的反馈:您希望能够跟踪哪些类型的信号,覆盖 100% 的回合?
简而言之:来自代理跟踪的语义信号,速度极快,通过 API 实现成本低廉。