返回首页

24小时热榜

1作者: frabonacci大约 18 小时前
大家好,HN!我们是 Cua 的 Dillon 和 Francesco。 我们想知道,有多少计算机使用任务实际上需要一个通用的 LLM(例如 gpt-6-astra、claude-opus-5 等)来思考所有的决策和步骤。有些任务需要规划、探索不同的路径、从失败中恢复。其他任务则涉及本地决策,比如这个值应该放在这个框里,或者我应该勾选这个框,或者这个元素应该被忽略。 我们想知道,如果我们使用一个只为做出这类决策而训练的小模型,能走多远。 我们的灵感来自 Typesafe 的 Jev 及其 System One Model 框架。这是对丹尼尔·卡尼曼(Daniel Kahneman)所描述的快速、自动、直观的思考(系统 1)与缓慢、分析性思考(系统 2)之间的二分法的致敬。 我们感兴趣的问题是:如果我们给一个模型提供当前上下文的接口和一组可能的选择,并要求它为每个选择返回一个概率,会发生什么?这种模型不像大多数 LLM 那样逐个 token 生成输出,而是对你提供的选项进行评分,你可以检查、信任并用它来驱动你的应用程序的行为。 CUA-S1 是我们针对狭窄、专业化的计算机使用决策模型的答案。我们的第一个版本是 CUA-S1-FORMS。我们基于 jevlike 的想法和代码构建了它,然后训练了第二个模型来专门处理表单交互。它有 706k 个参数,原始检查点大小为 2.8 MB。 第一次训练迭代在合成数据上花费了不到 30 分钟。给定从文档中提取的一组结构化元素和值,它会预测是为每个元素使用给定的值、勾选(CHECK)、点击(CLICK)还是跳过(SKIP)。它不会为文本字段预测新值,也不会考虑截图。元素决策一起评分,你的代码可以排序操作,Cua Driver 将逐个执行它们。 对这个专用模型与托管 Jev 在我们的表单任务上的初步评估: * 对于整个决策集:专用模型正确率为 99.7%,托管 Jev 为 83.6%。 * 对于需要操作的步骤子集:专用模型正确率为 100%,托管 Jev 为 96%。 * 对于只是保留已填写字段不动的步骤子集:专用模型正确率为 100%,托管 Jev 为 74%。 专用模型是专门为这项任务和约定(已填写框直接跳过)训练的,而托管 Jev 没有针对此进行微调,因此这是一个关于范围专业化的实验。 我们测得本地评分表单需要 7-9 毫秒,而每次调用托管 Jev(包括网络延迟)需要 260-280 毫秒,尽管这些样本测量的是不同的东西,而不是端到端的表单完成时间。 我们感兴趣的是介于脆弱脚本和通用代理循环之间的空间。表单字段的内容和布局变化足够大,以至于脚本变得笨拙,但可用的决策集可以保持狭窄和范围明确。我们希望探索通用代理遇到新事物,并将易于理解的决策交给像这样的专用模型处理的可能性。 这是我们正在探索的一个方向。当前版本仅适用于表单。我们在 libs/cua-s1 下开源了合成数据生成、训练、评估和 Driver 集成,采用 MIT 许可证。 欢迎评论!特别是如果你正在构建计算机使用代理,并且遇到了一个重复出现的决策,它变化太大以至于无法编写脚本,但又太狭窄以至于无法调用另一个 LLM。