15 分•作者: bayes-song•5 个月前
我开发 Understudy 是因为很多实际工作仍然需要在本地桌面应用、浏览器标签页、终端和聊天工具之间切换。而目前大多数智能体只能在一个界面中运行。<p>Understudy 是一个本地优先的桌面智能体运行时,可以在一个会话中操作 GUI 应用、浏览器、shell 工具、文件和消息传递。我最希望得到反馈的部分是“演示教学”功能:你执行一次任务,智能体就会记录屏幕视频和语义事件,提取意图而不是坐标,并将其转化为可复用的技能。<p>演示视频:<a href="https://www.youtube.com/watch?v=3d5cRGnlb_0" rel="nofollow">https://www.youtube.com/watch?v=3d5cRGnlb_0</a><p>在演示中,我教它:Google 图片搜索 -> 下载照片 -> 在 Pixelmator Pro 中移除背景 -> 导出 -> 通过 Telegram 发送。然后我让它对埃隆·马斯克做同样的事情。重放不是一个脆弱的宏:发布的技能仅将意图步骤、路由选项和 GUI 提示存储为备用方案。在这个例子中,当有更快的路线时,它也可以优先选择,而不是重复每一个 GUI 步骤。<p>当前状态:仅支持 macOS。第 1-2 层今天已经可以使用;第 3-4 层是部分实现的,还处于早期阶段。<p><pre><code> npm install -g @understudy-ai/understudy
understudy wizard
</code></pre>
GitHub:<a href="https://github.com/understudy-ai/understudy" rel="nofollow">https://github.com/understudy-ai/understudy</a><p>欢迎就架构、演示教学或当前实现的局限性提出问题。