10作者: arjunchint4 个月前
我们在 rtrvr.ai 中构建了 AI 子程序。只需录制一次浏览器任务,将其保存为可调用的工具,即可实现:零代币成本、零 LLM 推理延迟和零错误。 子程序本身是一个确定性脚本,由发现的网络调用组成,这些调用会命中网站的后端,以及页面交互,如点击/输入/查找。 关键的架构决策是:脚本在网页本身内部执行,而不是通过代理、无头工作者或进程外执行。该脚本从选项卡的执行上下文中分派请求,因此身份验证、CSRF、TLS 会话和签名标头都会被添加到所有请求中,并免费传播。无需安装证书,无需修改 TLS 指纹,也无需维护单独的身份验证堆栈。 在录制过程中,扩展程序会拦截网络请求(MAIN-world fetch/XHR 补丁 + webRequest 备用方案)。我们根据方法、相对于 DOM 事件的时间以及来源,对大约 300 个请求进行评分和修剪,最终保留大约 5 个。检测到易变的 GraphQL 操作 ID 后,会强制使用仅 DOM 备用方案,以防止它们在下次运行时静默中断。 生成的代码通过 rtrvr.* 辅助命名空间,将网络调用与 DOM 操作(点击、输入、查找)组合在同一个函数中。将代理指向一个包含 500 行的电子表格,只需一次 LLM 调用即可分配参数并启动 500 个子程序。 主要用例: * 录制发送 IG DM 的过程,然后拥有可重用且可调用的例程,以零代币成本发送 DM * 创建获取网站目录中最新产品的例程,调用它通过直接 graphql 查询获取数千种产品 * 设置例程以根据工具的参数填写 EHR 表格,AI 从当前页面上下文中推断参数并调用工具 * 每天重复使用例程,使用 MCP 服务器将 LinkedIn/Slack/Gmail 上的传出消息同步到 CRM 我们认为浏览器代理尚未普及的根本原因是,对于重复性任务,通过推理循环是多余的。最好只录制一次,并让 LLM 生成一个脚本,利用所有可能的方式与网站和更广泛的网络进行交互,例如直接调用后端 API、与 DOM 交互以及调用第三方工具/API/MCP 服务器。
1作者: akadeb4 个月前
Cloudflare 最近发布的语音代理提供 Deepgram STT(语音转文本)和 TTS(文本转语音)的免费每日使用额度。 因此,我创建了一个基于 Cloudflare Workers、Durable Objects 的语音 AI 代理管道,并与 Arduino ESP32 进行了交互。这使您能够利用任何 LLM(大型语言模型)为您的语音 AI 玩具和桌面助手提供支持,并原生处理 STT + TTS。