8作者: andrew_zhong5 个月前
我们一直在构建数据管道,用于抓取网站并提取结构化数据。如果你做过类似的事情,你就会知道其中的门道:你编写 CSS 选择器,网站改变了布局,所有东西在凌晨 2 点崩溃,然后你得花一上午的时间重写解析器。 大型语言模型(LLM)似乎是显而易见的解决方案——只需将 HTML 扔给 GPT 并请求 JSON。但实际上,这比那更痛苦: - 原始 HTML 充满了导航栏、页脚和跟踪垃圾,会消耗你的 token 预算。一个典型的产品页面 80% 都是噪音。 - LLM 返回格式错误的 JSON 的频率超乎你的想象,尤其是在嵌套数组和复杂模式的情况下。一个错误的括号就会导致你的管道崩溃。 - 相对 URL、markdown 转义链接、跟踪参数——当你处理数千个页面时,这些“小”的 URL 问题会迅速累积。 - 你最终会一遍又一遍地编写相同的样板代码:HTML 清理 → markdown 转换 → LLM 调用 → JSON 解析 → 错误恢复 → 模式验证。 我们厌倦了为每个项目重建这个堆栈,所以我们将其提取到一个库中。 Lightfeed Extractor 是一个 TypeScript 库,它处理从原始 HTML 到经过验证的结构化数据的整个管道: - 将 HTML 转换为 LLM 准备好的 markdown,并提取主要内容(删除导航栏、标题、页脚),可选地包含图像,并进行 URL 清理 - 适用于任何与 LangChain 兼容的 LLM(OpenAI、Gemini、Claude、Ollama 等) - 使用 Zod 模式进行类型安全的提取和真正的验证 - 从格式错误的 LLM 输出中恢复部分数据,而不是完全失败——如果 20 个产品中有 19 个解析正确,你就能得到这 19 个 - 通过 Playwright 内置浏览器自动化(本地、无服务器或远程),并带有反机器人补丁 - 与我们的浏览器代理(@lightfeed/browser-agent)配对,在提取之前进行 AI 驱动的页面导航 我们自己在 Lightfeed 的生产中使用它,并且它足够稳定,所以我们决定开源它。 GitHub: <a href="https://github.com/lightfeed/extractor" rel="nofollow">https://github.com/lightfeed/extractor</a> npm: npm install @lightfeed/extractor 采用 Apache 2.0 许可证。 欢迎提问或提供反馈。
1作者: isaacsight5 个月前
我构建了 kbot——一个终端 AI 智能体,它从每个会话中学习,并在遇到无法解决的问题时创建新工具。 它的与众不同之处:自我提升(贝叶斯技能路由随着时间的推移变得更智能)。工具创建(遇到差距时,构建一个工具,该工具永久存在)。自我防御(HMAC 内存完整性,提示注入检测)。368 个工具,41 个智能体,19 个本地模型。完全离线,0 美元。梦境模式(空闲时自我改进)。MIT 许可。 kbot 在 30 秒内创建工具的演示:[https://raw.githubusercontent.com/isaacsight/kernel/main/tools/video-assets/demo-forge-real.gif](https://raw.githubusercontent.com/isaacsight/kernel/main/tools/video-assets/demo-forge-real.gif) npm install -g @kernel.chat/kbot
1作者: mda_damico5 个月前
新版本发布啦!本次更新包含大量改动:更新了UI,新的稳定版EffectsSDK包含了更新的AI模型,以及数百处代码改动,提升了速度、质量和兼容性。<p>我们将其设置为付费版本,但仍可免费使用,无使用时长限制,但会带有水印。欢迎提供反馈!