返回首页

一周热榜

2作者: ccheshirecat4 天前
抓取现代网站已成为一大难题。你基本上有两个选择:要么支付 Firecrawl/Browserbase 等昂贵的 API 费用,要么运行大量无头 Chrome 实例,每个页面消耗 1GB 内存,而且仍然会被 Cloudflare 阻止。 我构建 Draco 来解决这个问题。它是一个用 Rust 编写的快速、单二进制的网络爬虫。你将其指向一个 URL,它就会输出完美的 Markdown 或结构化的 JSON,供 LLM 使用。 其秘诀在于,它不会为每个请求都启动一个浏览器。它使用一个分层升级引擎: 第一层(隐形抓取):Draco 使用自定义的 TLS/JA4 指纹,在数据包级别完美模仿真实浏览器的网络签名。事实证明,许多反机器人墙如果你的握手看起来正确,就会让你畅通无阻。在我针对 Cloudflare 和 Target 等网站的基准测试中,Playwright 消耗了约 500MB 内存并超时。Draco 在不到一秒的时间内就绕过了它们,仅消耗了 20MB 内存。 第二层(V8 隔离):如果遇到需要渲染的 React/Next.js SPA,Draco 会在几毫秒内启动一个进程内的 V8 引擎。它会水合 DOM 并拦截页面正在调用的隐藏 JSON API——让你获得原始数据,而无需图形浏览器的开销。 第三层(真实浏览器):如果遇到绝对的障碍,它会无缝回退到检测并驱动你机器上的真实浏览器。 我还构建了所有工具,使其成为托管服务的完整即插即用替代品: 守护进程模式:运行 `draco serve`,你将获得一个具有 Firecrawl 兼容 REST API 的持久 HTTP 服务器。你可以立即替换你的 API 密钥并进行自托管。 内置 MCP 服务器:它原生暴露一个模型上下文协议服务器,因此你可以将其直接插入 Claude Desktop 或你的 AI 代理。 网络搜索:内置并行多引擎网络搜索(无需 Google Search API 密钥)。 交互模式:像开发者工具控制台一样有状态地驱动页面,在导航之间持久化 cookie(主要用于 LLM)。 它完全开源(MIT/Apache-2.0)。我只是想把它提供给任何厌倦了与无头 Chromium 斗争或支付按页抓取费用的人。下载二进制文件,然后给它一个困难的 URL。 请注意,它仍处于开发阶段,因此可能会有一些不常见网站的意外中断,但总的来说它非常强大,可以处理 cf 保护的网站和重度 SPA,而其他所有工具都部分或完全失败,耗时更长或资源更多。(已在 example.com、hackernews、cloudflare、glassdoor、bluff.com、target.com、stake.com 和 thrill.com 上进行测试) | 排名 | 工具 | 分数 | 通过率 | 平均时间 | 平均内存 | | ---- | ------------ | ----- | ------ | -------- | -------- | | #1 | Draco | 769.7 | 8/8 | 3.45 | 216.50 | | #2 | Obscura | 384.5 | 4/8 | 2.68 | 87.59 | | #3 | BrowserOxide | 373.4 | 4/8 | 6.42 | 105.95 | | #4 | Playwright | 342.2 | 4/8 | 1.71 | 535.07 | | #5 | Bouncy | 196.6 | 2/8 | 0.59 | 19.38 | 仓库:https://github.com/0xchasercat/draco/
2作者: jamelhammoud5 天前
我和我哥哥一起创建了 Crew,这是一个让我们能够协同工作(与我们的代理一起)来构建事物的平台。 它是完全开源的,可以在你的电脑本地运行,并使用你已安装的代理命令行工具。 欢迎大家来试用,我们在开发它的过程中非常享受!
2作者: john_builds6 天前
当我的某篇文字获得异常多的关注时,我总能事后给出解释。比如:引人入胜的开头、恰当的时机、合适的格式、有趣的话题,或是读者正好心情不错。但对于那些无人问津的文章,我也能找出原因,这让我怀疑我只是在对“噪音”进行模式匹配。 对于那些经常在任何平台发帖的人:你们认为自己知道导致“异常值”(即特别受欢迎或特别不受欢迎的内容)的原因吗?有没有人能够有意识地复制出一次“异常值”的成功经验?