2 分•作者: thunderbong•7 天前
返回首页
一周热榜
2 分•作者: gmays•4 天前
2 分•作者: RobotToaster•4 天前
2 分•作者: fanf2•4 天前
2 分•作者: jamesblonde•4 天前
2 分•作者: robin_reala•7 天前
2 分•作者: Lambda11•4 天前
2 分•作者: Michelangelo11•7 天前
2 分•作者: arcaege•4 天前
前几天我查看了我的 Framework 笔记本上的 iio 设备,结果发现 Framework 12 的铰链角度传感器相当准确!所以我制作了一个 LidAngleSensor (<a href="https://github.com/samhenrigold/LidAngleSensor" rel="nofollow">https://github.com/samhenrigold/LidAngleSensor</a>) 的版本,适用于 Linux 上的 Framework 12,这样你就可以让你的铰链发出嘎吱嘎吱的声音了。
2 分•作者: davidbarker•4 天前
2 分•作者: duxup•4 天前
2 分•作者: thoughtpeddler•6 天前
2 分•作者: ccheshirecat•4 天前
抓取现代网站已成为一大难题。你基本上有两个选择:要么支付 Firecrawl/Browserbase 等昂贵的 API 费用,要么运行大量无头 Chrome 实例,每个页面消耗 1GB 内存,而且仍然会被 Cloudflare 阻止。
我构建 Draco 来解决这个问题。它是一个用 Rust 编写的快速、单二进制的网络爬虫。你将其指向一个 URL,它就会输出完美的 Markdown 或结构化的 JSON,供 LLM 使用。
其秘诀在于,它不会为每个请求都启动一个浏览器。它使用一个分层升级引擎:
第一层(隐形抓取):Draco 使用自定义的 TLS/JA4 指纹,在数据包级别完美模仿真实浏览器的网络签名。事实证明,许多反机器人墙如果你的握手看起来正确,就会让你畅通无阻。在我针对 Cloudflare 和 Target 等网站的基准测试中,Playwright 消耗了约 500MB 内存并超时。Draco 在不到一秒的时间内就绕过了它们,仅消耗了 20MB 内存。
第二层(V8 隔离):如果遇到需要渲染的 React/Next.js SPA,Draco 会在几毫秒内启动一个进程内的 V8 引擎。它会水合 DOM 并拦截页面正在调用的隐藏 JSON API——让你获得原始数据,而无需图形浏览器的开销。
第三层(真实浏览器):如果遇到绝对的障碍,它会无缝回退到检测并驱动你机器上的真实浏览器。
我还构建了所有工具,使其成为托管服务的完整即插即用替代品:
守护进程模式:运行 `draco serve`,你将获得一个具有 Firecrawl 兼容 REST API 的持久 HTTP 服务器。你可以立即替换你的 API 密钥并进行自托管。
内置 MCP 服务器:它原生暴露一个模型上下文协议服务器,因此你可以将其直接插入 Claude Desktop 或你的 AI 代理。
网络搜索:内置并行多引擎网络搜索(无需 Google Search API 密钥)。
交互模式:像开发者工具控制台一样有状态地驱动页面,在导航之间持久化 cookie(主要用于 LLM)。
它完全开源(MIT/Apache-2.0)。我只是想把它提供给任何厌倦了与无头 Chromium 斗争或支付按页抓取费用的人。下载二进制文件,然后给它一个困难的 URL。
请注意,它仍处于开发阶段,因此可能会有一些不常见网站的意外中断,但总的来说它非常强大,可以处理 cf 保护的网站和重度 SPA,而其他所有工具都部分或完全失败,耗时更长或资源更多。(已在 example.com、hackernews、cloudflare、glassdoor、bluff.com、target.com、stake.com 和 thrill.com 上进行测试)
| 排名 | 工具 | 分数 | 通过率 | 平均时间 | 平均内存 |
| ---- | ------------ | ----- | ------ | -------- | -------- |
| #1 | Draco | 769.7 | 8/8 | 3.45 | 216.50 |
| #2 | Obscura | 384.5 | 4/8 | 2.68 | 87.59 |
| #3 | BrowserOxide | 373.4 | 4/8 | 6.42 | 105.95 |
| #4 | Playwright | 342.2 | 4/8 | 1.71 | 535.07 |
| #5 | Bouncy | 196.6 | 2/8 | 0.59 | 19.38 |
仓库:https://github.com/0xchasercat/draco/
2 分•作者: zaikunzhang•6 天前
2 分•作者: embedding-shape•4 天前
2 分•作者: firefoxd•4 天前
2 分•作者: greyface-•6 天前
2 分•作者: autoshiftops•4 天前
2 分•作者: zazuke•4 天前
作者在此。从一个私有的 Obsidian 库(8360 条笔记,300 万字)中发布了约 660 条笔记。大约在 2011 年开始使用 OneNote,2021 年迁移到 Obsidian [1],并使用 Python 脚本导入了所有内容 [2]。
笔记会随着时间累积,我的写作也由此而来。“语义层”笔记始于 2022 年,后来发展成一个四部分的博客系列,再后来成为我书中的一个章节。“物化视图”、“大表”、“dbt”和“OLAP”是分开的笔记,写作时间相隔数年。我直到后来才注意到它们是相同的模式,于是又形成了一个新的章节。
发布:在笔记中添加 `#publish` 标签,然后运行 `make deploy`。使用 Quartz + Hugo,通过 rsync 同步到我自己的服务器 [3]。代码 [4]。基于图谱的语义搜索 [5]。
2 分•作者: jacquesm•4 天前