返回首页

一周热榜

2作者: ccheshirecat4 天前
抓取现代网站已成为一大难题。你基本上有两个选择:要么支付 Firecrawl/Browserbase 等昂贵的 API 费用,要么运行大量无头 Chrome 实例,每个页面消耗 1GB 内存,而且仍然会被 Cloudflare 阻止。 我构建 Draco 来解决这个问题。它是一个用 Rust 编写的快速、单二进制的网络爬虫。你将其指向一个 URL,它就会输出完美的 Markdown 或结构化的 JSON,供 LLM 使用。 其秘诀在于,它不会为每个请求都启动一个浏览器。它使用一个分层升级引擎: 第一层(隐形抓取):Draco 使用自定义的 TLS/JA4 指纹,在数据包级别完美模仿真实浏览器的网络签名。事实证明,许多反机器人墙如果你的握手看起来正确,就会让你畅通无阻。在我针对 Cloudflare 和 Target 等网站的基准测试中,Playwright 消耗了约 500MB 内存并超时。Draco 在不到一秒的时间内就绕过了它们,仅消耗了 20MB 内存。 第二层(V8 隔离):如果遇到需要渲染的 React/Next.js SPA,Draco 会在几毫秒内启动一个进程内的 V8 引擎。它会水合 DOM 并拦截页面正在调用的隐藏 JSON API——让你获得原始数据,而无需图形浏览器的开销。 第三层(真实浏览器):如果遇到绝对的障碍,它会无缝回退到检测并驱动你机器上的真实浏览器。 我还构建了所有工具,使其成为托管服务的完整即插即用替代品: 守护进程模式:运行 `draco serve`,你将获得一个具有 Firecrawl 兼容 REST API 的持久 HTTP 服务器。你可以立即替换你的 API 密钥并进行自托管。 内置 MCP 服务器:它原生暴露一个模型上下文协议服务器,因此你可以将其直接插入 Claude Desktop 或你的 AI 代理。 网络搜索:内置并行多引擎网络搜索(无需 Google Search API 密钥)。 交互模式:像开发者工具控制台一样有状态地驱动页面,在导航之间持久化 cookie(主要用于 LLM)。 它完全开源(MIT/Apache-2.0)。我只是想把它提供给任何厌倦了与无头 Chromium 斗争或支付按页抓取费用的人。下载二进制文件,然后给它一个困难的 URL。 请注意,它仍处于开发阶段,因此可能会有一些不常见网站的意外中断,但总的来说它非常强大,可以处理 cf 保护的网站和重度 SPA,而其他所有工具都部分或完全失败,耗时更长或资源更多。(已在 example.com、hackernews、cloudflare、glassdoor、bluff.com、target.com、stake.com 和 thrill.com 上进行测试) | 排名 | 工具 | 分数 | 通过率 | 平均时间 | 平均内存 | | ---- | ------------ | ----- | ------ | -------- | -------- | | #1 | Draco | 769.7 | 8/8 | 3.45 | 216.50 | | #2 | Obscura | 384.5 | 4/8 | 2.68 | 87.59 | | #3 | BrowserOxide | 373.4 | 4/8 | 6.42 | 105.95 | | #4 | Playwright | 342.2 | 4/8 | 1.71 | 535.07 | | #5 | Bouncy | 196.6 | 2/8 | 0.59 | 19.38 | 仓库:https://github.com/0xchasercat/draco/
2作者: zazuke4 天前
作者在此。从一个私有的 Obsidian 库(8360 条笔记,300 万字)中发布了约 660 条笔记。大约在 2011 年开始使用 OneNote,2021 年迁移到 Obsidian [1],并使用 Python 脚本导入了所有内容 [2]。 笔记会随着时间累积,我的写作也由此而来。“语义层”笔记始于 2022 年,后来发展成一个四部分的博客系列,再后来成为我书中的一个章节。“物化视图”、“大表”、“dbt”和“OLAP”是分开的笔记,写作时间相隔数年。我直到后来才注意到它们是相同的模式,于是又形成了一个新的章节。 发布:在笔记中添加 `#publish` 标签,然后运行 `make deploy`。使用 Quartz + Hugo,通过 rsync 同步到我自己的服务器 [3]。代码 [4]。基于图谱的语义搜索 [5]。
2作者: sschueller6 天前
DeepSeek API 服务即将采用峰谷定价策略,高峰时段价格将是常规价格的两倍,适用于所有计费项目。具体生效日期以官方通知为准。 高峰时段(UTC 时间):凌晨 1:00–4:00 和上午 6:00–10:00。 (相当于 UTC+8 时间:上午 9:00–中午 12:00 和下午 2:00–6:00。)
2作者: finbot7 天前
对 FFMpeg 进行了内存安全加固,运行时开销低于 2%,内存开销可忽略不计,从而杜绝了任何形式的远程代码执行(RCE)的可能性。
2作者: mustafak994 天前
我一直在致力于一个名为“blanked”的项目。我感觉目前科技行业的招聘流程非常不透明,你需要经历多轮面试,却不知道具体内容或薪资。我希望创建一个公开的资源列表,让你能够比较不同公司的招聘流程,例如面试轮数、面试类型等。人们也可以匿名投票并分享他们的经历。我希望它能成为招聘流程领域的“levels.fyi”。非常感谢任何反馈,也欢迎任何贡献,这将有助于提高其准确性。目前我只能通过论坛和 Reddit 找到一些信息。该项目还可以让你指出哪些公司完全“幽灵化”(不回复)了你,然后我们可以对它们进行排名。“幽灵化”是求职者在就业市场上普遍面临的一个大问题。
2作者: mark_l_watson6 天前
我刚在不到一周的时间里进行了第三次会话,最后不得不放弃 Claude Code,转而使用另一个模型/订阅来完成任务。 是我运气不好吗? 编辑:现在又能用了。今天我请求进行研究,但一直收到模型不可用的警告(Opus 4.8)。