2 分•作者: cui•3 个月前
返回首页
最新
1 分•作者: eigenBasis•3 个月前
3 分•作者: Bender•3 个月前
2 分•作者: dmmalam•3 个月前
2 分•作者: cdrnsf•3 个月前
1 分•作者: mrinfinite•3 个月前
3 分•作者: armanluthra_•3 个月前
6 分•作者: arhamislam5766•3 个月前
我每天都使用 Claude Code,并在研究过程中测量了它在处理网页时的成本。例如,一篇普通的维基百科文章原始 HTML(使用 tiktoken 编码)有 68,240 个 token,而耐克官网首页则有 353,000 个 token。
Claude Code 内置的网页抓取功能可以很好地处理简单情况。它能将维基百科总结到大约 950 个 token,并且可以绕过 Indeed 和 Ticketmaster 等网站的 Cloudflare 防护。
但是,(总会有个但是)对于 JavaScript 渲染的页面和一些反爬虫页面,它会返回空。
quotes.toscrape.com/js 会返回“未找到引文”;nike.com 会返回 403 错误。然后你的代理会将原始 HTML 重新放入上下文中,但仍然会失败。(注意:我也遇到过这种情况,在聊天结束时回顾发现它失败了,然后就从训练数据或来自其他来源的陈旧缓存中提取信息。)
因此,我着手构建了一个开源的隐形浏览器(重新编译的 Chromium),它作为 Claude Code、Cursor 和 Claude Desktop 的 MCP 运行。本质上,我需要做的就是添加 MCP,它就能返回清理后的 token,同时还能规避检测:JavaScript 引文页面现在只需要 285 个 token,耐克官网只需要大约 700 个 token,而不是返回 403 错误。
我仍在积极开发一些功能:目前还没有住宅出口节点,也无法绕过 Kasada 式的防护墙。它主要用于代理、QA 和研究。
代码库和可复现的基准测试:https://github.com/tiliondev/fortress/tree/main/mcp
我是作者,欢迎大家提供反馈。
19 分•作者: tagawa•3 个月前
1 分•作者: kokodoko•3 个月前
1 分•作者: gnabgib•3 个月前
1 分•作者: ingve•3 个月前
1 分•作者: kteare•3 个月前
1 分•作者: msephton•3 个月前
1 分•作者: iqbal1980•3 个月前
我需要一个 Numba 的替代品,它支持其他类型的 GPU 和 FPGA。我需要开发和测试方面的帮助,尤其是在 AMD 目标和 FPGA 方面。
谢谢
1 分•作者: mooreds•3 个月前
1 分•作者: kamphey•3 个月前
1 分•作者: techwrath11•3 个月前
1 分•作者: neustradamus•3 个月前
1 分•作者: Brandon99pt•3 个月前