1 分•作者: mpweiher•6 个月前
返回首页
最新
1 分•作者: eyasu6464•6 个月前
我开发了一个基于浏览器的工具,它使用视觉-语言模型(VLMs)通过自然语言提示来检测卫星图像中的物体。在地图上绘制一个多边形,输入您想要查找的内容(例如,“游泳池”、“油罐”、“太阳能板”),系统就会逐个扫描瓦片,并将边界框作为 GeoJSON 投射回地球。
流程:选择缩放级别 + 提示 → 将地图切片成墨卡托瓦片 → 将每个瓦片 + 提示输入 VLM → 创建边界框 → 投影到 WGS84 坐标 → 在地图上渲染。
演示无需登录。对于清晰的零样本结构效果很好;对于密集/遮挡的物体,窄 YOLO 模型仍然更胜一筹。
1 分•作者: incognitojam•6 个月前
1 分•作者: vijaym2k6•6 个月前
30 分•作者: strogonoff•6 个月前
5 分•作者: todsacerdoti•6 个月前
25 分•作者: Anon84•6 个月前
2 分•作者: duroapp•6 个月前
1 分•作者: cid435•6 个月前
代理的核心能力完全来自于底层的 LLM。因此,代理的未来完全取决于 LLM 的现状。
那么,LLM 目前究竟发展到什么程度了呢?
我认为我们目前正处于 AI 的“手工业”(或自给自足)阶段——工业化的黎明。用一个历史类比:我们刚刚发明了第一批蒸汽机。它们笨重、固定,只能用于从煤矿中抽水。我们离拥有蒸汽火车还差得远呢。
目前,定制代理的构建正在大规模爆发。但如果你仔细观察,它们几乎完全是“自给自足”和孤立的。每个人都在为自己的特定用例构建自己的代理,但很难将其适配或扩展以供更广泛使用。这就像每个家庭都有自己的织布机,自己织布,从不使用别人的。
为什么会这样?这归结于 LLM 目前的局限性。如果我们暂时抛开多模态能力,基于文本的 LLM 基本上有四个核心支柱:
自然语言理解 (NLU)
自然语言生成 (NLG)
工具调用
推理
前三个已经高度成熟和可靠。但第四个——推理——仍然是一个充满幻觉的雷区。
然而,代理开发者最痴迷于什么?推理。为什么?因为它在演示中看起来很酷。这种痴迷正是我们还无法真正“工业化”代理的原因。这也是为什么在实际应用中很难找到真正可靠的通用代理的原因(最近关于 Manus 的炒作和现实检验就是一个教科书式的例子)。
当然,总有一天 LLM 的推理能力可能会超越 99% 的人类。当这一天到来时,我们将最终看到真正强大、通用的代理。但老实说,没有人确切知道这个时间表何时会到来。
我的观点是:如果我今天正在构建一个用于生产的通用代理,我将严格使用 NLU、NLG 和工具调用。我将远离依赖“推理”。
最近和一些朋友关于 AI 的对话让我思考。我的观点似乎引起了他们的共鸣,所以我在这里分享出来,听听大家的想法。
1 分•作者: nagi_builds•6 个月前
1 分•作者: cbrunnkvist•6 个月前
如果你曾经想过对你的花哨的 TUI 进行一些混沌工程测试,看看它在 500 毫秒的抖动下会如何表现,而又不想真的去找一个糟糕的 Wi-Fi 热点,我为你打造了一个工具!
ttylag 将任何命令包裹在一个“塑造”过的 PTY 中。无需复杂的管道操作,也无需 tc 队列规则。它处理 RTT、抖动,在两个方向上都产生延迟,甚至还有一个 --bits-per-byte 标志(如果你喜欢的话)。
它仅在用户空间运行,适用于 macOS,可能也适用于 Linux,无需任何网络命名空间或防火墙规则的干预。
1 分•作者: trawlcli•6 个月前
我编写的每个爬虫都面临着同样的失败模式:它们能运行三个月,然后网站改版,我的 CSS 选择器就悄无声息地返回空字符串。数据仍然完好地存在于页面上——人类可以立即找到它——但爬虫却“瞎了”。
Trawl 通过拆分问题来解决这个问题。你描述你想要的内容:
```
trawl "https://books.toscrape.com" --fields "title, price, rating, in_stock"
```
LLM (Claude) 查看一个样本条目,并推导出完整的提取策略——CSS 选择器、属性映射、类型转换、备用选择器。该策略会被缓存。随后,每个具有相同结构的页面都会使用纯 Go + goquery 进行提取。没有 API 调用,没有代币成本,完全并发。
关键的见解是:LLM 擅长理解 HTML 结构,但你不需要它们来提取 10,000 行数据。使用 AI 进行智能处理,使用 Go 进行吞吐量处理。
当网站改版时,结构指纹会发生变化,缓存会失效,Trawl 会自动重新推导。
你可以预览它确切的推导结果:
```
$ trawl "https://example.com/products" --fields "name, price" --plan
https://example.com/products 的策略
Item 选择器:div.product-card
字段:
name: h2.product-title -> text (string)
price: span.price -> text -> parse_price (float)
置信度:0.95
```
一些需要真正工程努力的事情:
* JS 渲染的 SPA:带有 DOM 稳定性检测的无头浏览器——轮询直到元素计数稳定且骨架加载器解析,滚动以触发延迟加载,自动点击“显示更多”按钮
* 多部分页面:启发式地检测候选数据区域,使用 --query "Market Share" 定位特定部分,通过容器选择器限定提取范围
* 自修复:监控提取健康状况(字段填充百分比),如果低于 70% 则重新推导策略
* Iframes:当 iframe 包含比外部页面更丰富的数据时,自动检测并从中提取
输出格式为 JSON、JSONL、CSV 或 Parquet。管道操作很顺畅:
```
trawl "https://example.com/products" --fields "name, price" --format jsonl | jq 'select(.price > 50)'
```
用 Go 编写。MIT 许可。
1 分•作者: clsia•6 个月前
1 分•作者: taubek•6 个月前
1 分•作者: surrTurr•6 个月前
1 分•作者: SuppieRK•6 个月前
我构建了 ccp,因为我注意到编码助手在终端输出上浪费了多少上下文。<p>它运行真实的命令,裁剪重复的部分,并保持命令行为不变。<p>两个实际工作中的例子:<p>Java/Gradle 任务(Claude Code):5,330,571 -> 90,127 预估 tokens,涉及 88 个命令(节省 98.31%)
跨 4 个代码库的研究任务(Claude Code):944,007 -> 59,195 预估 tokens,涉及 96 个命令(节省 93.73%)
你可以通过安装脚本试用它,运行 ccp init,然后用 ccp gain 检查效果。<p>它并非对每个命令都有效。在这个代码库自身使用 Codex 的情况下,当混合了大量类似 sed 和 openspec 这种依赖直通命令的场景时,整体节省效果会较低。<p>它也通过 ccp init 适用于广泛的助手,包括 Codex、Claude、Cline、Cursor、Gemini、GitHub Copilot、Roo Code、Aider 等。<p>代码库:<a href="https://github.com/SuppieRK/ccp" rel="nofollow">https://github.com/SuppieRK/ccp</a><p>如果你经常使用编码助手,你的工作流程中哪些命令浪费了最多的上下文?
1 分•作者: ashmawy•6 个月前
1 分•作者: jonator•6 个月前
59 分•作者: doener•6 个月前
2 分•作者: OliverGuy•6 个月前
Caliper 旨在自动检测 Python 中 LLM 调用的情况,它通过 monkey patch OpenAI 和 Anthropic SDK(计划添加 LiteLLM,这样你就可以使用任何你想要的提供商),因此对于开发者来说,它几乎是完全不可见的,并且对于基本指标来说,可以在启动时作为一个 init() 函数插入。<p>它还可以收集关于调用的自定义元数据,这可以是任何你想要的键值对,包括请求前和请求后。<p>```python<p>import caliper<p>import anthropic<p>caliper.init(target="s3") # 这是基本可观测性所必需的全部内容,对于基本指标,无需更改 LLM 调用<p>client = anthropic.Anthropic()<p>response = client.messages.create(<p><pre><code> model="claude-sonnet-4-20250514",
messages=[{"role": "user", "content": "What is 2 + 2?"}],
caliper_metadata={"campaign": "q4"}, # 请求前元数据
</code></pre>
)<p>print(response.content[0].text)<p>caliper.annotate(sentiment="positive") # 请求后元数据<p>```<p>你可以使用它来跟踪模型更改的有效性,并根据不同的用户层级进行跟踪。也许你的免费用户不会注意到你使用了更便宜的模型,但你的付费用户会注意到?你如何知道最近的系统提示更改是否有效?你可以在元数据中跟踪提示的版本,并比较不同提示版本之间的请求后评级注释。<p>它有一个开发模式,可以在本地记录日志,也可以将文件发送到 S3。SDK 具有一个后台队列和工作程序,可以分批刷新,批次大小和刷新时间间隔都是可配置的。它导出到 S3 作为批处理的 JSON 文件,可以很容易地集成到大多数数据工程管道中,或者你也可以直接使用 DuckDB 等工具进行查询。<p>PyPi: <a href="https://pypi.org/project/caliper-sdk/" rel="nofollow">https://pypi.org/project/caliper-sdk/</a><p>编辑:格式和 PyPi 链接