1作者: osherse6 个月前
我希望能够让 LLM “针对 [主题] 创建一个词云” —— LLM 擅长研究,但在排版方面略逊一筹。<p>所以我构建了一个专门的排版引擎。它在浏览器中运行,并且我还使用 @napi-rs/canvas 将其封装在一个小的 Go/Fiber 服务器中,以将其作为 MCP 服务器和 REST API 暴露出来 —— 这样任何 LLM 工具都可以直接调用它。<p>说明请参见 <a href="https:&#x2F;&#x2F;word-cloud.net&#x2F;ai.html" rel="nofollow">https:&#x2F;&#x2F;word-cloud.net&#x2F;ai.html</a><p>欢迎在 <a href="https:&#x2F;&#x2F;github.com&#x2F;pilotso11&#x2F;word-cloud-net&#x2F;" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;pilotso11&#x2F;word-cloud-net&#x2F;</a> 提出反馈
1作者: eyasu64646 个月前
我开发了一个基于浏览器的工具,使用视觉-语言模型(VLMs)来检测卫星图像中的物体。您可以在地图上绘制一个多边形,并输入文本提示,例如“游泳池”、“油罐”或“公共汽车”。系统会逐个瓦片扫描所选区域,并将检测结果以 GeoJSON 格式投射回地图上。 流程:选择区域和缩放级别,将区域分割成瓦片,使用提示将每个瓦片输入 VLM,将预测的边界框转换为地理坐标(WGS84),然后在地图上渲染结果。 该工具在零样本设置下对清晰的结构表现良好。被遮挡的物体仍然更适合由 YOLO 模型等专业检测器处理。 有一个公开演示,无需登录。我主要关注以下方面的反馈:检测质量、VLMs 和专业检测器之间的性能权衡,以及潜在的实际应用案例。