2 分•作者: blef•5 个月前
返回首页
最新
2 分•作者: datacorp•5 个月前
2 分•作者: andsoitis•5 个月前
2 分•作者: hilti•5 个月前
我们一直将数据发送到云端进行分析,但现代Mac电脑的性能足以在几毫秒内本地查询数百万行数据,即使是8GB内存的MacBook Neo也不在话下。
我开发ColumnLens是因为我不想再为了执行GROUP BY操作而将敏感数据上传到SaaS工具。它是一个原生C++桌面应用程序,可以在大约3秒内打开5GB以上的CSV、JSONL、Parquet和Excel文件,然后让你使用DuckDB的完整SQL引擎进行查询——JOIN、CTEs、窗口函数,所有操作都在你的机器上运行。
这个想法很简单:你的笔记本电脑就是一个非常棒的分析工作站。你不需要云端管道也能查看你的数据。
在构建它的过程中,我学到了一些东西:
* DuckDB的列式引擎非常高效。1200万行数据,查询时间不到一秒,内存占用不到1GB。而且,这些性能是在一个可以装进背包的硬件上实现的。
* ImGui + OpenGL是构建数据密集型桌面应用程序的绝佳组合。没有DOM,没有布局引擎的开销——只有原始的GPU渲染。数据网格可以滚动1200万行数据,而不会掉帧。
* 我添加了一个“3D城市视图”,将行映射到建筑物(高度=一列,颜色=另一列)。听起来有点花哨,但异常值和聚类在表格或图表中是无法立即看到的。我们的大脑擅长在天际线中发现高耸的建筑物。
* Lua脚本比预期的更有用。人们编写小脚本来从API获取数据、运行查询和配置图表——无需离开应用程序即可进行可重复的分析。
* 所有操作都在本地运行。零遥测,零网络调用。二进制文件只有33MB,静态链接。
免费下载地址:<a href="https://columnlens.com" rel="nofollow">https://columnlens.com</a>
很想听听其他正在构建本地优先数据工具的人的意见——我认为“将所有内容发送到云端”的时代正在开始转变。
2 分•作者: SeanLang•5 个月前
4 分•作者: zof3•5 个月前
其他几家知名模型提供商一直在稳步推出新产品;xAI 怎么了?他们的模型虽然算不上是“最好”的,但现在却被远远甩在后面了。<p>有人在这里实际使用 Grok 模型吗?<p>SpaceX 的合并刚刚完成,这是否是他们过去 5 个月没有发布任何东西的原因之一?
11 分•作者: ibobev•5 个月前
71 分•作者: ndr42•5 个月前
<a href="https://www.ft.com/content/7cab4ec7-4712-4137-b602-119a44f771de" rel="nofollow">https://www.ft.com/content/7cab4ec7-4712-4137-b602-119a44f77...</a> (<a href="https://archive.ph/wXvF3" rel="nofollow">https://archive.ph/wXvF3</a>)<p><a href="https://twitter.com/lukolejnik/status/2031257644724342957" rel="nofollow">https://twitter.com/lukolejnik/status/2031257644724342957</a> (<a href="https://xcancel.com/lukolejnik/status/2031257644724342957" rel="nofollow">https://xcancel.com/lukolejnik/status/2031257644724342957</a>)
9 分•作者: inputmice•5 个月前
30 分•作者: akyuu•5 个月前
6 分•作者: dnhkng•5 个月前
5 分•作者: garymiklos•5 个月前
8 分•作者: dougdonohoe•5 个月前
我一直对照片分享网站感到很沮丧。苹果的 iCloud 共享相册加载需要 20 多秒,而其他网站要么有广告,要么用户界面繁琐,或者充斥着社交媒体的干扰。我只想快速、方便地在手机上与朋友和家人分享照片,而且没有干扰。<p>所以我创建了 DD Photos。你可以从你已经使用的任何软件(Lightroom、苹果照片等)中导出照片到文件夹,运行 `photogen`(一个 Go 命令行工具)将它们调整为 WebP 格式并生成 JSON 索引,然后将 SvelteKit 静态站点部署到任何可以提供文件的位置。Apache、S3,随便什么都行。没有服务器端代码,也没有数据库。<p>这个项目花了几个星期的时间完成,大量使用了 Claude Code,我发现它对这种跨越 Go、SvelteKit/TypeScript、Apache 配置、Docker 和 Playwright 测试的全栈项目非常有用。也很乐意讨论那段经历。<p>在线示例:<a href="https://photos.donohoe.info" rel="nofollow">https://photos.donohoe.info</a>
代码库:<a href="https://github.com/dougdonohoe/ddphotos" rel="nofollow">https://github.com/dougdonohoe/ddphotos</a>
7 分•作者: asabil•5 个月前
Hi HN,
我想分享一下我过去几个月一直在做的事情:一个用于嵌入式 Linux 系统的固件分析器,它完全在浏览器中运行,有助于发现安全问题。
这还是一个非常早期的 Alpha 版本。它可能还不够完善。但我认为它已经提供了相当多的价值。
所以,请上传一个固件(目前仅支持 .tar 格式的 rootfs 压缩包)并尝试破坏它吧 :)
18 分•作者: sohkamyung•5 个月前
8 分•作者: ethan_zhao•5 个月前
我运营着 3mins.news (https://3mins.news),这是一个完全基于 Cloudflare Workers 构建的 AI 新闻聚合器。后端有 10 多个 cron 触发器,每隔几分钟运行一次——RSS 获取、文章聚类、LLM 调用、电子邮件发送。
问题在于:Workers 付费计划有严格的月度限制(1000 万次请求、100 万次 KV 写入、100 万次队列操作等)。它没有内置的“达到限制时暂停”功能——CF 会直接开始收取超额费用。KV 写入的费用是超过上限后每百万次 5 美元,因此重试循环的 bug 可能会迅速变得昂贵。
AWS 有预算警报,但这些都是被动通知——等你读到电子邮件时,损害已经造成了。我想要主动的、应用级别的自我保护。
所以我构建了一个面向内部的断路器——它不是为了防止下游故障(Hystrix 模式),而是监控我自己的资源消耗,并在达到上限之前优雅地降级。
关键设计决策:
* **按资源设置阈值:** Workers 请求(超额费用为每百万次 0.30 美元)仅在达到 80% 时发出警告。KV 写入(超额费用为每百万次 5 美元)可以在达到 90% 时触发断路器。并非所有资源都同样危险,因此有些配置为仅警告(trip=null)。
* **滞后效应:** 在 90% 时触发,在 85% 时恢复。这 5% 的差距可以防止振荡——如果没有它,系统会在每次检查周期都在触发和恢复之间来回切换。
* **监控失败时的安全措施:** 如果 CF 使用情况 API 宕机,则保持最后已知状态,而不是假设“一切正常”。监控中断不应掩盖使用量激增。
* **警报去重:** 按资源、按月。如果没有它,一旦某个资源达到 80%,你会在本月剩余时间内收到大约 8,600 封相同的电子邮件。
实现方式:每 5 分钟,并行查询 CF 的 GraphQL API(请求、CPU、KV、队列)+ 可观察性遥测 API(日志/跟踪),评估 8 个资源维度,将状态缓存到 KV。在检查之间,它是一个简单的 KV 读取——基本上是免费的。
当断路器触发时,所有计划任务都会被跳过。cron 触发器仍然会启动(你无法阻止它),但它做的第一件事是检查断路器,如果已触发则退出。
它已经在生产环境中运行了两周。在本月初捕获了 KV 读取量在 82% 时的峰值——收到一封警告邮件,进行了调查,修复了根本原因,从未达到触发阈值。
该模式应适用于任何按量计费的无服务器平台(Lambda、Vercel、Supabase)或任何有预算上限的 API(OpenAI、Twilio)。核心思想是:将你自己的资源预算视为一个健康信号,就像你对待下游服务的错误率一样。
如果大家有兴趣,我很乐意分享代码细节。
完整的实现代码和测试文章:https://yingjiezhao.com/en/articles/Usage-Circuit-Breaker-for-Cloudflare-Workers
1 分•作者: dash2•5 个月前
1 分•作者: mazilin•5 个月前
1 分•作者: bookofjoe•5 个月前
1 分•作者: bilsbie•5 个月前