1 分•作者: downbad_•3 个月前
返回首页
最新
2 分•作者: selvan•3 个月前
2 分•作者: duprat•3 个月前
标准的 AI 能源讨论将服务器端 LLM 推理与服务器端的 Google 查询进行比较。我认为这忽略了在真实的搜索会话中,移动设备上实际发生的大部分情况。
我建立了一个完整的端到端移动搜索会话的参数模型:4G/5G 无线电能耗、2.5MB 页面的 SoC 渲染成本、后台运行的程序化广告 RTB 竞价,以及双方的网络传输成本。然后,我将其与等效的 LLM 会话进行了比较。
主要发现在 10,000 次蒙特卡洛抽样中:在移动设备上,标准的 LLM 会话平均比传统的、广告支持的网页搜索会话少消耗 5.4 倍的能量。仅程序化广告就占了每次会话设备电池消耗的 41%。
我试图明确说明的注意事项:
* 在固定 Wi-Fi/光纤网络上,优势消失
* 对于推理模型,结果相反
* 参数模型,而非经验性设备测量。Greenspector 已经提出为 v2 运行终端测量
* 适用杰文斯悖论
SSRN 工作论文,未经同行评审。方法论和蒙特卡洛分布在论文中已完全记录。乐于为这些假设辩护。
DOI: 10.2139/ssrn.6287918
1 分•作者: Almured•3 个月前
1 分•作者: zeristor•3 个月前
1 分•作者: zeristor•3 个月前
1 分•作者: -R-•3 个月前
32 分•作者: luu•3 个月前
1 分•作者: nathan84•3 个月前
1 分•作者: AllenCao•3 个月前
1 分•作者: xnhbx•3 个月前
1 分•作者: mectors•3 个月前
1 分•作者: e1ghtSpace•3 个月前
嘿,Hacker News!
我一直想讨论这个话题很久了,我觉得现在我掌握了足够的证据,可以安全地谈论它了。
我一直在尝试将音乐与电影同步播放,并记录其效果。
它们似乎能完美同步,电影就变成了一首歌曲的音乐视频。
我不确定谁观看这些视频是否重要,但我感觉这可能会影响最终的结果。
举个例子,在这里(20:55)就能很明显地看出来:<a href="https://x.com/KyleSerbov/status/2044696810095255732" rel="nofollow">https://x.com/KyleSerbov/status/2044696810095255732</a>
我从未听说过有人真正谈论过这个,所以我很好奇你们对此的看法。
我经常想,电影制作人是否会对我录制的他们的电影感兴趣。
我真的很喜欢这个人在这里(2:22)做的视觉效果:<a href="https://x.com/KyleSerbov/status/2046164265502212137" rel="nofollow">https://x.com/KyleSerbov/status/2046164265502212137</a>
我发现即使音乐倒放也有效。
这里是另一个例子:<a href="https://www.youtube.com/watch?v=w40MXiiXosY" rel="nofollow">https://www.youtube.com/watch?v=w40MXiiXosY</a>
请注意,该视频在澳大利亚、日本、新西兰和英国被地区屏蔽。
1 分•作者: Inziu•3 个月前
1 分•作者: birdculture•3 个月前
1 分•作者: pramodbiligiri•3 个月前
1 分•作者: mysticmode•3 个月前
2 分•作者: luu•3 个月前
3 分•作者: stealthtsdb•3 个月前
我构建了一个仅基于浏览器的工作室,用于设计和编排 MCP 代理系统,用于开发和实验目的。整个技术栈——工具创作、多代理编排、RAG(检索增强生成)、代码执行——都通过 WebAssembly 从单个静态 HTML 文件运行。没有后端。<p>我的赌注是:WASM 是一个坚固的沙盒,而且是免费的。当你使用 LLM 生成工具(或手动编写它们)时,工作室会对源代码进行 AST 验证,进行惰性注册,并在首次调用时 JIT 编译成 Pyodide。SQL 工具在 Web Worker 中的 DuckDB-WASM 中运行。内置的 RAG 使用 Xenova/all-MiniLM-L6-v2,通过 Transformers.js 进行设备端嵌入。任何东西都不会离开浏览器;关闭标签页,整个技术栈就消失了。WASM 边界使得在本地执行 LLM 生成的代码变得安全——没有 Docker,没有每个租户的容器,没有服务器。<p>在工具层之上是一个代理系统,具有 10 种编排策略:<p>- 监督者(路由器 → 1 个专家)
- 专家混合(并行 + 合成器)
- 顺序管道
- 计划与执行(规划器分解,工作者执行)
- 蜂群(同行交接)
- 辩论(参赛者 + 评委)
- 反思(行动者 + 评论者循环)
- 层次(管理者通过 ask_<persona> 工具委派)
- 循环赛(小组 + 主持人)
- Map-Reduce(拆分器 → 并行 → 聚合器)<p>你通过可视化方式构建一个团队:将工具芯片拖到服务图上的角色节点上,选择一个策略,拓扑结构就会重新塑造以匹配。每个角色都会自动注册为 MCP 工具 (ask_<name>),以及一个 agent_chat(query, strategy?) 元工具。一个捆绑的 Node 桥接器通过 stdio 与 Claude Desktop 通信,并通过 WebSocket 与你的标签页通信——你的浏览器就变成了一个 MCP 服务器。<p>当你完成后,导出功能会给你一个真正的 Python MCP 服务器:server.py, agentic.py, tools/*.py, Dockerfile, requirements.txt, .env.example。导出的 agentic.py 是在浏览器中运行的相同编排逻辑的忠实 Python 端口,因此可部署的工件的行为与原型完全相同。<p>还附带:项目包。将整个项目导出为单个 .agentpack.json 文件。通过扫描工具源代码中的 os.environ.get(...) 并交叉引用网络允许列表,自动检测所需的外部服务(OpenAI、GitHub、Stripe、Anthropic、Slack、Notion、Linear 等)。接收者会得到一个导入向导,提示输入凭据。清单是可审查、可共享的,并且从不携带秘密。<p>我对某些事情确实不确定:<p>- 10 种策略可能太多了。我猜大多数用户只需要监督者、专家混合和辩论。欢迎提供关于哪些策略真正发挥作用的数据。
- 浏览器冷启动(首次加载时 Pyodide 预热)对用户体验来说是一个真正的打击,尽管进行了积极的缓存。
- bridge.js 是唯一一个非浏览器部分。一个托管的变体是显而易见的下一步。<p>使用 Pyodide、DuckDB-WASM、Transformers.js、OpenAI Chat Completions(或通过 Transformers 在浏览器中运行的本地 Qwen 1.5 0.5B,用于完全离线模式)构建。一个文件中大约有 5000 行 HTML/CSS/JS。<p><a href="https://www.agentmcp.studio" rel="nofollow">https://www.agentmcp.studio</a><p>我真的很好奇,在你看来,在浏览器标签页中运行这么多 LLM 生成的代码是合理的,还是悄悄地令人恐惧。
1 分•作者: gurjeet•3 个月前