1作者: ilitirit3 个月前
背景:我是一名程序员,不是数学家,但这个故事让我很感兴趣: <p><a href="https:&#x2F;&#x2F;news.ycombinator.com&#x2F;item?id=47903126">https:&#x2F;&#x2F;news.ycombinator.com&#x2F;item?id=47903126</a></p> 我想知道,如果我只是选择一个随机的未解决问题,然后把它交给大型语言模型,我能走多远。 声明:我根本不知道这个问题指的是什么,更不用说输出是否正确了。我感兴趣的纯粹是测试各种模型的能力、好奇心和娱乐性。 问题:<a href="https:&#x2F;&#x2F;www.erdosproblems.com&#x2F;691" rel="nofollow">https:&#x2F;&#x2F;www.erdosproblems.com&#x2F;691</a> <pre><code> 给定 A\subseteq \mathbb{N},令 M_A=\{ n \geq 1 : a\mid n\textrm{ 对于某个 }a\in A\} 为 A 的倍数集合。 求 A 的一个充要条件,使得 M_A 的密度为 1。 </code></pre> 我的方法: 我使用了 DeepSeek 的专家模式,使用了与链接的 HN 提交中相同的提示。它思考了很长时间,但我在后台做其他事情,所以实际上没有计时。我在大约 60 分钟内按了两次“继续”。输出显示它思考了大约 46 分钟。 一旦它生成了一个证明,我让 Opus 4.7 审查它,然后将审查结果输入 DeepSeek,DeepSeek 进行编辑、更正和完善。这种反复进行的过程一直持续到 Opus 4.7 相当满意为止。在那一点上,我调用了 Gemini 3.1 Pro Preview,它提出了 Opus 遗漏的问题。Opus 承认了反馈,然后我将它的反馈输入 Deepseek 进行最后一轮。本质上,Opus 说 Deepseek 生成的是“D[avenport]-E[rdos] 推论的清晰阐述”,而不是一个新结果。很可能这个结果已经为人所知(Deepseek 在这个阶段不允许使用互联网),甚至可能是错的。 用“简单”的术语来说: <pre><code> 该论证实际上证明了对于每个自然数集合 \( A \) 来说,一个更强的事实: 集合 \( M_A \) 的上密度等于你可以从 \( A \) 的有限子集中获得的最大可能下密度,这也等于 \( M_A \) 的下密度。 当上密度为 1 时,它迫使下密度也为 1,因此自然(普通)密度自动存在并等于 1,不需要任何额外的条件。 证明中唯一非基本的部分是 Davenport–Erdős 定理;其他一切都很简单。 </code></pre> 无论如何,这是我的收获: * 这些新模型似乎出奇地强大,特别是当它们相互配合使用时,即使使用相当简单的提示也是如此 * 我对 Deepseek 印象深刻。我将审查它的编码能力,甚至可能完全从 Anthropic 切换 * 这是一个真正有趣的练习,即使我不知道它是否正确或有用 其他一些观察: * Opus 在审查 Deepseek 的输出方面非常快。字面意思就是几秒钟 * Gemini 很难弄清楚“Erdos 691”指的是什么 * 免费版的 ChatGPT 生成了大部分无用的输出。我没有包括它。 聊天链接如下: <p><a href="https:&#x2F;&#x2F;chat.deepseek.com&#x2F;share&#x2F;hpguvrhcxn226bi3hn" rel="nofollow">https:&#x2F;&#x2F;chat.deepseek.com&#x2F;share&#x2F;hpguvrhcxn226bi3hn</a></p> <p><a href="https:&#x2F;&#x2F;claude.ai&#x2F;share&#x2F;4f3ccad1-d862-4e37-8333-8a1ebd84b38f" rel="nofollow">https:&#x2F;&#x2F;claude.ai&#x2F;share&#x2F;4f3ccad1-d862-4e37-8333-8a1ebd84b38f</a></p> <p><a href="https:&#x2F;&#x2F;aistudio.google.com&#x2F;app&#x2F;prompts?state=%7B%22ids%22:%5B%221cRWKS3ngW_nqfSn3W-Kq_bWlk8FWXmDw%22%5D,%22action%22:%22open%22,%22userId%22:%22100878499144503719961%22,%22resourceKeys%22:%7B%7D%7D&amp;usp=sharing" rel="nofollow">https:&#x2F;&#x2F;aistudio.google.com&#x2F;app&#x2F;prompts?state=%7B%22ids%22:%...</a></p>
1作者: locusofself3 个月前
我有一台配备 24GB 内存的 Macbook Air M3。前几天,我第一次想在本地运行一个 LLM。我运行了 gemma-4-e4b,并向它输入了一些聊天内容。 这让我想起了我第一次使用 ChatGPT 的经历。虽然它显然不如 Opus 4.6 这样的模型强大,但它让我对未来充满了期待。 我知道拥有一个像样的 GPU 的普通人就可以运行相当强大的模型。 我真正的问题是,硬件和软件优化相结合,是否能让我们在真正基础的硬件上运行接近“state of the art”(最先进)的模型? 考虑到在数据中心上花费的巨额资本支出,如果出现类似摩尔定律的现象,或者其他算法突破,让我们能够运行在普通机器上的超级 LLM,会怎么样呢?
2作者: MemTensor3 个月前
内存操作器是一个专为 MemOS 开发的专业语言模型,旨在处理与内存相关的操作。其核心功能包括内存提取、整合和更新。
1作者: Irongirl13 个月前
希望以上解释清楚了,如果还不明白:我正在寻找一种在安卓设备上将网页转换为 PDF 的方法,以便获得更好的阅读/研究体验。如果能通过安卓现有的分享系统发送到 Kindle 就更理想了。 提前感谢,BK
1作者: hopa3 个月前
我(以及许多人)一直在思考“使用 AI 完成哪些任务是最好的”。 我个人一直在使用的框架是,当你满足以下条件时,就应该使用 AI 生成代码: 1. 代码**易于验证** 2. 人类是否理解代码并不重要 我发现最适合 AI 生成的是纯函数级别的代码(易于验证 + 没必要理解实现细节,只要你理解接口即可)。 我尝试过生成整个服务或应用程序,但这通常违反了规则 1 - 验证整个应用程序是否“正确”是**困难的**,因为“正确”的定义并不明确——例如,是否存在内存泄漏,是否安全,是否能够被监控等等。 我很想知道大家对这个话题的看法。使用 AI 完成的任务越大,节省的时间就越多,但也越有可能在生成的代码中存在灾难性的错误。 遵循这些规则的一个副作用是,生产力提升并不大——最多可能只有 20-30%。 我真的很好奇是否有人找到了一个平衡点——在不损失正确性的前提下实现显著的加速。