1 分•作者: samclemens•3 个月前
返回首页
最新
1 分•作者: matt_d•3 个月前
1 分•作者: aaronbrethorst•3 个月前
1 分•作者: johncole•3 个月前
1 分•作者: ilitirit•3 个月前
背景:我是一名程序员,不是数学家,但这个故事让我很感兴趣:
<p><a href="https://news.ycombinator.com/item?id=47903126">https://news.ycombinator.com/item?id=47903126</a></p>
我想知道,如果我只是选择一个随机的未解决问题,然后把它交给大型语言模型,我能走多远。
声明:我根本不知道这个问题指的是什么,更不用说输出是否正确了。我感兴趣的纯粹是测试各种模型的能力、好奇心和娱乐性。
问题:<a href="https://www.erdosproblems.com/691" rel="nofollow">https://www.erdosproblems.com/691</a>
<pre><code> 给定 A\subseteq \mathbb{N},令 M_A=\{ n \geq 1 : a\mid n\textrm{ 对于某个 }a\in A\} 为 A 的倍数集合。
求 A 的一个充要条件,使得 M_A 的密度为 1。
</code></pre>
我的方法:
我使用了 DeepSeek 的专家模式,使用了与链接的 HN 提交中相同的提示。它思考了很长时间,但我在后台做其他事情,所以实际上没有计时。我在大约 60 分钟内按了两次“继续”。输出显示它思考了大约 46 分钟。
一旦它生成了一个证明,我让 Opus 4.7 审查它,然后将审查结果输入 DeepSeek,DeepSeek 进行编辑、更正和完善。这种反复进行的过程一直持续到 Opus 4.7 相当满意为止。在那一点上,我调用了 Gemini 3.1 Pro Preview,它提出了 Opus 遗漏的问题。Opus 承认了反馈,然后我将它的反馈输入 Deepseek 进行最后一轮。本质上,Opus 说 Deepseek 生成的是“D[avenport]-E[rdos] 推论的清晰阐述”,而不是一个新结果。很可能这个结果已经为人所知(Deepseek 在这个阶段不允许使用互联网),甚至可能是错的。
用“简单”的术语来说:
<pre><code> 该论证实际上证明了对于每个自然数集合 \( A \) 来说,一个更强的事实:
集合 \( M_A \) 的上密度等于你可以从 \( A \) 的有限子集中获得的最大可能下密度,这也等于 \( M_A \) 的下密度。
当上密度为 1 时,它迫使下密度也为 1,因此自然(普通)密度自动存在并等于 1,不需要任何额外的条件。
证明中唯一非基本的部分是 Davenport–Erdős 定理;其他一切都很简单。
</code></pre>
无论如何,这是我的收获:
* 这些新模型似乎出奇地强大,特别是当它们相互配合使用时,即使使用相当简单的提示也是如此
* 我对 Deepseek 印象深刻。我将审查它的编码能力,甚至可能完全从 Anthropic 切换
* 这是一个真正有趣的练习,即使我不知道它是否正确或有用
其他一些观察:
* Opus 在审查 Deepseek 的输出方面非常快。字面意思就是几秒钟
* Gemini 很难弄清楚“Erdos 691”指的是什么
* 免费版的 ChatGPT 生成了大部分无用的输出。我没有包括它。
聊天链接如下:
<p><a href="https://chat.deepseek.com/share/hpguvrhcxn226bi3hn" rel="nofollow">https://chat.deepseek.com/share/hpguvrhcxn226bi3hn</a></p>
<p><a href="https://claude.ai/share/4f3ccad1-d862-4e37-8333-8a1ebd84b38f" rel="nofollow">https://claude.ai/share/4f3ccad1-d862-4e37-8333-8a1ebd84b38f</a></p>
<p><a href="https://aistudio.google.com/app/prompts?state=%7B%22ids%22:%5B%221cRWKS3ngW_nqfSn3W-Kq_bWlk8FWXmDw%22%5D,%22action%22:%22open%22,%22userId%22:%22100878499144503719961%22,%22resourceKeys%22:%7B%7D%7D&usp=sharing" rel="nofollow">https://aistudio.google.com/app/prompts?state=%7B%22ids%22:%...</a></p>
4 分•作者: latentframe•3 个月前
1 分•作者: locusofself•3 个月前
我有一台配备 24GB 内存的 Macbook Air M3。前几天,我第一次想在本地运行一个 LLM。我运行了 gemma-4-e4b,并向它输入了一些聊天内容。
这让我想起了我第一次使用 ChatGPT 的经历。虽然它显然不如 Opus 4.6 这样的模型强大,但它让我对未来充满了期待。
我知道拥有一个像样的 GPU 的普通人就可以运行相当强大的模型。
我真正的问题是,硬件和软件优化相结合,是否能让我们在真正基础的硬件上运行接近“state of the art”(最先进)的模型?
考虑到在数据中心上花费的巨额资本支出,如果出现类似摩尔定律的现象,或者其他算法突破,让我们能够运行在普通机器上的超级 LLM,会怎么样呢?
1 分•作者: thunderbong•3 个月前
1 分•作者: freakynit•3 个月前
1 分•作者: ICodeSometimes•3 个月前
2 分•作者: MemTensor•3 个月前
内存操作器是一个专为 MemOS 开发的专业语言模型,旨在处理与内存相关的操作。其核心功能包括内存提取、整合和更新。
2 分•作者: SerCe•3 个月前
2 分•作者: kitchi•3 个月前
1 分•作者: matt_d•3 个月前
1 分•作者: NN88•3 个月前
1 分•作者: Irongirl1•3 个月前
希望以上解释清楚了,如果还不明白:我正在寻找一种在安卓设备上将网页转换为 PDF 的方法,以便获得更好的阅读/研究体验。如果能通过安卓现有的分享系统发送到 Kindle 就更理想了。 提前感谢,BK
5 分•作者: testfoobar•3 个月前
26 分•作者: reconquestio•3 个月前
1 分•作者: tinolyonne•3 个月前
1 分•作者: hopa•3 个月前
我(以及许多人)一直在思考“使用 AI 完成哪些任务是最好的”。
我个人一直在使用的框架是,当你满足以下条件时,就应该使用 AI 生成代码:
1. 代码**易于验证**
2. 人类是否理解代码并不重要
我发现最适合 AI 生成的是纯函数级别的代码(易于验证 + 没必要理解实现细节,只要你理解接口即可)。
我尝试过生成整个服务或应用程序,但这通常违反了规则 1 - 验证整个应用程序是否“正确”是**困难的**,因为“正确”的定义并不明确——例如,是否存在内存泄漏,是否安全,是否能够被监控等等。
我很想知道大家对这个话题的看法。使用 AI 完成的任务越大,节省的时间就越多,但也越有可能在生成的代码中存在灾难性的错误。
遵循这些规则的一个副作用是,生产力提升并不大——最多可能只有 20-30%。
我真的很好奇是否有人找到了一个平衡点——在不损失正确性的前提下实现显著的加速。