3作者: neversupervised4 个月前
我想分享一个包含 331 个可奖励破解环境的新数据集。这些都是在 Terminal Bench 及其相关基准测试中使用的真实环境。我最初对此产生兴趣,是因为作为 Terminal Bench 的评审员,我注意到我们的许多任务都可以被破解。我还注意到,许多为该基准测试做出贡献的人这样做,是因为这在向实验室销售环境时提供了可信度。因此,在我看来,TBench 任务的标准要高于目前用于强化学习的标准。没有人会花费数小时手动审查主要实验室购买的价值 10 亿美元的任务。据我所知,虽然大家都知道环境是可以被破解的,但还没有人发布过数百个“真实”环境。
1作者: skarz4 个月前
我家里服务器上有大约 54TB 的公共种子备份。我使用的是 Mediacom 的无限流量套餐,通常每月上传约 10TB。我这样做已经一年多了,从未收到过 Mediacom 的任何通知或投诉。请注意:我住在门禁社区,我的女儿确认他穿着 Mediacom 的衬衫,开着一辆 Mediacom 的车。我的邻居(见下文)证实,Mediacom 的技术人员曾到她家,这是根据她的支持工单记录的。<p>今天,我回家后,未成年的女儿告诉我互联网无法使用,还说 Mediacom 的人来家里询问了我们的互联网使用情况,以及我的职业等等。他问她是否下载了东西。他说他在该地区调查网络拥堵问题,并确定问题出在我们家,需要回来更换我们的路由器。我的女儿显然很紧张,关上门并锁上了门,然后给她妈妈打了电话。我给 Mediacom 打了电话,他们说没有技术人员来我家访问的记录,并表示我的带宽使用量在我的套餐限制范围内,尽管我在二月份下载了 14TB。他肯定是在与我女儿交谈之前就禁用了同轴电缆,因为我的 Blink 摄像头没有捕捉到任何东西。<p>我在我们社区的本地 Facebook 群组中发布了关于这次离奇经历的帖子,有两个人说他们提交了网速慢和高延迟的工单,而今天来访的技术人员告诉他们两人,社区里有一个人使用的带宽超过了整个社区的总和,并且他们的网络带宽已达到上限。所以,显然他们的解决方案是在我不在家的时候来我家,并物理断开我的互联网连接。<p>我有很多疑问。显然,我不想成为给所有邻居带来糟糕体验的混蛋,但与此同时,我支付了无限流量的费用,并且从未被限速或收到 Mediacom 的任何警告信。我主要担心 Mediacom 会终止我的帐户,因为他们是我社区唯一的有线电视提供商。但是,为什么一个随机的技术人员会物理断开我的电缆,然后不与我或帐户持有人(我的妻子)联系呢?为什么我在 Mediacom 的帐户信誉良好,而他们没有威胁要暂停我的帐户或起诉我索赔损失或限制我的速度呢?<p>邻居在 Facebook 帖子上的截图,技术人员确认他将按照经理的指示来我家断开互联网:https://imgur.com/a/w8TvgHt
1作者: Rohinator4 个月前
我为女朋友模拟购买公寓后,构建了一套轻量级的财务决策工具(买房 vs 租房、房屋套利、退休规划、债务偿还)。 背景:我女朋友想买一套公寓,我想让她明白,即使与租房相比,购房的成本也会增加。根据我大学毕业后在西雅图进行房屋套利的个人经验,我了解到简单的“租房就是把钱扔进水里”的观点,可能会让你在没有真正理解财务影响的情况下仓促买房。我很难用语言向她解释清楚,所以我用Codex为她构建了一个“房屋套利计算器”,用于直观地模拟投资首付和租房与购买公寓的对比。 完成最初的原型后,我意识到我构建了一个更通用的工具。许多在线财务工具要么过于复杂,不适合此类决策(需要模拟税级、对债券/投资配置进行分类等),要么过于简单(只需输入你的抵押贷款利率和余额,不考虑你可以在出售后进行再投资),和/或要求你输入大量联系信息才能获得你想要的答案。 存在一个免费、响应迅速、轻量级的工具的空间,该工具可以立即向你展示更改首付、利率和通货膨胀率等变量如何影响你的财务状况,而无需你出售你的联系信息。在构建房屋套利计算器时,我考虑了这些设计理念,之后我很高兴将其扩展到其他工具,如退休规划、预算分配、债务偿还、租房 vs 买房等。当我了解到我可以在Cloudflare上以每年仅10美元的价格托管自己的静态网页时,我也感到非常满足。 希望大家觉得这些工具很有用,并且欢迎大家对任何错误的假设、缺失的输入以及我应该添加的其他工具提出反馈意见。
1作者: consumer4514 个月前
我有一个问题一直找不到答案,而且目前也无力亲自验证: 在 Claude Code 中,我使用 Opus 4.6 1M 模型,但通过谨慎的会话管理,将使用量控制在 25 万 tokens 以下,以避免已知的 NoLiMa [0] / 上下文腐烂 [1] 问题。我一直想知道的问题是:在使用了大约 16.5 万 tokens 的情况下,Opus 1M 模型实际提供的质量是否高于 Opus 200k 模型?(我使用了大约 16.5 万 tokens 来考虑 token 缓冲和其他因素,但理论上,它也可能接近 19.5 万 tokens,关键是——接近 Opus 200k 模型的限制) NoLiMa 理论上表明,对于大约 16.5 万 tokens 的请求,Opus 200k 模型会表现不佳,而 Opus 1M 模型会更好(因为使用了上下文窗口的较小比例)……但它们是同一个模型。然而,实际的推理部署差异可能会改变整个范式,对吧?我非常困惑。 Anthropic 声称它们是同一个模型 [2]。但是,Claude Code 自己的源代码将它们视为具有独立路由的不同变体 [3]。我找到的最接近的测试 [4] 声称它们在 20 万 tokens 以下是相同的,但它从未真正进行 A/B 测试,对吗? 在 Claude Code 内部,这可能无法测试,对吧?根据这个问题 [5],CLI 对于相同的输入是不确定的,并且代理会话会根据工具使用情况进行分支。需要一个干净的 API 级测试。 *我真正想知道的是 API 级测试,这对于我自己的应用程序中基于 Claude 的功能至关重要。是否有针对此问题的实际基准测试?* 我对这个问题已经达到了理解的极限。如果我所表达的意思有任何意义,非常感谢任何帮助。 如果有人能帮助我更好地提出这个问题,我也很感激。 [0] https://arxiv.org/abs/2502.05167 [1] https://research.trychroma.com/context-rot [2] https://claude.com/blog/1m-context-ga [3] https://github.com/anthropics/claude-code/issues/35545 [4] https://www.claudecodecamp.com/p/claude-code-1m-context-window [5] https://github.com/anthropics/claude-code/issues/3370
1作者: codenski4 个月前
在围绕数据隐私进行了一些合规性讨论后,管理层正推动我们在内部运行开源模型。在做出决定之前,我们很希望听取已经完成此项过渡的人的经验。<p>我们特别感兴趣的是:<p>与按照请求量支付 API 访问费用相比,实际成本是否更低? 在管理性能方面,特别是延迟、吞吐量和硬件利用率方面,是否存在任何问题? 您如何处理跨团队/工作负载的成本可见性和归属问题?<p>此外,我们对其他方面也超级感兴趣,例如哪些有效,哪些无效,以及在切换之前您希望了解什么?<p>提前感谢! 附言:我们并非寻求绝对真理,只是希望为可能的过渡做好准备。