2 分•作者: yohji1984•3 个月前
我使用 gpt-5.6 sol 在 codex cli 和我自己的 agent harness 上进行了最大推理测试:https://github.com/Tura-AI/tura。我只测试了一个任务,token 效率的差异不像在高模式下那么大:在重写基准测试中,Tura 使用的轮次最多减少了 83.1%,并将 harness 的结果提高了 7 个百分点。在 ultra 模式下,差异约为 50%,并将 harness 的结果仅提高了 1%。 完整报告:https://turaai.net/blog#is-gpt-5-6-sol-max-worth-it 然而,在基于 DeepSWE 等发布的报告的 bug 修复任务中,与成本的增加相比,性能的提升并不那么令人印象深刻。 以下是总结: 构建新项目时使用 Max 模式,调试或添加已定义功能时使用 High 模式。
4 分•作者: ThierryRkt•3 个月前
我推广项目已经一周了,效果非常糟糕。我一直在 X 和 Reddit 上持续发布信息。 我甚至尝试了“寻找连接…”的流行趋势,但到目前为止还没有用户或反馈。 你们是如何应对这种沮丧情绪并保持心理健康的?
1 分•作者: atharvmunde•3 个月前
你好 HN, 在构建 Wolbarg(一个开源的 AI Agent 共享内存 SDK)时,我曾认为 PostgreSQL 会是内存存储的理想选择。 在对 SQLite 在实际 Agent 工作负载下进行基准测试后,我对其结果感到惊讶。对于本地优先和单节点部署,SQLite 的表现远超我的预期,同时保持了更简单的架构。 我撰写了关于基准测试、方法论、权衡以及我仍然认为 PostgreSQL 是更优选择的场景的文章。