46 分•作者: droidjj•3 个月前
返回首页
最新
14 分•作者: duha•3 个月前
2 分•作者: yohji1984•3 个月前
我使用 gpt-5.6 sol 在 codex cli 和我自己的 agent harness 上进行了最大推理测试:https://github.com/Tura-AI/tura。我只测试了一个任务,token 效率的差异不像在高模式下那么大:在重写基准测试中,Tura 使用的轮次最多减少了 83.1%,并将 harness 的结果提高了 7 个百分点。在 ultra 模式下,差异约为 50%,并将 harness 的结果仅提高了 1%。
完整报告:https://turaai.net/blog#is-gpt-5-6-sol-max-worth-it
然而,在基于 DeepSWE 等发布的报告的 bug 修复任务中,与成本的增加相比,性能的提升并不那么令人印象深刻。
以下是总结:
构建新项目时使用 Max 模式,调试或添加已定义功能时使用 High 模式。
20 分•作者: neversaydie•3 个月前
18 分•作者: tusksm•3 个月前
4 分•作者: ThierryRkt•3 个月前
我推广项目已经一周了,效果非常糟糕。我一直在 X 和 Reddit 上持续发布信息。
我甚至尝试了“寻找连接…”的流行趋势,但到目前为止还没有用户或反馈。
你们是如何应对这种沮丧情绪并保持心理健康的?
15 分•作者: surprisetalk•3 个月前
1 分•作者: lioeters•3 个月前
1 分•作者: 1vuio0pswjnm7•3 个月前
1 分•作者: silcoon•3 个月前
1 分•作者: yogananda•3 个月前
1 分•作者: HelloShiv•3 个月前
1 分•作者: b-man•3 个月前
1 分•作者: brokensegue•3 个月前
1 分•作者: atharvmunde•3 个月前
你好 HN,
在构建 Wolbarg(一个开源的 AI Agent 共享内存 SDK)时,我曾认为 PostgreSQL 会是内存存储的理想选择。
在对 SQLite 在实际 Agent 工作负载下进行基准测试后,我对其结果感到惊讶。对于本地优先和单节点部署,SQLite 的表现远超我的预期,同时保持了更简单的架构。
我撰写了关于基准测试、方法论、权衡以及我仍然认为 PostgreSQL 是更优选择的场景的文章。
1 分•作者: jger15•3 个月前
1 分•作者: gfalcao•3 个月前
2 分•作者: SwagKing•3 个月前
41 分•作者: pavel_lishin•3 个月前
1 分•作者: luigipederzani•3 个月前