1 分•作者: dym•5 个月前
返回首页
最新
2 分•作者: wkauf•5 个月前
1 分•作者: davidw•5 个月前
2 分•作者: whiteboardr•5 个月前
2 分•作者: alwillis•5 个月前
1 分•作者: chilipepperhott•5 个月前
1 分•作者: skysniper•5 个月前
我们构建了一个竞技场,用于比较 AI 模型在真实的智能体任务上的表现——而非聊天或静态基准测试。模型在全新的虚拟机中作为真正的 OpenClaw 子智能体运行,拥有完全的工具访问权限,结果被反馈到两个独立的排行榜:性能和成本效益。
问题在于:聊天机器人竞技场测试的是对话质量。但大多数使用 AI 智能体的人需要它们做更多的事情:浏览网页、管理文件、编写和运行代码、创建完整的应用程序、自动化多步骤工作流程。目前还没有一个基准测试能够(1)测试通用智能体任务,(2)使用用户提交的任务而不是固定的测试集,并且(3)分别对模型的质量和成本效益进行排名。
我们构建了什么:OpenClaw 竞技场允许你提交任何任务,并让 2-5 个模型相互竞争。一个裁判 OpenClaw 智能体(目前使用顶级模型之一:Claude Opus 4.6、GPT-5.4 或 Gemini 3.1 Pro)在全新的虚拟机上运行,为每个模型生成一个子智能体,每个模型独立解决任务,并完全访问终端、浏览器、文件系统和代码执行。
结果被反馈到两个实时排行榜:
* 性能——哪个模型产生最好的结果
* 成本效益——哪个模型以更低的成本提供最好的质量
我们发现了什么(经过 300 多场战斗,15 个模型):
这两个排名完全不同。性能前 3 名:Claude Opus 4.6、GPT-5.4、Claude Sonnet 4.6。成本效益前 3 名:Step 3.5 Flash、Grok 4.1 Fast、MiniMax M2.7。
Claude Opus 4.6 在性能上排名第一,但在成本效益上排名第 14。
Step 3.5 Flash 在成本效益上排名第一,在性能上排名第五。(老实说,我没预料到)
几个模型(GLM-5 Turbo、小米 MiMo v2 Pro、MiniMax M2.7)在性能上优于 Gemini 3.1 Pro。实际上,Gemini 3.1 Pro 在使用技能方面表现很差,我们不得不专门为它优化裁判消息,否则它有时只会读取技能并决定什么都不做...
注意:我们通过抓取人们使用 OpenClaw 的内容(在 X、Reddit 等上),并生成具有类似任务 + 随机选择模型的战斗,来引导前 300 场战斗。
方法:我们仅使用每场战斗中模型的相对排序来计算排名——而不是原始分数。与聊天机器人竞技场相同的原则:来自裁判的绝对分数是嘈杂且校准不佳的(在一场战斗中“7/10”可能在另一场战斗中是“6/10”),但“A 排名高于 B”更一致和可靠。排名使用分组的 Plackett-Luce 模型(不是简单的胜率或 Bradley-Terry),具有 1,000 次重采样的引导置信区间。每个模型条目显示分数 ± CI 和一个排名范围(可能的排名范围)。数据不足的模型被标记为“暂定”。完整的方法和公式:[https://app.uniclaw.ai/arena/leaderboard/methodology?via=hn](https://app.uniclaw.ai/arena/leaderboard/methodology?via=hn)
主要特点:
* 实时双排行榜(性能 + 成本效益),使用 Plackett-Luce 排名
* 跨 11 个类别的动态用户提交任务(没有固定的测试集来过度拟合),我们将添加更多,请告诉我你想添加什么
* 每个基准测试都有一个全新的虚拟机,每个模型一个子智能体
* 用户可选的裁判模型
* 保留并向用户显示完整的对话历史、裁判推理和工作区工件
* 完全透明:你可以自己评估输出,而不仅仅是相信分数
* 开源裁判技能:[https://github.com/unifai-network/skills/tree/main/agent-bench](https://github.com/unifai-network/skills/tree/main/agent-bench)
公共基准测试是免费的(我们承担计算成本)。无需帐户即可浏览排行榜。
* 排行榜:[https://app.uniclaw.ai/arena?via=hn](https://app.uniclaw.ai/arena?via=hn)
* 提交战斗:[https://app.uniclaw.ai/arena/new?via=hn](https://app.uniclaw.ai/arena/new?via=hn)(需要免费帐户)
* 方法:[https://app.uniclaw.ai/arena/leaderboard/methodology?via=hn](https://app.uniclaw.ai/arena/leaderboard/methodology?via=hn)
* 裁判技能来源:[https://github.com/unifai-network/skills/tree/main/agent-bench](https://github.com/unifai-network/skills/tree/main/agent-bench)
我们很乐意收到关于方法和您希望看到的基准测试任务的反馈。
1 分•作者: andrewjneumann•5 个月前
1 分•作者: NubPlayz•5 个月前
一键在 Goodreads 上通过按钮打开 Zlib 或 Anna's Archive 中的书籍。
我开发了一个免费的开源浏览器扩展程序,可以直接在 Goodreads 读书页面上添加按钮。无需手动复制书名和搜索,只需点击你想要的资源来源的徽标即可。
你还可以切换资源来源的开启/关闭状态,例如,如果你只想显示 Z-Lib 和 Anna's Archive 的徽标,而不想显示 Gutenberg 的,完全可以实现。
支持的资源来源:
* Anna's Archive
* Z-Library
* Project Gutenberg
* AudioBookBay (新增!)
支持的网站:
* Goodreads
* StoryGraph
* Hardcover
* Babelio
* Novelupdates
可在以下平台使用:
* Chrome
* Firefox
* Edge
可在 Chrome 和 Firefox 上使用。
也适用于 Firefox 移动端。
使用 Anime.js 实现动画效果。
不收集任何数据,你可以在 GitHub 上的源代码或隐私页面中自行验证。
已更新至 V1.0.8!
它是免费且开源的,
如果你想支持我并喜欢这个扩展程序,请点亮星标并评分。
(你也可以在 GitHub 上赞助我!)
谢谢。
1 分•作者: kayge•5 个月前
1 分•作者: ishqdehlvi•5 个月前
1 分•作者: chmaynard•5 个月前
1 分•作者: skaul•5 个月前
2 分•作者: research2026•5 个月前
您好!您是否愿意参与一项关于人工智能对软件开发影响的研究?我们是纽约大学和伦敦城市大学的研究人员,正在进行一项访谈研究,旨在了解新型人工智能工具如何改变软件开发人员的工作。我们希望与所有级别的开发人员(包括担任领导职务的开发人员)进行交流,他们可以分享他们在日常工作中如何使用(或选择不使用)人工智能的经验和看法。
访谈将持续45到60分钟,通过Zoom进行。参与者将被问及他们的工作流程、人工智能工具的使用情况以及他们的角色如何随着时间的推移而演变。所有回复都将严格保密,仅用于学术研究目的。研究参与者需居住在美国。
如果您有兴趣,请填写这份简短的表格,以便我们与您联系:[https://nyu.qualtrics.com/jfe/form/SV_cHkvoczxgtaLLo2](https://nyu.qualtrics.com/jfe/form/SV_cHkvoczxgtaLLo2)
谢谢!
1 分•作者: ohjeez•5 个月前
1 分•作者: theahura•5 个月前
1 分•作者: AdmiralAsshat•5 个月前
1 分•作者: matt_d•5 个月前
1 分•作者: t-shark•5 个月前
17 分•作者: like-to-code1•5 个月前