1 分•作者: GodelNumbering•大约 2 个月前
尽管有许多大型语言模型(LLM)的基准测试,但很少有(甚至没有)利用“harness”进行基准测试。我认为构建一个这样的基准测试将是一个非常好的社区项目。
最终目标:在一个多样化的真实世界任务集[1]上,根据底层模型和推理工作量进行分组,展示“harness”性能的排行榜(多维度)。任何人都可以贡献结果。
任务标准、测量方法、底层框架等可以由一个小组而非个人决定。
如果兴趣足够,我将创建一个Discord服务器。
披露:我是名为Dirac(https://github.com/dirac-run/dirac)的编码代理的维护者,因此我不会影响最终基准测试的外观,以避免任何利益冲突。我只是想让这件事发生。
[1] 多样化的真实世界任务是指贡献者遇到的足够复杂的任务,最好来自开源仓库。