1 分•作者: GodelNumbering•大约 2 个月前
尽管有许多大型语言模型(LLM)的基准测试,但很少有(甚至没有)利用“harness”进行基准测试。我认为构建一个这样的基准测试将是一个非常好的社区项目。 最终目标:在一个多样化的真实世界任务集[1]上,根据底层模型和推理工作量进行分组,展示“harness”性能的排行榜(多维度)。任何人都可以贡献结果。 任务标准、测量方法、底层框架等可以由一个小组而非个人决定。 如果兴趣足够,我将创建一个Discord服务器。 披露:我是名为Dirac(https://github.com/dirac-run/dirac)的编码代理的维护者,因此我不会影响最终基准测试的外观,以避免任何利益冲突。我只是想让这件事发生。 [1] 多样化的真实世界任务是指贡献者遇到的足够复杂的任务,最好来自开源仓库。
2 分•作者: alias_12•大约 2 个月前
这是一个旨在供公众打破的实验,所以,请随意以任何您喜欢的方式进行探索。该实验基本上只是一个有限的免费供应量,由公众挖掘。货币的总量在 100 到 10000 之间,比比特币的 2100 万枚上限更严格。一旦免费供应量耗尽,交易就开始了,而我的理论也到此为止,所以经济要么注定会蓬勃发展,要么会硬着陆。祝您实验愉快!