3 分•作者: killiandunne1•大约 2 个月前
如果能够衡量幽默感,会怎么样? 我们利用一个包含约 5 万条人类评分的数据集训练了一个模型,用于检测人们认为最有趣的笑话。 我们知道幽默感包含一部分客观成分,一部分主观成分。 目前主观成分超出了我们的能力范围,哈哈。 主要结果:Fable 5 最有趣——在 67% 的情况下优于平均模型,而 GPT 4o 以 17% 的得分垫底。 其他发现: - 模型从不拒绝尝试,即使是带有“黑暗”提示的内容。 - 思考时间更长会带来轻微的好处。 - 荒谬程度与笑话质量呈负相关。 一些方法论说明: - 我们将我们的模型与人类多数意见进行了基准测试,在盲测样本中,模型有 72% 的时间与人类意见一致。 - 我们有 51 名美国成年人对笑话进行评分,他们对模型一无所知,笑话顺序随机,并通过注意力检查和速度检查来保证质量。 - 如果想自己评分,请访问 <a href="https://pair.laugh.so" rel="nofollow">https://pair.laugh.so</a>。 完整的基准测试在此: <a href="https://laugh.so/benchmark" rel="nofollow">https://laugh.so/benchmark</a> 如果您希望看到更多研究,请提出您的需求!谢谢。