1 分•作者: fraXis•大约 2 个月前
返回首页
最新
1 分•作者: chirau•大约 2 个月前
3 分•作者: killiandunne1•大约 2 个月前
如果能够衡量幽默感,会怎么样?
我们利用一个包含约 5 万条人类评分的数据集训练了一个模型,用于检测人们认为最有趣的笑话。
我们知道幽默感包含一部分客观成分,一部分主观成分。
目前主观成分超出了我们的能力范围,哈哈。
主要结果:Fable 5 最有趣——在 67% 的情况下优于平均模型,而 GPT 4o 以 17% 的得分垫底。
其他发现:
- 模型从不拒绝尝试,即使是带有“黑暗”提示的内容。
- 思考时间更长会带来轻微的好处。
- 荒谬程度与笑话质量呈负相关。
一些方法论说明:
- 我们将我们的模型与人类多数意见进行了基准测试,在盲测样本中,模型有 72% 的时间与人类意见一致。
- 我们有 51 名美国成年人对笑话进行评分,他们对模型一无所知,笑话顺序随机,并通过注意力检查和速度检查来保证质量。
- 如果想自己评分,请访问 <a href="https://pair.laugh.so" rel="nofollow">https://pair.laugh.so</a>。
完整的基准测试在此:
<a href="https://laugh.so/benchmark" rel="nofollow">https://laugh.so/benchmark</a>
如果您希望看到更多研究,请提出您的需求!谢谢。
1 分•作者: birdculture•大约 2 个月前
3 分•作者: petethomas•大约 2 个月前
1 分•作者: gurjeet•大约 2 个月前
1 分•作者: benjiro29•大约 2 个月前
1 分•作者: rzk•大约 2 个月前
3 分•作者: quodeq•大约 2 个月前
1 分•作者: Beaudelaire•大约 2 个月前
1 分•作者: omid2007hope•大约 2 个月前
7 分•作者: mapping365•大约 2 个月前
1 分•作者: 1659447091•大约 2 个月前
1 分•作者: geox•大约 2 个月前
1 分•作者: matv•大约 2 个月前
14 分•作者: petethomas•大约 2 个月前
1 分•作者: Archelaos•大约 2 个月前
1 分•作者: JCKodel•大约 2 个月前
2 分•作者: tony•大约 2 个月前
1 分•作者: karissafho•大约 2 个月前