1 分•作者: jpattanooga•5 个月前
返回首页
最新
1 分•作者: eustoria•5 个月前
1 分•作者: pjmlp•5 个月前
1 分•作者: eustoria•5 个月前
1 分•作者: simonpure•5 个月前
1 分•作者: Anon84•5 个月前
1 分•作者: brilee•5 个月前
1 分•作者: joshcsimmons•5 个月前
1 分•作者: miguel-attri•5 个月前
2 分•作者: block_dagger•5 个月前
NerdFlair 是一个可配置的 Bash 状态栏,以及用于 Claude Code 的提示音/旋转器包。 同时也包含了光标扩展(仅提示音)。
56 分•作者: Fibonar•5 个月前
9 分•作者: supai•5 个月前
大家好,我是 Ken,一个 20 岁的斯坦福大学计算机科学系学生。我开发了 Sup AI。
我开始做这个是因为没有哪个 AI 模型是永远正确的,但它们的错误之间并没有很强的相关性。换句话说,模型之间经常会犯独特的错误。所以我并行运行多个模型,并通过根据置信度对片段进行加权来综合输出。输出 token 概率分布的低熵与准确性相关。高熵往往是幻觉开始的地方。
我的父亲 Scott(TRI 的 AI 研究科学家)是我的研究伙伴。他会随时随地给我发论文,我们争论它们是否真的适用,以及哪些修改有意义,然后我就构建和测试东西。熵加权方法源于其中一次对话。
在 Humanity's Last Exam 的评估中,Sup 的得分为 52.15%。在同一评估中,最好的单个模型得分为 44.74%。相对差距具有统计学意义(p < 0.001)。
方法、评估代码、数据和原始结果:
- [https://sup.ai/research/hle-white-paper-jan-9-2026](https://sup.ai/research/hle-white-paper-jan-9-2026)
- [https://github.com/supaihq/hle](https://github.com/supaihq/hle)
局限性:
- 我们评估了 2,500 个 HLE 问题中的 1,369 个(详情请见上述链接)
- 并非所有 API 都公开 token logprobs;在它们不公开时,我们使用多种方法来估计置信度
我们尝试提供免费访问,但被滥用得太严重,几乎让我们崩溃。现在可持续的选择是 5 美元的启动信用额度,需要进行信用卡验证(不自动扣款)。如果你不想注册,可以在评论中留下一个提示,我会自己运行它并发布结果。
在 [https://sup.ai](https://sup.ai) 试用。我的父亲 Scott (@scottmu) 也在这个帖子中。很乐意收到直接的反馈,特别是关于它对你真正有用的地方以及它不足的地方。
这是一个简短的演示视频:[https://www.youtube.com/watch?v=DRcns0rRhsg](https://www.youtube.com/watch?v=DRcns0rRhsg)
10 分•作者: thebeardisred•5 个月前
4 分•作者: amaarc•5 个月前
1 分•作者: shamirallibhai•5 个月前
1 分•作者: mmarian•5 个月前
1 分•作者: june-jule•5 个月前
465 个测试,无依赖
1 分•作者: geox•5 个月前
1 分•作者: Dhwanil25•5 个月前
1 分•作者: mitchbob•5 个月前