1作者: eustoria5 个月前
9作者: supai5 个月前
大家好,我是 Ken,一个 20 岁的斯坦福大学计算机科学系学生。我开发了 Sup AI。 我开始做这个是因为没有哪个 AI 模型是永远正确的,但它们的错误之间并没有很强的相关性。换句话说,模型之间经常会犯独特的错误。所以我并行运行多个模型,并通过根据置信度对片段进行加权来综合输出。输出 token 概率分布的低熵与准确性相关。高熵往往是幻觉开始的地方。 我的父亲 Scott(TRI 的 AI 研究科学家)是我的研究伙伴。他会随时随地给我发论文,我们争论它们是否真的适用,以及哪些修改有意义,然后我就构建和测试东西。熵加权方法源于其中一次对话。 在 Humanity's Last Exam 的评估中,Sup 的得分为 52.15%。在同一评估中,最好的单个模型得分为 44.74%。相对差距具有统计学意义(p < 0.001)。 方法、评估代码、数据和原始结果: - [https://sup.ai/research/hle-white-paper-jan-9-2026](https://sup.ai/research/hle-white-paper-jan-9-2026) - [https://github.com/supaihq/hle](https://github.com/supaihq/hle) 局限性: - 我们评估了 2,500 个 HLE 问题中的 1,369 个(详情请见上述链接) - 并非所有 API 都公开 token logprobs;在它们不公开时,我们使用多种方法来估计置信度 我们尝试提供免费访问,但被滥用得太严重,几乎让我们崩溃。现在可持续的选择是 5 美元的启动信用额度,需要进行信用卡验证(不自动扣款)。如果你不想注册,可以在评论中留下一个提示,我会自己运行它并发布结果。 在 [https://sup.ai](https://sup.ai) 试用。我的父亲 Scott (@scottmu) 也在这个帖子中。很乐意收到直接的反馈,特别是关于它对你真正有用的地方以及它不足的地方。 这是一个简短的演示视频:[https://www.youtube.com/watch?v=DRcns0rRhsg](https://www.youtube.com/watch?v=DRcns0rRhsg)