30 分•作者: minusf•大约 1 个月前
返回首页
最新
1 分•作者: deeptishukla22•大约 1 个月前
1 分•作者: todotask2•大约 1 个月前
2 分•作者: doener•大约 1 个月前
1 分•作者: shintoist•大约 1 个月前
2 分•作者: urnicus•大约 1 个月前
2 分•作者: amai•大约 1 个月前
2 分•作者: kyle_mongo•大约 1 个月前
1 分•作者: shadowbip•大约 1 个月前
2 分•作者: Bluestein•大约 1 个月前
1 分•作者: giuliomagnifico•大约 1 个月前
1 分•作者: quysala123•大约 1 个月前
1 分•作者: signa11•大约 1 个月前
1 分•作者: tosh•大约 1 个月前
1 分•作者: Thunder_rumbles•大约 1 个月前
1 分•作者: darvh•大约 1 个月前
马尾辫 vs Signal
基准测试虽然运行起来了,但过程有些混乱。模型表现出了对答案的记忆,这在如今也是意料之中的。
比起技术本身,更令人开心的是成功运行了基准测试 :)。
如果关于基准测试的进行方式或构建方式的介绍有任何问题,请告诉我。
博客文章:darvh.com/posts/when-coding-agents-raced-through-108-bugs/
基准测试:github.com/darvh/bench
Signal:github.com/darvh/signal
2 分•作者: rzk•大约 1 个月前
2 分•作者: zelon88•大约 1 个月前
1 分•作者: car•大约 1 个月前
1 分•作者: artiomyak•大约 1 个月前