1 分•作者: msaaa•3 个月前
1 分•作者: owulveryck•3 个月前
我真心认为自主代码生成是未来。 但今天我们面临一个问题:我们无法对大型语言模型(LLM)生成的代码结果足够自信。 问题在于它的工作方式。即使有“让按钮变蓝”这样明确的指令,我们也无法确定按钮一定会是蓝色的(因为上下文可能包含矛盾的信息)。 这个概念验证(POC)基于钩子(hooks),并验证了实现一个确定性的通用测试框架是可行的。 例如,你可以分发一个声明按钮必须是蓝色的技能,并附带一个检查按钮是否为蓝色的策略。这样,系统将应用该策略并检查按钮的颜色。