44 分•作者: chatmasta•3 个月前
返回首页
最新
1 分•作者: divinecanon•3 个月前
1. 问题:
当前的大型语言模型(LLM)在经过人类反馈强化学习(RLHF)后就处于静态冻结状态。生成器仍在运行,但约束条件(奖励模型逻辑)已失效。我们正试图通过提示词让一个“死物”表现得更聪明。
2. 架构:
我建议将“约束”与“生成器”解耦。引入一个“调制器”(Modulator)——一个微组件,它不生成文本,而是控制运行时状态(KV缓存、注意力预算、上下文窗口)。
3. 假设:
如果约束条件持续存在于运行时状态(+、-、0),那么生成器将停止“记忆”并开始“适应”。这并非为了追求更高的分数,而是为了实现一种不同的推理物理学。
1 分•作者: frou_dh•3 个月前
1 分•作者: shivamthange•3 个月前
1 分•作者: ehsanamel•3 个月前
1 分•作者: softwaredoug•3 个月前
1 分•作者: blakesterz•3 个月前
1 分•作者: YeGoblynQueenne•3 个月前
1 分•作者: ovvyblabla•3 个月前
1 分•作者: tosh•3 个月前
2 分•作者: taubek•3 个月前
1 分•作者: rellem•3 个月前
2 分•作者: ExMachina73•3 个月前
1 分•作者: ayushpawar•3 个月前
1 分•作者: nicosammito•3 个月前
1 分•作者: vntok•3 个月前
1 分•作者: owulveryck•3 个月前
1 分•作者: rtills•3 个月前
通过将 AI 任务输出为 HTML 文件,我的工作流程得到了极大的改善。但随后编辑 HTML 文件以使其达到理想状态却很麻烦。你最终会为了修改一个句子或单词而反复提示 Claude/Codex。
因此,我为 Mac 开发了这个简单的所见即所得编辑器。所有内容都存储在本地。它极大地帮助了我。我很想知道这是否也能解决其他人的痛点!
2 分•作者: MomohNobert•3 个月前
1 分•作者: rbanffy•3 个月前