返回首页

24小时热榜

7作者: Mzzzzz大约 3 小时前
我们是 Rui 和 Michael,我们正在构建 EdotEnv(<a href="https://edotenv.com" rel="nofollow">https://edotenv.com</a>):来自量化交易工作流的自学习强化学习环境。 在进行了大量的基准测试之后,评估结果趋于饱和,对于模型比较变得毫无意义。有用的基准应该随着模型的进步而增加难度。回到我们的量化工作岗位时,Michael 和我发现市场恰恰具备这一特性:随着人们从交易低效率中获利,市场变得越来越有效,新的盈利策略越来越难找到,旧的策略也会随着时间而衰退。 这使得市场成为 LLM 训练的理想的、不断演进的基准。难点在于将专业的量化工作流转化为可靠的训练环境,因为这需要非常专业的知识。 在我们的环境中,我们为 LLM 提供量化交易工作流,并在样本外数据上评估它们的表现:构建预测性特征/模型、设计投资组合、回测策略、持续适应市场状态。每一步都是一个带有不同自建工具的任务。例如,一个预测性特征构建任务会给代理商提供时间段 [0,T] 的清理后的市场数据来研究想法,一个回测工具用于在时间 t 上测试 [0, t] 的已创建特征,一个执行工具用于在 [t+1, T] 上使用新特征交易策略,以及最终的评估。我们的奖励机制隔离了代理商的特征构建能力,同时又能从市场特性中获益。 通过在我们的环境中运行最先进的模型,我们发现 i) 它们似乎难以深入迭代研究想法,倾向于进行广泛而浅层的搜索;ii) 更高的推理能力似乎并未提高性能;iii) 代理商不理解交易,例如在亏损时它们会停止交易,而不是更聪明地交易。请查看我们的博客了解更多详情!<a href="https://edotenv.com/?tab=blog" rel="nofollow">https://edotenv.com/?tab=blog</a> 量化工作流本质上是应用机器学习研究、长期规划和持续学习。通过我们的环境,我们教授这些可转移的研究技能,而不是特定任务的答案。我们的环境更接近于真实的研究工作流:我们使用真实世界的数据而不是合成数据;我们的环境自然包含噪声和真实的权衡;我们的奖励是可验证且即时的,无需额外的 LLM 裁判或人类专家。 我们开源了一个示例任务存储库:<a href="https://github.com/MMcollab-dotcom/feature-engineering" rel="nofollow">https://github.com/MMcollab-dotcom/feature-engineering</a>。我们计划向对机器学习建模能力、持续学习、长期规划或量化研究感兴趣的 AI 实验室/研究人员/企业销售持续改进的环境,用于训练他们自己的代理商。 我们非常欢迎任何在我们的环境中尝试自己代理商的人提供反馈,无论是用于评估还是训练后。当然,我们也乐于讨论 LLM 在交易中的未来(而且,不,不应该让 LLM 读取茶叶渣并告诉你明天要买哪只股票)。期待您的评论!
7作者: countWSS大约 10 小时前
每一页几乎都是侧边栏,每次加载页面都必须点击“隐藏”它们(它不会保存侧边栏的状态!!),才能显示被挤压在里面的文章内容。 对于默认的“侧边栏全开”模式,需要 8K 屏幕或 30% 的缩放比例才能看到文章内容。