1 分•作者: Loris_jk•21 天前
各位 HN 的朋友们! 我构建了一个数据管道,可以抓取 600 多家公司的 SEC EDGAR 10-K 和 10-Q 文件,将 XBRL 标签映射到大约 35 个财务概念,并计算增长率、基本面和估值倍数(价格数据来自 yfinance)。 这个项目的初衷是我希望获得干净、非第三方提供的财务数据,以便评估我自己的一个交易观点。我找不到任何(免费)提供此类数据的应用程序,更不用说开源的了。 事实证明,之所以没有数据提供商,是因为 10-K 和 10-Q 的 XBRL 数据非常糟糕(!!!!)。它混乱、不受监管且杂乱无章。这是金融界的狂野西部。 五年前,这样的项目是不可能实现的,至少不可能由少于约 1000 人来完成。这是因为 XBRL 标签的性质。由于它们不受监管,某个 XBRL 标签可能非常适合某家公司,但对另一家公司却毫无用处,只提供部分信息,或者提供完全错误的数据。您必须遍历一家公司发布过的每一份财务报表,搜索所有可能的标签,进行比较,一旦找到一个标签,就需要不断检查,一旦有更多公司被添加到可观测的范围内,该标签是否也为这些新公司生成了有意义的数据。 正如我所说,这是一项难以管理的任务。除了大型语言模型(LLM)。 我主要使用了 Anthropic 的 Claude Fable 5,给它下达了严格的、非回归导向的标签研究任务,让它不断地遍历整个股票代码列表,搜索和比较标签。而且它奏效了。 仅仅手动搜索 3 家公司(AAPL、MSFT、NVDA)的股票代码列表,我就花了大约 3 周的时间来生成错误的数据。现在,这个数据管道可以为 600 多家公司生成正确、清理过的数据(稍后会详细介绍)。 这只是主要问题。还需要解决的显著问题包括: - 公司将所有内容都标记为全年; - 现金流按累计方式申报; - 第四季报从未提交; - 一个季度不总是相同的长度; - 公司更改标签; - 股票拆分(天哪,我讨厌它们); - 公司报告错误(例如多几个零); 还有很多工作要做,用户界面和用户体验……还很粗糙。 非常感谢任何反馈/批评。 感谢您花时间阅读。
2 分•作者: druidcz•21 天前
我创建了一个转换器,可以将 HyperCard 2.x 堆栈转换为独立的 HTML,以便在现代浏览器中运行。我构建它是为了分享我自己在 90 年代初期的堆栈,这些堆栈已经在旧的软盘镜像中沉睡了 30 年。该转换器采用 MIT 许可,我非常欢迎贡献——特别是那些会破坏转换器的堆栈,因为我只用我自己的堆栈进行过测试。如果您手头有旧的 HyperCard 文件,我很想听听它们表现如何。