3作者: us-merul4 天前
我在学习西班牙语课程期间制作了这个应用程序,目的是找到使用我正在学习的动词时态(现在时、过去时、将来时、虚拟式等)的文本。首先,我从网上抓取了约 10,000 首公共领域的西班牙语诗歌。然后,我为 550 多个最常见的动词构建了一个变位词典,使用规则生成规则动词,并从网上抓取不规则动词。仅凭这一点,您就可以确定哪些诗歌包含您试图针对的最多类型的动词。为了更进一步,我使用 Python 中的 k-means 聚类算法,根据动词时态的频率将诗歌分为四个难度级别(例如,包含大量虚拟式将来完成时动词的诗歌比仅包含现在时的诗歌更难)。 我于 2024 年 12 月首次完成了这个项目,几乎完全是手工完成的,主要使用 LLM 来创建一个交互式的 Plotly Dash 应用程序。(我在数据可视化方面拥有丰富的经验,尤其是 ggplot2;这是我第一次使用 LLM 在新领域进行编码。)上周,我花了一个小时使用 Claude,将前端完全更新为 Javascript 和 Plotly.js。 我希望有人能从中受益。这可能是回答诸如“19 世纪哪位哥伦比亚诗人使用将来时动词最多?”之类问题的唯一方法。(当然,这取决于可用的语料库。) 如果我今天从头开始做这个项目,我会使用 LLM 来生成动词形式,而不是像我之前那样创建词典。但我仍然会使诗歌的分析具有确定性。我还会使用 LLM 来评估主题和话题,作为额外的筛选条件。当然,还会扩展到更多语言 :)
1作者: apatheticonion4 天前
我一直在将 DeepSeek v4 flash 用于引导式代理工作流(IDE 内、提示/审查差异),并且在这些工作流中没有发现使用 Haiku、Opus、Sonnet 有任何明显的好处。 每天花费大约一美元,我的生产力就能提高一倍多。那么,前沿模型是什么?它们在解决什么问题? 它们是为一次性应用设计的吗?我们是否期望能够“ YOLO 式”地提示 LLM,让它们在无人监督的情况下完成工作?