1 分•作者: halperter•24 天前
返回首页
最新
2 分•作者: domenkozar•24 天前
4 分•作者: jethronethro•24 天前
1 分•作者: nycdatasci•24 天前
1 分•作者: nlsarcos•24 天前
1 分•作者: E-Reverance•24 天前
401 分•作者: gmays•24 天前
1 分•作者: 1317•24 天前
2 分•作者: arjavmehta•24 天前
在过去的几年里,我一直在使用 Duolingo,并学会了印地语和西班牙语(甚至帮助我获得了州双语能力认证)。
我这一代(Z世代)面临的最大问题之一是孤独感。我喜欢 Duolingo 的社区,但有时(实际上是经常)我感到难以坚持下去。
在线语言学习是一种技能,其动力主要来自于连接,而日常练习则是在孤独中进行的。
没有人学习西班牙语只是为了会说西班牙语。他们学习是为了与伴侣的家人交流,是为了不成为餐桌上的沉默者,是为了搬到一个新地方并开始新的生活。然后,他们却独自与一只猫头鹰相处 90 天。
我一直在思考一种方法,通过共同的热情——学习语言——将全球各地的人们联系起来,并创建一个竞争性的社交空间,让人们可以在快速匹配中竞争,即时获得反馈,并通过教授自己的虚拟形象来学习(而不是被动地“听课式”学习)。他们需要当场、在压力下学习,并被置于不同的情境中,必须在各种荒谬的场景中游刃有余,并以令人满意的方式说出或写出目标语言)。
核心流程是:学习(2-5 分钟互动环节)→ 教学(向你的虚拟形象解释)→ 虚拟形象尝试(你的得分)。
然后,你可以将其用于与水平相近的对手进行排名赛 1v1 对决,类似于 chess.com 的模式:一位盲审评判官根据口语和写作能力对双方玩家进行评分,等级会变动,还有一个包含头衔和奖励的全球排行榜。
目的是通过竞争和内部社区建设来弥合这一差距。除了竞技之外,用户还可以相互交流,并根据他们对语言的共同兴趣创建微型社区。例如,学习西班牙语并对制作食物(如 Carne Asada 或 Gazpacho)感兴趣的用户,可以加入一个(基于他们对语言共同兴趣的)社区。
在技术方面,我发现了一个有趣的混合问题(结果发现它们其实是同一个问题)。
匹配系统需要根据两个评分来预测 A 是否能战胜 B 的概率。
对开放式输出的评分在评分标准下是不可靠的,因此我没有给一个答案打分,而是只问“这两个哪个更好”,即比较判断,并通过 Bradley–Terry 模型恢复评分。
跨 CEFR/JLPT 等级的教学内容难度校准使用的是项目反应理论,通常是 Rasch 模型。
这三者都基于相同的逻辑函数。Elo 是 Bradley–Terry 似然函数上的在线梯度下降;Rasch 模型则是将一方固定为“项目”的 Bradley–Terry 模型。因此,1v1 对决是评判官需要进行的成对比较,评判官的输出是评分更新所消耗的观测值,项目难度则通过拟合得出。评分采用 Glicko-2,因此新玩家具有明确的不确定性(高 RD),并在几次对决后就能收敛,而不是需要三十次。用户将其视为流畅度分数。
两个问题:
人类问题:竞争会让你更想练习,还是只会让你对练习感到焦虑?
如果你曾经将 LLM 作为评判者部署过,并且评分具有实际后果,你是如何检测到系统内部无法看到的漂移的?
如果你认为你可能会从中受益/想要使用它,我整理了一个小型候补名单,其中包含一些未来可能对使用它感兴趣的人(我还在网站上放了一个小型创意写作提示的演示……看看你是否能获得最高准确率!)
感谢您的阅读。
https://thelingo.xyz
3 分•作者: joshka•24 天前
3 分•作者: alphabetatango•24 天前
2 分•作者: thread_id•24 天前
1 分•作者: rabbim750•24 天前
1 分•作者: joshkolo•24 天前
1 分•作者: redman25•24 天前
1 分•作者: mysticmode•24 天前
1 分•作者: benatkin•24 天前
4 分•作者: pampas•24 天前
我被“书呆子狙击”了,进行了一系列评估,以了解模型在玩 Redactle 游戏方面的表现。结果发现,Gemini Flash 在性能和成本方面都独占鳌头。它能在几秒钟内一次性完成所有评估。
1 分•作者: cwwc•24 天前
1 分•作者: royriace•24 天前