3 分•作者: Deepender25•2 个月前
返回首页
最新
2 分•作者: armin976•2 个月前
我想分享一个 Noema Overfit 的用例,这是一个目前在 Noema 应用中可用的模型分页系统。需要披露的是,我创立了 Noema,并且是帮助开发该系统的团队成员。
它的工作原理是,非专家权重保留在内存中,而模型的路由专家权重则根据需要从存储中读取。这使得运行那些否则会超出设备可用内存限制的模型成为可能,但代价是首次 token 的时间会增加,生成速度会变慢。
对于一个 699 token 的初始提示,我测量了:
预填充速度:34.4 tokens/秒
预填充时间:20.34 秒
解码速度:3.5 tokens/秒
Overfit 实际运行的照片:https://noemaai.com/overfit/gemma4-iphone
完整的答案生成大约花了六分钟,但答案是正确的。这并非用于交互式、低延迟的聊天。更有趣的用例是允许受限设备在答案质量比响应时间更重要时,运行一个功能强大得多的模型。
同样的分页系统对于内存较小的 MacBook 也很有用,这些 MacBook 通常无法将完整模型保留在统一内存中。
如果您认为此功能有任何价值,请告诉我们!
技术细节:https://noemaai.com/overfit
分页模型:https://huggingface.co/NoemaAI-labs/Noema-Overfit
14 分•作者: cute_boi•2 个月前
- 有大量的验证码,其中很多即使使用真实的 Chrome 浏览器且未安装广告拦截扩展也无法解决。
- 每个网站都要求进行双重身份验证,而且我每次都会被登出。
- 发送到我手机的多重身份验证码似乎无法正常工作。
- 注册新的 Google 账号需要手机号码,而且我还必须安装应用程序来证明我不是机器人。
- 网站要求我转动头部并授予麦克风访问权限。
- 网站阻止复制粘贴,所以你必须手动输入所有内容……
- 银行应用程序即使与安全无关也会强制你更新。
- 每个人都认为你是机器人。
1 分•作者: untiledsource•2 个月前
1 分•作者: stuaxo•2 个月前
1 分•作者: CHB0403085482•2 个月前
3 分•作者: michikawa59•2 个月前
1 分•作者: wglb•2 个月前
1 分•作者: joshbetz•2 个月前
1 分•作者: gmays•2 个月前
2 分•作者: sohamac•2 个月前
1 分•作者: soheilpro•2 个月前
1 分•作者: slymax•2 个月前
2 分•作者: onescales•2 个月前
AI 驱动的操作。您的代理无法单独完成的现实世界任务。
按次付费,使用 x402 - 无需账户、无需登录、无需密钥。
80 分•作者: Austin_Conlon•2 个月前
1 分•作者: georgeven•2 个月前
1 分•作者: dsantbakshsing•2 个月前
1 分•作者: herbertl•2 个月前
1 分•作者: herbertl•2 个月前
2 分•作者: herbertl•2 个月前