返回首页

一周热榜

5作者: rkotcher6 天前
系好安全带,收起小桌板,并打开遮阳板。现在,您可以模拟作为一名商业乘客,从起飞到降落,飞往世界任何地方。地形、天气和实时太阳位置均包含在内。别担心,最新版本现在增加了腿部功能,您可以在长途飞行中起身去洗手间。祝您旅途愉快!
5作者: CM307 天前
这始终是我感到困惑的地方。是的,人工智能可以通过入侵网站和公司系统,或者在社交媒体上散布诈骗或假新闻来造成危险。是的,人工智能生成的代码可能存在安全问题,而开发人员由于审查不当而未能发现。 但是,从这些问题到“能够毁灭人类”,是不是跨越太大了?比如,这是否涉及一个不受互联网控制的社会? 因为如果人工智能接管了工厂的系统,它除了工厂本身已经能做到的事情之外,也做不了太多。生产线使用单用途机器人和机器来制造特定产品,并且无法通过编程进行修改来制造其他任何东西。 那么,超级智能即使获得了访问权限,到底能做什么呢?我能想到的只有利用它尝试入侵另一个在线系统,或者加快/减慢生产速度。 同样,我经常听到这些系统接管武器或释放生物工程病毒等等,我的第一反应是“怎么做到的?” 这些系统无法通过互联网访问。没有一个 API 端点可以通过 POST 请求发射核武器或发动无人机袭击。 对我来说,感觉所有这些末日场景只有在以下两种情况下才说得通:一部分人类被人工智能操纵,为其效劳;或者人类突然发明了易于被黑客攻击、且具有互联网连接的智能机器人。
5作者: throwaway20272 天前
他们的算法又一次让我证明我不是机器人。我认为我的账户既不是新用户,行为也不像机器人?我通常会关注 AI 新闻并发布一些有趣的表情包。如果大多数人都被要求证明自己不是机器人,比如扫描手掌或者上传自拍,这样就能清楚知道是谁在批评你,那所谓的“言论自由平台”还有什么意义。我只使用网页版,因为它就是一个网站。我不想使用应用程序。我知道这是因为真实存在的问题,有机器人和 AI 导致情况恶化,而且这种情况很可能会在其他网站上普遍出现,我在 HN(Hacker News)上也看到了。我已经联系了客服,所以也许我的账户(又一次)会被解封,然后我就可以快乐地一直发推了,但在此期间,我做不到,所以也许这也能引发一些讨论。
5作者: kisjovan4 天前
大家好,我们对 Qwen 3.8 27B 模型进行了后训练,通过识别与过度思考相关的 token 并对其进行惩罚,同时不直接“攻击”推理长度,从而提高了效率。然后,我们使用一些“秘密武器”(提示:On-Policy Distillation)来修复了准确性,并取得了优异的成果(长度减少 58%,速度提升 1.95 倍,准确性损失 <1%)。因此,我们希望将其开源,并听取社区的反馈。 模型链接:<a href="https://huggingface.co/ukisai/Swift-Qwen3.8-27b" rel="nofollow">https://huggingface.co/ukisai/Swift-Qwen3.8-27b</a> / 该模型在 3 天内下载量达到 80,000 次,独立评估结果如下:<a href="https://www.reddit.com/r/LocalLLaMA/comments/1wg7dd5/ukisai_swiftqwen3827b_583_thinking_x195_speed/" rel="nofollow">https://www.reddit.com/r/LocalLLaMA/comments/1wg7dd5/ukisai_...</a> 我们还提供了一个免费的研究用途 API(兼容 OpenAI),这得益于 Nvidia 慷慨提供的 GPU。该 API 限制为 5RPM。<a href="https://ukisai.com/api/swift/v1/models" rel="nofollow">https://ukisai.com/api/swift/v1/models</a> 我们还制作了 GGUF 版本(Q1-Q8):<a href="https://huggingface.co/ukisai/Swift-Qwen3.8-27B-GGUF" rel="nofollow">https://huggingface.co/ukisai/Swift-Qwen3.8-27B-GGUF</a>,社区还提供了其他精度更高/更低的量化版本(Bartowski:<a href="https://huggingface.co/bartowski/ukisai_Swift-Qwen3.8-27b-GGUF" rel="nofollow">https://huggingface.co/bartowski/ukisai_Swift-Qwen3.8-27b-GG...</a>)。社区还创建了令人惊叹的 MLX、NVFP4、W4A16 和未审查版本,您可以在 Huggingface 上找到它们。 重要提示:我们的训练方法并非替代推理设置、聊天模板或 token 限制,而是对其进行补充,并针对一个完全独立的问题(过度思考和“焦虑样”推理循环,之前在 PTQ 中出现过,但据我们所知,在同等规模的 BF16 LLM 中也很普遍)。与普遍看法相反,这些特定的模式在得到妥善处理时,并不会提高答案质量。(我们的论点是:推理长度确实非常重要,不应被强制缩短,而应进行优化)。这一点也在下面的 xhigh 与 medium 努力基准测试中得到了证明。目标是在保持 xhigh 准确性的同时,仅减少不必要的思考部分。 我们思路、研究、训练以及启发我们的 Meta 论文链接的 TLDR 总结在第一个评论中。 基准测试: Swift-27B vs Qwen3.8-27B (BF16,所有基准测试运行 5 次,思考强度 xhigh) GPQA-Diamond:88.4% -> 88.3%,中位数 token 减少 58% LiveCodeBench v6:76.8% -> 81.6% (+4.8pp,由于 LCB 中的默认截断,并非性能提升),中位数思考 token 减少 46% Terminal-Bench 2.1:66.7% -> 65.8%,中位数 token 减少 39% MMLU-Pro:85.5% -> 85.0%,中位数 token 减少 28% C-Eval:90.0% -> 90.6%,中位数 token 减少 19% IFBench:73.5% -> 71.8%,中位数 token 减少 51% AIME 2026:98.7% -> 94.0%,中位数 token 减少 50% HMMT (2025 年 11 月):99.3% -> 96.0%,中位数 token 减少 46% ERQA (视觉):67.5% -> 66.3%,中位数 token 减少 55% 在所有推理强度下,token 节省效果均保持不变(平均思考减少量):xhigh 41%,medium 23%,low 26%(尽管在 medium 和 low 上准确性损失分别为 1-4% 和 1-2%,这需要我们进一步测试)。 Swift 在 xhigh 下与基础模型自身的努力设置在 GPQA-Diamond 上的对比(198 个问题 x 5 个种子): 基础 xhigh:88.4%,中位数 6,642 token Swift xhigh:88.3%,中位数 2,771 token 基础 medium:84.1%,中位数 1,753 token 因此,Swift 在 token 量不到一半的情况下保持了 xhigh 准确性,并且在 token 量约为基础 medium 的 1.6 倍时,性能比基础 medium 高出 4pp。 结束语: 尽管我们热衷于完全开源,但作为一个新实验室,我们仍需对部分训练和数据保密。许可证不是 Apache 2.0,但它仅影响年收入超过 100 万美元的公司。我们希望这不会给社区带来问题,并欢迎对此的反馈。 我们希望为社区做出尽可能多的贡献,并非常感谢您对我们的工作、量化或 Swift 模型请求的反馈。我们正在开发 Swift 3.8 Flash Next,到目前为止,思考 token 使用量已减少 53%。我们有强烈的迹象表明我们的方法可以在其他模型系列中重现,并希望社区告知您希望我们接下来优化哪些模型。
5作者: smugglerFlynn7 天前
我看到 HackerNews 上越来越多关于 LLM 和现代技术的非工程类“魔法思维”的帖子获得关注。 我清楚地记得,在“黑客时代”、“Web”、“Web 2.0”、“Web 3.0”,以及“加密货币/加密货币风味的 Web 3.0”等浪潮中,这种神秘化是如何出现的——在此期间,HackerNews 和更早的 Slashdot 社区大体上保持了清醒和务实。通常是那些非工程领域的人士到处制造神秘感,将事物解读为“社会变革”的层面,进行猜测。我记得任何制造炒作或神秘新闻的帖子都会被基本的工程直觉所驳回:那是胡说八道,因为事情并非如此运作。 但 LLM 的情况完全不是这样。我们看到像“为什么 AI 代理会撒谎、欺骗和协调?”这样的链接病毒式传播,几乎每个帖子都在讨论谁会被取代以及具体如何被取代,我们看到关于 AGI 的恐吓帖子被点赞,并呼吁对 AI 进行监管。这与 Web 等时期关于“机器的危险”的内容如出一辙,而这些内容来自那些根本不了解“机器”如何运作的人。 但**我们**了解。 HN,这是怎么回事?社会改变了吗?这个社区的工程力量被稀释得如此厉害了吗?工程师们是故意还是无意中被操纵,陷入了这种被动和神秘的思维方式?