1 分•作者: federicoTXTS•11 天前
本地化人工智能的普及至关重要。
我一直在努力突破商用硬件的极限,榨取每一丝额外的性能。我的科学代理人工智能助手帮助我重新分配了每一份计算资源。
我重写了内核,深入研究了 CUDA,直到能够解释整个过程中涉及的每一比特和每一毫秒的计算能力,将 Qwen 30B-A3B 的推理速度从使用 llama.cpp 的 8 token/秒提升到 19 token/秒,我的项目达到了 22.2 token/秒,对于非新颖内容更是达到了 109 token/秒,并将预填充速度提升了 5-9 倍。