1 分•作者: jiangzhuo•6 个月前
大家好,我是Sokuji的开发者,我开发了一款开源的实时语音翻译应用,它既是一个Electron桌面应用,也是一个Chrome/Edge浏览器扩展程序。
最新版本(v0.15)增加了本地推理模式——完全在设备上进行ASR(自动语音识别)、翻译和TTS(文本转语音),使用WASM和WebGPU。无需API密钥,无需联网,数据也不会离开你的设备。它包含:
* 48个ASR模型,涵盖99种以上语言(sherpa-onnx WASM + Whisper WebGPU)
* 55+翻译语言对(Opus-MT)以及多语言LLM(Qwen 2.5/3/3.5),通过WebGPU实现
* 136个TTS模型,涵盖53种语言(Piper、Coqui、Mimic3、Matcha)
对于那些喜欢云服务提供商的用户,它也支持OpenAI实时API、Google Gemini Live、Palabra.ai、火山引擎ST、豆包AST 2.0以及任何兼容OpenAI的端点。
浏览器扩展程序与Google Meet、Teams、Zoom、Discord、Slack等集成——它可以捕获参与者的音频,并通过虚拟麦克风注入翻译后的语音。
技术栈:React + Zustand + Vite,Electron Forge,sherpa-onnx编译为WASM,HuggingFace Transformers.js用于WebGPU推理。模型按需下载并缓存在IndexedDB中。
我开发这个应用是因为现有的翻译工具要么需要昂贵的API密钥,要么将你的音频发送到云端,或者不支持足够的语言。本地推理模式使其适用于对隐私敏感的用例以及没有可靠互联网连接的人。
AGPL-3.0许可。可在Windows、macOS、Linux、Chrome Web Store和Edge插件商店中使用。
GitHub:[https://github.com/kizuna-ai-lab/sokuji](https://github.com/kizuna-ai-lab/sokuji)
官方网站:[https://sokuji.kizuna.ai](https://sokuji.kizuna.ai)