Saymore:完全本地的免费语音输入工具,Qwen3-ASR + 自训 LoRA 润色,零上传

Saymore: Free Local Voice Dictation with Qwen3-ASR and Self-Trained Polish LoRA — Zero Cloud

Tech-Experiment #语音输入#ASR#本地AI#隐私#Windows#开源工具#Qwen3
🇨🇳 中文

大多数语音输入工具都有一个隐含前提:你的声音需要上传到别人的服务器。Typeless 把音频传到 AWS,微信输入法走腾讯云,OpenWispr 也是网络调用。这个前提对很多场景是不可接受的——会议录音、客户通话、医疗口述,或者只是不想让任何公司拿到你的声音。

Saymore 从这个痛点出发:Qwen3-ASR 本地识别,自训 LoRA 本地润色,VAD 本地检测,唤醒词本地跑。录音不出本机。

GitHub: https://github.com/frankzch/Saymore | ⭐ 10 | MIT | Python | v1.1.9


技术栈一览

组件实现规格
ASR 模型Qwen3-ASR 1.7BGGUF IQ4_NL 量化,~1.15 GB
音频编码器mmproj-Qwen3-ASR-1.7BQ8_0 量化,~340 MB
推理引擎llama.cpp(Vulkan 版)GPU 加速或纯 CPU
VADSilero VAD v52 MB ONNX,抗噪,fallback RMS
端点检测依赖sherpa-onnx—
唤醒词本地自研 KWS默认「小咪」,可配置
文本润色自训 LoRA(Qwen3-ASR 基座)四种风格,打包在仓库

这个组合的关键决策是:ASR 基座和润色 LoRA 共用同一个 Qwen3-ASR-1.7B,共用同一个 llama.cpp 进程,不额外开进程,不额外占显存。


为什么用 Qwen3-ASR 而不是 Whisper

主流本地 ASR 方案大多基于 Whisper 系列。Saymore 选 Qwen3-ASR 有两个实际原因:

  1. 中文识别质量:Qwen3-ASR 是面向中文优化的多模态 ASR 模型,中文识别准确率高于同量级 Whisper,特别是口语、方言词和专有名词。

  2. 同一基座做润色:Qwen3-ASR 基于 Qwen3 语言模型架构,可以接 LoRA 做文本生成任务(润色/改写),而 Whisper 只是纯编码器-解码器结构,不支持这样扩展。一套推理引擎两用,是核心效率决策。


文本整理 LoRA:四种风格

LoRA 权重打包在 polish_lora/ 目录里,克隆仓库即用,不需要自己训练。

四种风格靠 system 提示词切换,用的是同一份 adapter:

风格场景效果
轻度整理日常记录保留口语感,修错别字、加标点
深度润色正式内容口语→书面语,改结构
邮件模式工作邮件整理成可直接发出去的邮件格式
00后风格社交内容保留网络语气,适合小红书/朋友圈

这里有一个准确性说明:用户原文里说「说出一封能直接发出去的邮件」——邮件模式确实会改写口述内容成邮件格式,但结果质量取决于你的 GPU 性能和口述清晰度,实际使用中复杂句子仍然需要检查。


安装步骤

前提:Windows 10/11,x64,建议有 4GB+ VRAM 的 GPU(GTX 1650 起步),也可纯 CPU

  1. 进入 GitHub Releases 页面(github.com/frankzch/Saymore/releases),下载最新版 .exe 安装包(v1.1.x 约 248.7 MB)

  2. 双击安装,默认安装到 %LocalAppData%,不需要管理员权限,可选桌面快捷方式和开机自启

  3. 第一次打开时,程序自动下载 ASR 主模型(约 1.5 GB):

    • 自动检测网络,优先 HuggingFace,失败则切 ModelScope
    • 国内用户通常直接走 ModelScope,不需要额外设置网络
  4. 下载完成后自动重启,重启后直接可用

安装包已打包:唤醒词模型 + Silero VAD + LoRA 权重 + llama.cpp 推理引擎。首次下载只有 ASR 主模型是动态获取的。


性能参考

场景GPU(Vulkan)CPU
ASR 转录~0.5 秒~1-2 秒
文本润色(LoRA)~2 秒~5 秒

实测硬件:开发者 README 给出的基准是 GTX 1650 级别 GPU。高端 GPU(RTX 3090/4090)实际更快,低端 CPU(i5/i7 无 GPU)会慢一些但仍可用。


和主流产品对比

SaymoreTypeless微信输入法
价格免费$30/月 或 $144/年免费
字数限制无免费版 8000 词/周无
隐私100% 本地音频上传 AWS云端
中文识别Qwen3-ASR(中文 SOTA)英文强,中文一般好
文本润色本地 LoRA,四风格云端 LLM❌ 仅识别
唤醒词本地 KWS,可自定义仅快捷键长按按钮
平台Windows(macOS/Linux 计划)Windows/macOSWindows/macOS/手机

微信输入法不做润色这个点是用户原文里提到的真实差距:微信输入法只做识别和加标点,不会把「那个,这件事呢我觉得吧……」改写成能发出去的句子。


局限

仅 Windows:目前只有 Windows 10/11 x64 版本,macOS 和 Linux 在计划中但未发布。

10 颗星的早期项目:7 周内 17 个 Release 版本说明迭代快,但 100 来次累计下载量意味着用户基础极小,边角 case 没有被大量真实用户测试到。

中文识别仍有边界:Qwen3-ASR 对标准普通话准确率高,但强方言口音、大量专业术语(医学/法律)场景仍需建立热词词典(v1.1.x 新增了热词切词模型支持)。

润色需要 GPU 才流畅:CPU 模式下润色需要 5 秒,连续口述场景会感觉到延迟。


MIT 开源。10 颗星的早期项目,API 可能随版本变化。录音音频完全本地处理,不上传任何服务器。开源仅供学习参考。


🇬🇧 English

Saymore: Free Local Voice Dictation with Qwen3-ASR Polish LoRA

Most voice input tools share an unstated assumption: your audio goes to someone’s server. Typeless sends audio to AWS, WeChat input uses Tencent Cloud. For meetings, client calls, medical dictation, or just personal privacy, this isn’t acceptable.

Saymore’s premise: Qwen3-ASR recognition locally, self-trained LoRA polishing locally, VAD endpoint detection locally, wake word locally. Audio never leaves your machine.

GitHub: https://github.com/frankzch/Saymore | ⭐ 10 | MIT | Python | v1.1.9


Tech Stack

ASR: Qwen3-ASR 1.7B, GGUF IQ4_NL quantization (~1.15 GB) + audio encoder mmproj (~340 MB)
Inference engine: llama.cpp Vulkan (GPU accelerated or CPU-only)
VAD: Silero VAD v5 (2 MB ONNX), fallback RMS energy threshold
Wake word: local custom KWS, default “小咪”, configurable
Polish LoRA: self-trained on Qwen3-ASR-1.7B base, bundled in polish_lora/, four styles via system prompt switching

Key architectural decision: ASR base model and polish LoRA share the same Qwen3-ASR-1.7B and the same llama.cpp process — no extra process, no extra VRAM allocation.


Why Qwen3-ASR Instead of Whisper

Two practical reasons: (1) Qwen3-ASR is optimized for Chinese, with better accuracy than same-scale Whisper on Mandarin, spoken language, and proper nouns. (2) The Qwen3 architecture supports LoRA fine-tuning for text generation tasks — Whisper’s encoder-decoder structure doesn’t, so you can’t do polishing with the same model.


Four Polish Styles

Light, deep, email, and Gen-Z styles all share a single LoRA adapter, switched by system prompt:

  • Light: preserve spoken tone, fix typos and add punctuation
  • Deep: convert spoken → written, restructure sentences
  • Email: format dictation into a sendable email
  • Gen-Z: keep internet tone for social media posts

The four styles use the same 1.7B model and the same llama.cpp instance — no additional resource cost per style change.


Installation

Windows 10/11, x64. Minimum GTX 1650 (4GB VRAM), or CPU-only.

  1. Download .exe from GitHub Releases (~248.7 MB, v1.1.x)
  2. Install to %LocalAppData% — no admin rights required
  3. First launch auto-downloads ASR model (~1.5 GB): prefers HuggingFace, falls back to ModelScope automatically (China users typically land on ModelScope with no proxy needed)
  4. Auto-restarts after download; ready to use

Performance

TaskGPU (Vulkan)CPU
ASR transcription~0.5s~1-2s
LoRA polish~2s~5s

Comparison

SaymoreTypelessWeChat Input
PriceFree$30/month or $144/yearFree
Word limitNone8K words/week (free tier)None
Privacy100% localAudio → AWSCloud
Chinese ASRQwen3-ASR (SOTA)Good English, weaker ChineseGood
Text polishLocal LoRA, 4 stylesCloud LLM❌ Transcription only
Wake wordLocal KWS, customizableKeyboard shortcut onlyHold button
PlatformWindows (Mac/Linux planned)Windows/macOSCross-platform

Constraints

Windows-only currently. 10-star early-stage project with ~100 cumulative downloads — rapid iteration (17 releases in 7 weeks) but minimal real-world stress testing. CPU polish mode (5s) creates noticeable lag in continuous dictation. Strong accents and dense technical terminology may need custom hotword dictionaries (added in v1.1.x).


MIT. 10 stars, 7-week-old project. Audio processing fully local; no audio ever uploaded. For technical reference only.

💬 评论与讨论

使用 GitHub 账号登录后发表评论

关于本站 · 免责声明

🍄 Mushroom Research Blog 是非营利、免费公开的个人科技观察博客与公众号 XStack18,不接受商业合作、不代表任何企业或机构立场,也不谋求商业利益。我们以个人视角客观中立地记录和分析 AI、Web3 等领域的最新模型发布与技术动态——不止转述新闻标题或二手信息,而是给出有独立思考的深入分析,希望帮更多人获得有价值的一手科技认知。

⚠️ 文中介绍的开源代码与模型,仅供学习交流与技术借鉴。它们大多仍处于早期阶段,有待进一步研究和验证,请勿直接用于工作或生产环境;如需采用,请先自行充分测试,并核实其许可证与安全性。
Open-source code and models featured here are shared for learning and reference only. Most are early-stage and still need further study and verification — please don't use them directly in your work or in production. Test them thoroughly and check their licenses and security first.

  1. 本站文章均为作者基于公开信息的个人研究与观点整理,不代表文中提及的任何公司、产品、模型的官方立场,未与其构成商业关联或合作关系。
  2. 科技行业信息更新极快,我们尽力保证内容准确、及时,但不对完整性、实时性做绝对保证,具体请以相关企业/项目官方公告为准。
  3. 文中引用的第三方商标、产品名称、图片、数据等版权归原权利人所有,我们会尽量注明来源;如你认为存在版权疑问或侵权,请通过下方邮箱联系我们,收到通知后会尽快核实处理(更正、加注来源或删除)。
  4. 文章内容仅为技术科普与个人观点,不构成投资、法律或其他专业建议,据此进行任何决策的后果需自行判断和承担。

📮 侵权 / 勘误 / 合作咨询:[email protected]