录了 3 秒声音,它替我把一本小说读完了
我录了 3 秒自己的声音,扔给它一句"把这章小说读出来",它真的用我的声音,把一整章读完了——语气、停顿、换气的地方,都像我自己念的。
这不是科幻片,是复旦系 MOSS 团队 2026 年 4 月开源的一个 0.1B 参数小模型:MOSS-TTS-Nano。不需要显卡,不需要联网,不需要按次付费。4 核 CPU 就能实时跑,MacBook Air 单核也能流畅出声。
声音克隆这行当,过去是"租录音棚"的生意:要么掏钱用云端 API(ElevenLabs 按字符计费),要么搬出 24GB 显存的显卡自己训。而 Nano 干的事,相当于把一台"声音复印机"塞进了普通电脑——你的声音是原稿,任意文本是空白纸,按一下,就出来一份"你的声音"。
谁做的:老熟人了
MOSS-TTS-Nano 出自 OpenMOSS 团队,背后是上海创智学院、复旦大学自然语言处理实验室和模思智能(MOSI.AI)。2023 年那个火遍中文互联网的开源大模型 MOSS,就是他们的作品——连公司名"模思"都是 MOSS 的音译。
团队成员名单里,领衔的是复旦 NLP 实验室的邱锡鹏教授团队,论文作者列表一拉 20 多人,规格是正经学术团队的配置。
凭什么 0.1B 能干这活
先看硬指标:
| 规格 | 数值 |
|---|---|
| 参数量 | 0.1B(1 亿) |
| 语言 | 20 种(中英德西法日俄等) |
| 输出 | 48kHz 双声道 |
| 克隆方式 | 约 3 秒参考音频,零样本 |
| 推理 | 4 核 CPU 实时,无 GPU |
| 许可证 | Apache 2.0(可商用) |
它用的是纯自回归 Audio Tokenizer + LLM 管道:一个约 2000 万参数的音频分词器(MOSS-Audio-Tokenizer-Nano,基于 Cat 架构——无 CNN 的因果 Transformer),把声音切成 token 流,再用一个小 LLM 预测下一个 token。RVQ 16 个码本、12.5Hz 的 token 率,整个模型码率只有 0.125-2 kbps——相当于把"声音"压缩成极小的离散符号流再重建。
这不是什么黑科技,但把体积和效果平衡到这种程度,靠的是真本事。
最狠的一刀:砍掉 PyTorch
4 月中旬,团队又放出一版 ONNX CPU 版:推理阶段完全不依赖 PyTorch,直接跑 ONNX Runtime。实测处理效率约为原版的 2 倍,MacBook Air M4 上单核 CPU 就能流畅运行。还有 GGUF 路径,能随一个 200MB 左右的二进制一起分发。
这意味着什么?你的服务端不用再为推理装一整套 Python 深度学习环境,一个运行时就能把 TTS 嵌进去。对做 IVR、端侧语音、本地朗读工具的人来说,这是从"能跑"到"好部署"的质变。
数据不会说谎
写文章前我拉了一遍 GitHub 实测数据(2026-09-02 核验):
- MOSS-TTS-Nano:⭐4279,fork 546,Apache-2.0,最后提交 2026-08-30
- MOSS-TTS(旗舰):⭐4056,Apache-2.0,最后提交 2026-08-30
- MOSS-TTSD(对话生成):⭐1394,Apache-2.0,最后提交 2026-08-30
星数不算爆炸,但仓库是活的:最近一次提交在 8 月底,发布至今几乎每周都有更新——4 月 10 日发布 Nano,14 日出浏览器 Reader,16 日放微调代码,17 日上 ONNX 版,4 月底就挂出"2.0 需求收集"表单问用户要什么,5 月接入 mlx-audio。这种迭代密度,比很多 2 万星但停更半年的项目靠谱得多。
和开源 TTS 卷王们比一比
开源声音克隆赛道已经卷成麻花了,我把几个主流选手的真实数据摊开:
| 项目 | Stars | 许可证 | 硬件 | 最后提交 |
|---|---|---|---|---|
| coqui-ai/TTS (XTTS) | 45,979 | MPL-2.0 | GPU | 2024-02(停更) |
| ChatTTS | 39,814 | AGPL-3.0 | GPU | 2026-04 |
| fish-speech | 32,501 | 非商用 | 12GB 显存起 | 2026-08 |
| CosyVoice | 23,408 | Apache-2.0 | GPU | 2026-05 |
| F5-TTS | 15,182 | MIT | GPU | 2026-07 |
| Kokoro-82M | 8,649 | Apache-2.0 | CPU | 2025-08 |
| MOSS-TTS-Nano | 4,279 | Apache-2.0 | 4 核 CPU | 2026-08-30 |
几个值得注意的点:
第一,商用许可差距巨大。 fish-speech 的许可证是 CC BY-NC-SA,非商用,想商用得单独谈;ChatTTS 是 AGPL,商用意味着你的代码也得开源。MOSS-TTS-Nano 是 Apache 2.0——个人用、商业产品、闭源集成,全部合法,这是做产品的人最看重的一行字。
第二,"CPU 优先"是稀缺生态位。 同赛道里 Kokoro 也是 82M 的 CPU 模型,但主打英语、约 5-8 种语言、单声道;MOSS-TTS-Nano 用类似体量覆盖 20 种语言、48kHz 立体声、零样本克隆、无 PyTorch 的 ONNX/GGUF 路径。用 Clore.ai 部署文档的话说:Kokoro 占住了西方英语细分市场,Nano 占住的是"CPU 优先的多语言"细分市场。
第三,老牌项目正在掉队。 coqui-ai/TTS 4.6 万星,但最后提交停在 2024 年 2 月——星数高不等于活着。这行迭代太快,半年不更新基本就等于退场。
跑起来要什么配置
这是全文最重要的部分。官方和部署文档的配置要求:
方案一:Nano CPU 版(普通人首选)
| 配置项 | 最低要求 | 推荐配置 |
|---|---|---|
| 处理器 | 4 核 x86/ARM | 8 核 |
| 内存 | 4 GB | 8 GB |
| GPU | 不需要 | 不需要 |
| 硬盘 | 1 GB | 2 GB |
方案二:家族大模型(追求音质上 GPU)
| 配置项 | 要求 |
|---|---|
| GPU | RTX 3060 12GB+ |
| 显存 | 4-8 GB |
| 内存 | 16 GB |
Nano 不是家族的全部——往上还有 1.7B 的 Realtime(180ms 首字节,做实时语音 Agent)和 8B 的 TTSD(多说话人对话、超长播客),用的还是同一个 tokenizer 和 API。从 Nano 起步,业务真跑起来了,换大模型不用重写代码。
代价清醒:三个坑得说清楚
吹完了,说点难听的。
1. 0.1B 的音质上限摆在那。 1 亿参数再能打,也打不过 8B 大模型的细节表现力。Nano 的定位是"实时、轻量、够用",不是"音质天花板"。想要情绪丰富、能哭能笑的效果,得上家族里的大家伙。
2. 20 种语言 ≠ 20 种语言一样好。 多语言覆盖是所有小模型的通病:中文、英文大概率靠谱,小众语言质量要打问号。Fish Audio 自己都承认只有日英中是顶级水平。别拿俄语长文直接上线生产环境,先试听。
3. 克隆质量取决于参考音频,模型只是下限。 移植 XTTS 操作手册的原则:几秒参考音频的清晰度、降噪、发音准确性,直接决定克隆相似度。拿一段嘈杂的录音进去,出来就是"你的声音 60% 相似 + 40% 电流声"。
另外,安装有 pynini/WeTextProcessing 的坑(社区 Issue #6 有解法),建议直接优先用 ONNX 版,少踩 PyTorch 环境的雷。
怎么上手
最省事的路子:打开在线 Demo(openmoss.github.io/MOSS-TTS-Nano-Demo/),浏览器里直接试,支持传自己的录音做克隆。想本地折腾,GitHub 仓库 clone 下来 python infer.py 就能跑,配套的 MOSS-TTS-Nano-Reader 还能当浏览器插件用。国内用户走 ModelScope 魔搭下载权重,速度更快。
最后说句清醒的
声音克隆是柄双刃剑。模型开源、门槛归零,意味着"伪造你的声音"的门槛也归零了——用几秒录音冒充你给家人打电话要钱,这种案子这两年已经不少。所以:别把大段清晰的录音随便发给陌生人;收到"熟人"的语音转账请求,多留个心眼,视频确认一下。
技术本身是中性的。它把一台"声音复印机"放到了每个人桌面上——怎么用,看人。
相关链接:
- GitHub:https://github.com/OpenMOSS/MOSS-TTS-Nano
- 在线 Demo:https://openmoss.github.io/MOSS-TTS-Nano-Demo/
- Hugging Face:https://huggingface.co/spaces/OpenMOSS-Team/MOSS-TTS-Nano
- 模型权重(HF):https://huggingface.co/OpenMOSS-Team/MOSS-TTS-Nano-100M-ONNX
- ModelScope 魔搭:https://modelscope.ai/models/openmoss/MOSS-TTS-Nano
暂无评论。