2026 年 8 月 10 日,哔哩哔哩 Index 团队正式推出升级版本 IndexTTS‑2.5,作为工业级零样本语音合成开源基础模型,它在前代 IndexTTS‑2 基础上完成全方位迭代。仅需要一小段参考音频样本,无需额外训练微调,就可以复刻说话人音色,同时支持多语种、情感、语速、发音的精细化调控,搭配本地一键整合包,普通用户也能在 Windows、macOS 设备上免费体验高质量语音克隆与语音生成能力。
安装包下载
基于B站最新开源 IndexTTS-2.5,本地免费语音克隆生成一键安装整合包
核心功能:零样本克隆,多维度精细可控
IndexTTS‑2.5 最核心的亮点就是零样本音色克隆,不做模型微调,输入简短参考音频,就能还原目标人物声线,快速完成语音生成工作。
在语言能力上,模型原生覆盖中文、英文、日语、西班牙语、阿拉伯语五大语种,可实现跨语言情感迁移。即使用中文音频作为参考样本,也能保留原本音色与情绪,生成其余语种的语音,解决传统 TTS 跨语言时音色跑偏、情感丢失的痛点。
同时它具备丰富的细粒度调节能力:
- 情感控制:既可直接提取参考音频自带的情感特征,也可通过情感向量精准控制语气强弱,适配开心、愤怒、悲伤、平静等多种情绪;
- 语速调节:依靠
duration_factor参数,支持 0.5‑2.0 倍区间自由调整语速; - 发音校正:支持拼音、CMU 音素、日语假名输入,针对多音字、特殊词汇做精准发音修正;
- 多角色对话生成,适配有声书、广播剧、短视频配音等多角色音频创作场景。
四大技术革新,速度与音质同步跃升
本次版本完成四项关键技术优化,兼顾推理效率、生成音质与多语言适配能力。
第一,语义编解码器压缩,语义编解码器帧率由 50Hz 下降至 25Hz,序列长度直接减半,训练和推理的算力开销显著降低。
第二,声学模型架构升级,S2M 声学模型主干网络从 U‑DiT 更换为 Zipformer,缩减参数量,加快梅尔频谱生成速度。
第三,搭建完整多语言扩展方案,提出边界感知对齐、词元级拼接、指令引导生成三大跨语言建模策略,为多语言情感 TTS 提供成熟设计思路,即便没有目标语种的情感训练数据,依旧可以完成情感迁移。
第四,引入GRPO 分组相对策略优化算法对 T2S 文本转语义模块做后训练优化,有效降低读错字、断句生硬问题,提升发音准确度和语音自然度,弱化机械 AI 感。
实测性能数据,兼顾效果与落地性
根据官方技术报告,IndexTTS‑2.5 在 A10 硬件环境下,推理实时率(RTF)相比上一代提升约2.28 倍。
- 五语言零样本场景词错误率 WER:6.00%
- 平均说话人相似度:73.63
- 跨语言情感迁移 MOS 平均分:4.18/5 分,接近真人配音水准。
硬件门槛降低,普通显卡本地可跑
得益于架构和编解码层面的双重优化,该模型显存门槛大幅下探:
- 最低可在4GB 显存 NVIDIA 显卡运行,社区实测可用;
- 6GB 显存能够获得相对稳定体验;
- 官方推荐8GB 及以上显存 NVIDIA 显卡,实现流畅生成。
开启 BF16 半精度推理,可以进一步减少显存占用、加快生成速度。系统兼容 Windows 与 macOS,依托一键整合包,免去复杂环境配置,普通用户本地就可以免费使用全部能力。
应用场景与价值
IndexTTS‑2.5 完全开源免费,在内容创作领域拥有广阔空间:短视频配音、有声读物录制、广播剧多角色演绎、播客制作、AI 视频本地化翻译配音都可以使用该模型。既可供普通创作者快速产出音频素材,也可供开发者做二次开发、定制部署,推动本地端高质量语音合成落地。
提示:使用语音克隆技术,请务必获取对应人声的授权,严禁未经许可复刻他人声音用于伪造、造谣等违规用途。


评论(0)