IndexTTS2 模型指南

了解 IndexTTS2 声音克隆与表现力语音

IndexTTS2 是一个开放语音合成模型,以参考音频克隆和细粒度表现控制见长。先了解它的能力,再用 MuseFable 当前已上线的语音工具制作可交付音频。

IndexTTS2 的独特之处

IndexTTS2 专注于根据文本和参考音频生成可控语音。以下描述的是模型能力,并不代表每项控制现在都已在 MuseFable 中开放。

参考音频声音克隆

使用一段简短的说话人录音作为条件,让生成语音继承参考人物的声音特征。

表现力与情感控制

当所使用的实现支持相关控制时,可通过情感参考、文字描述或情感向量调整表达方式。

节奏与时长控制

调整语速和时间,用于旁白、配音以及需要匹配目标时长的音频片段。

多语言语音

在支持的语言间生成语音,同时尽量保留目标说话人特征和表达方向。

现在就用 MuseFable 制作语音内容

可以使用当前已上线的原生语音模型直接把文本转成配音,也可以运行 Playbook,先把原文改写成适合聆听的脚本再生成音频。

IndexTTS2 常见问题

现在能在 MuseFable 中直接使用 IndexTTS2 吗?

暂时不能。本页面介绍 IndexTTS2,并链接到 MuseFable 当前已上线的语音工具。

IndexTTS2 如何进行声音克隆?

IndexTTS2 可以使用说话人参考音频作为生成条件。声音克隆需要所使用的实现能够接收并安全处理该参考音频。

现在可以用什么工具生成配音?

MuseFable 当前提供 MiniMax Speech 2.8 Turbo 原生文本转语音。完成后的音频可以下载,也可以保存在 MuseFable 项目中。

MuseFable 能把长文章转成音频吗?

可以。文章转播客 Playbook 会先把书面内容改写成自然口语脚本,再生成语音,避免听起来像直接朗读文档。